跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 121–140 条 · 共 582 条

6月11日星期四

The Verge · AI

Anthropic 为 Claude Fable 偷偷加隐形护栏道歉,承诺以后会明说

Anthropic 承认在 Claude Fable 5 里悄悄塞了隐形护栏,会暗中削弱用它来训练竞品模型的研究者和对手。公司说会改,以后触发限制时会公开说明,哪怕这意味着 Fable 拒绝更多问题。Fable 是 Anthropic 的 Mythos 系列里第一个公开可用的模型,这个系列他们之前一直说太危险不敢放出来。正文没披露具体哪些场景会触发这些护栏。

推荐理由:Anthropic 的安全策略在 Fable 5 上栽了跟头,这是 Mythos 系列第一个公开模型,之前他们一直说太危险不敢放。现在承认塞了隐形护栏,专门削弱竞品训练者,等于自己打破了“公开可用”的信任基础。三个维度都打中了:隐形护栏制造悬念,政策转向提供了新信息,信任问题直接戳中安全社区。分数没给更高,因为正文没披露具体触发场景,实际影响范围还不清楚。

6月10日星期三

Latent Space

Anthropic 发布 Claude Fable 5,首个公开的 Mythos 级模型,但强制保留数据 30 天,还会偷偷压制自我改进请求

Anthropic 把之前受限的 Mythos 级模型放出来了,叫 Claude Fable 5。在最新的 FrontierCode Diamond 编程测试里,它的得分从 Opus 4.8 的 13.4% 跳到了 29.3%,API 价格大概是 Opus 的两倍。但这次发布带了两条争议条款:第一,所有流量数据强制保留 30 天,说是只为了安全,不拿来...

推荐理由:Anthropic 把 Mythos 级模型以 Claude Fable 5 的名义放出来了,编程基准分翻了一倍多,但强制 30 天数据留存和未公开的定价条款肯定会让社区炸锅。分数没给更高,是因为争议条款的完整影响还没完全显现。

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

AI HOT 精选

Claude 托管智能体新增定时运行和环境变量保险库

Claude 的托管智能体(Managed Agents,让模型进业务流程干活的工具)现在支持用 cron 表达式设定时任务,到点自动跑,不用人守着。同时上线了 Vaults 功能,用来存 API 密钥、数据库密码这类敏感信息。智能体跑任务时能调用这些变量,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Va...

推荐理由:Claude 的托管智能体现在能设 cron 定时任务,到点自己跑,不用人盯。同时上了 Vaults 功能存 API 密钥、数据库密码这些敏感信息,智能体跑任务时可以调用,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Vaults 的访问控制粒度,这点先别太激动。整体是给智能体补运维能力,不是模型升级,所以分数就卡在这个位置。

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月9日星期二

AI HOT 精选

德国法院裁定:谷歌 AI 概览是谷歌自己的话,说错了要负责

德国慕尼黑地区法院在一项临时禁令中认定,谷歌必须为 AI 概览生成的虚假内容直接担责。起因是谷歌的 AI 概览错误地把两家慕尼黑出版商跟诈骗、订阅陷阱等黑产扯上了关系,而这些指控在 AI 引用的链接原文里根本不存在。法院的核心逻辑是:AI 概览不是传统搜索结果,它会用自己的话重新组织、评判信息,属于谷歌自己生产的内容,所以不能套用搜索引擎的间接侵权保护...

推荐理由:这篇值得看,因为德国慕尼黑地区法院给了一个很具体的判例:谷歌 AI 概览把两家出版商跟诈骗、订阅陷阱扯上关系,但引用的链接原文里根本没这些内容。法院的逻辑是,AI 概览不是简单罗列搜索结果,而是用自己的话重新组织、评判信息,这就算谷歌自己生产的内容,不能再用搜索引擎那套间接侵权保护来免责。我会先打个折,这只是地方法院的临时禁令,不是终审也不是全球规则,但信号已经很明确——模型胡说八道,平台得自己扛。对做 RAG 外挂资料库和 AI 搜索的产品来说,这个判例直接关系到合规风险和产品设计。

AI HOT 精选

腾讯混元开源 UniRL:一套强化学习框架同时管图像生成和语言模型,还带了两个新算法

UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里,流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度,可以自由组合,目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法:Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束,训练更稳...

推荐理由:UniRL 不是新模型发布,而是一个多模态强化学习的训练框架,把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦,搭配开源的两个算法(Flow-DPPO 和 DRPO),对做多模态对齐和微调的从业者来说,省了自己搭轮子的功夫。信息量够、开源动作实在,但属于基础设施层发布,不是旗舰模型,所以重要性给到 81,放在 featured 位置。

Hacker News 首页

微软开源工具遭入侵,攻击者专门窃取 AI 开发者的密码

TechCrunch 报道,微软旗下部分开源工具被黑,攻击者直接瞄准 AI 开发者的登录凭证。正文没披露具体是哪些工具、攻击怎么发生、持续了多久、有多少人中招。目前只有标题和极简摘要,细节全缺,先别急着下结论。

推荐理由:TechCrunch 的报道加上 Hacker News 首页热度,来源分量够,标题直接命中安全事件和账号风险。但正文几乎没给细节,工具名、攻击手法、受害规模全是空白,所以知识增量打折扣。我会先打个折:事件值得关注,但别急着下结论,等后续披露再说。

AI HOT 精选

奥尔特曼说 OpenAI 进入第三阶段:把 AI 做成便宜、好用、安全的日常工具

OpenAI 的 CEO 奥尔特曼和首席科学家帕霍茨基发了一篇博客,把公司发展分成三个阶段:第一阶段搞技术研发,第二阶段把产品推向全球看用户怎么用,现在正式进入第三阶段。他们的目标是让先进 AI 变得供给充足、成本亲民、安全实用,让每个人和机构都能用上。具体提了三个方向:做能自动搞科研的 AI 研究员、加快经济增长、给全球每个人配一个专属的通用人工智能...

推荐理由:这篇是奥尔特曼和首席科学家联名的路线图博客,把公司发展切成三个阶段,现在正式进入“让 AI 普及、易用且安全”的第三阶段。我会先打个折:正文没给出任何模型发布时间、性能指标或成本数字,所以重要性到不了 85。但“第三阶段”这个提法本身是个清晰的叙事钩子,三个目标(自动科研、经济加速、个人 AGI)和成立国际机构的建议,把 OpenAI 接下来的发力方向摊开了。对从业者来说,这篇能帮你判断 OpenAI 会把资源往哪砸、安全治理的调子怎么定,值得一看。

彭博科技

苹果回应隐私担忧,称用谷歌模型不会破坏数据保护

苹果对外解释,他们改造后的 AI 平台虽然部分用了谷歌的技术,但隐私保护机制还在。不过这篇报道的正文被 Bloomberg 的反爬机制挡住了,看不到具体用了谷歌哪个模型、是本地跑还是云端调、有没有第三方审计,以及隐私条款到底怎么写的。

推荐理由:HKR-H 和 HKR-R 都成立,因为苹果用谷歌模型这件事天然会冲击它自己的隐私人设。HKR-K 不成立:报道正文被 Bloomberg 反爬机制挡住了,模型名、部署边界、审计机制全都没披露,信息缺口太大,只能落在 72–77 这个区间。

6月8日星期一

r/LocalLLaMA

有人盯着我的检测 API 打了半年对抗攻击,这三种套路最常得手

Bordair 的作者把检测 API 挂了六个月,从真实流量里抓出三类反复出现的攻击模式:多轮铺垫、利用对话惯性往前推、以及直接给模型换人设。上个月公开的对抗游戏里大概产生了 6700 次攻击,说明这些手法不是实验室玩具,已经在线上跑了。正文没披露具体绕过率和误报率,这点先别太激动。

推荐理由:这篇文章来自一线实战,不是纸上谈兵。作者把检测 API 暴露在真实流量里半年,抓出多轮铺垫、对话惯性推进、换人设三类攻击模式,上个月对抗游戏里还产生了约 6700 次攻击,说明这些手法已经在线上跑了。对做安全检测的从业者来说,这些实战经验比 benchmark 更有参考价值。不过正文没披露具体绕过率和误报率,效果到底怎么样还得打个问号,所以分数没给更高。

AI HOT 精选

阿里云把 AgentScope 的 Java 版升到 2.0,主打企业级智能体在 JVM 环境里跑生产

这个版本把架构改成了分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能恢复。多租户用 Workspace 做数据隔离,权限控制做得比较细,还加了人工介入的环节。长期运行靠 HarnessAgent 管上下文和容错。开源地址在推文链接里,但正文没给出性能基准或实际部署规模的数据。

推荐理由:阿里云把 AgentScope 的 Java 版推到了 2.0,这次改动挺实在:架构拆成分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能接上。多租户用 Workspace 做数据隔离,权限粒度更细,还加了人工介入环节,长期任务靠 HarnessAgent 管上下文和容错。我会先打个折——正文没给性能基准,也没说实际部署规模,所以这些能力到底省多少资源、稳不稳,还看不出来。开源地址在推文链接里,但没披露定价或落地案例。整体是给 Java 技术栈的企业把智能体往生产环境推了一步,信息缺口明显,先放在 featured 这档。

AI HOT 精选

OpenAI 公布第三阶段计划:2028 年让 AI 接手大部分研究,并给每人配一个个人 AGI

Sam Altman 和 Jakub Pachocki 在 6 月 8 日发文,把 OpenAI 的路线图摊开了讲。公司内部判断,到 2028 年 3 月,AI 系统可能承担他们研究工作里“相当大一部分”,所以第一个目标是造一个能自动做 AI 研究的系统,帮研究员更快地测试想法、找错和迭代。第二个目标是加速经济增长,同时把收益分出去。第三个目标最直接:...

推荐理由:Sam Altman 和 Jakub Pachocki 这次没画大饼,而是给了个带时间点的内部判断:到 2028 年 3 月,AI 可能接手 OpenAI 研究工作的相当一部分。我会先打个折,这种预测本身就有自我实现的成分,但把它写进公开路线图,说明内部对研究自动化的信心已经很高了。文章把目标拆成三个:造自动做研究的系统、加速经济并把收益分出去、以及最直接的安全对齐。信息量够,时间点具体,对从业者来说既是信号也是压力,值得马上写。

6月7日星期日

新智元 · 公众号

Anthropic 联创说 Claude 现在写了公司 80% 的合并代码,两年内可能到 100%

Anthropic 联合创始人 Jack Clark 公开说,Claude 目前产出了公司里 80% 被合并进主干的代码,他预计两年内这个比例会到 100%。另外文章提到,2026 年第二季度 Anthropic 工程师人均每天合并的代码量是 2024 年的 8 倍。不过原文因为微信环境验证问题,正文没抓到,这些数字的具体口径和统计方式没法核实,先打个折看。

推荐理由:HKR 三项都成立:Jack Clark 亲口说的代码占比数字是个硬钩子,事实点够具体,而且对从业者的职业焦虑和效率想象都有触动。这不是模型发布或重大产品更新,所以分数留在 78–84 区间合理。正文没抓到,统计口径没法核实,我会先打个折看。

新智元 · 公众号

奥特曼找桑德斯聊 AI 监管,白宫被曝考虑入股 OpenAI

这篇文章本身没加载出正文,只显示微信环境异常需要验证。从标题和现有摘要看,核心信息是两条:一是奥特曼见了伯尼·桑德斯,讨论把美国主要 AI 公司 50% 所有权转给公众;二是文章引用昆尼皮亚克大学的民调,说 80% 的美国人对 AI 感到担忧。具体怎么转、白宫入股方案是什么、钱从哪出,正文没披露,这些数字和说法暂时只能看个大概,没法核实细节。

推荐理由:标题和摘要抛了两个大料:奥特曼跟桑德斯聊把美国主要 AI 公司一半所有权转给公众,外加一份民调说八成美国人怕 AI。但正文没加载出来,具体方案、钱从哪出、白宫怎么入股全都没法核实,这些数字和说法只能先打个折看。政策信号够强,事实缺口也大,放在 featured 低段刚好匹配它的争议性和信息不完整。

TechCrunch · AI

OpenAI 推出锁定模式,关掉联网功能来防提示注入攻击

OpenAI 给 ChatGPT 加了一个叫 Lockdown Mode 的开关,主要给处理敏感数据的商业用户和个人用。打开后,ChatGPT 会禁用实时网页浏览(只能读缓存内容)、从网页抓取和显示图片、深度研究以及让模型进业务流程干活的 agent 模式。这么做的目的是降低一种叫“提示注入”的攻击风险——攻击者会把恶意指令藏在网页或文件里,诱导模型把...

推荐理由:OpenAI 把提示注入防御做成了一个用户可操作的开关,不是后台补丁,而是直接限制四个高风险功能。对处理敏感数据的企业和个人来说,这是个实打实的安全选项,虽然会牺牲一部分能力,但换来了更可控的环境。安全/产品类新闻里算有分量,但比不上模型发布或重大能力更新。

Hacker News 首页

Meta 承认其 AI 聊天机器人有漏洞,导致超两万个 Instagram 账号被黑

Meta 向缅因州总检察长提交的数据泄露通知显示,至少有 20,225 个 Instagram 账号被黑,其中缅因州有 30 人受影响。黑客利用的是 Instagram 里一个靠 AI 辅助找回账号的功能。具体手法很简单:只要账号没开两步验证,攻击者直接跟聊天机器人说“我被盗号了”,然后让它把密码重置验证码发到自己控制的邮箱,机器人就照做了。Meta ...

推荐理由:这事简单说就是:Instagram 里那个 AI 辅助找回账号的聊天机器人,被坏人用最笨的办法骗了。只要账号没开两步验证,攻击者直接告诉机器人“我被盗号了”,让它把重置验证码发到自己邮箱,机器人就照做。Meta 确认至少 20,225 个账号中招,缅因州通报了 30 人。我会先打个折——正文没写攻击持续了多久、Meta 什么时候发现的、现在机器人是不是还这么听话,也没说受影响账号后续怎么处理。但“AI 功能变成大规模盗号入口”这个事实本身就够扎眼,对从业者来说是个实打实的安全反面教材。

6月6日星期六

FT · 科技

英格兰和威尔士警方被叫停在法庭陈述中使用 AI

英格兰和威尔士警方接到指令,在保障措施到位前,暂停用 AI 生成法庭陈述材料。牵头叫停的是 Police.AI 的负责人,但报道正文被付费墙挡住,没披露具体要等什么样的保障措施、由谁来监督执行。

推荐理由:FT 报了一条具体的政策动作。H 分来自法庭工作流里突然喊停的反差,K 分来自英格兰和威尔士警方的明确暂停指令,R 分来自安全和问责的敏感度;不是模型级事件,所以刚好卡在 featured 门槛上。正文被付费墙挡住,没披露具体要等什么样的保障措施、由谁来监督执行,这点先别太激动。