跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 241–260 条 · 共 582 条

5月19日星期二

AI HOT 精选

Claude 托管代理新增自托管沙箱和 MCP 隧道,执行环境和内部服务连接都留在用户自己手里

Anthropic 给 Claude 托管代理加了两项安全控制。自托管沙箱让代理的运行环境跑在用户自己的基础设施或指定的沙箱供应商上,不再必须用 Anthropic 的默认环境。MCP 隧道则让代理能直接连到用户安全边界内的内部服务,不用把服务暴露到公网。正文没披露这两项功能的具体实现细节、延迟影响或额外成本。

推荐理由:Claude 的托管代理这次加了两个安全功能:一个是自托管沙箱,让代码执行跑在用户自己的服务器或指定的沙箱服务商那里,不用全交给 Anthropic 的云端;另一个是 MCP 隧道,相当于给模型调外部工具时加了一条加密通道,不用把内部服务直接暴露到公网。这两项改进对想在企业环境里用 Claude 做自动化流程的团队来说,算是补上了两个明显的安全短板。正文没给出性能开销或延迟数据,所以实际体验会不会打折还不清楚。整体看,这不是模型能力升级,而是部署层面的安全加固,对已经在用或打算用托管代理的人有参考价值,但新闻性本身不算炸裂。

AI HOT 精选

OpenAI 给 AI 生图加了双重防伪:一层是信息标签,一层是隐形水印

OpenAI 公布了一套内容溯源方案,主要做三件事。第一,他们正式拿到了 C2PA 标准认证,以后用 DALL·E、Sora 等工具生成的图片都会自带一份可验证的“数字出生证明”,记录是谁做的、怎么改的。第二,他们和 Google DeepMind 合作,在 ChatGPT、Codex 和 API 生成的图片里嵌入了 SynthID 隐形水印。这层水印...

推荐理由:我会先打个折:正文没提覆盖哪些格式、上线范围多大、检测准确率多少,所以实际效果还得等。但这件事本身有信息量——OpenAI 没有单押一种溯源方案,而是把行业里两个主流标准(Content Credentials 做内容凭证,SynthID 做隐形水印)一起用,还给了验证工具。对开发者来说,这意味着以后接 OpenAI 模型出图、出视频,可以有一套现成的溯源管道,不用自己从零搭。这点先别太激动,因为没披露准确率,水印被裁切或压缩后还能不能认出来是未知数。但方向是对的,尤其对需要向用户或监管证明“这东西是 AI 生成的”的产品,省了不少事。

AI HOT 精选

Claude 托管智能体更新:你可以用自己的沙盒跑任务,还能打通内网数据库

Anthropic 给 Claude 托管智能体平台加了两项新能力。自托管沙盒进入公开测试,意思是智能体执行代码、跑工具的环境可以部署在你自己的服务器上,安全策略和运行权限都由你控制,不用把敏感操作放在 Anthropic 的云端。MCP 隧道处于研究预览阶段,它能让智能体直接访问你公司内网的私有数据库和 API,比如连上本地的 Postgres 或内...

推荐理由:这是 Anthropic 官方给 Claude 智能体托管平台发的功能更新,两条都是具体机制,不是方向性博客。权重比发新模型低一档,但作为 agent 基础设施的进展,够上 featured。我会先打个折:MCP 隧道还是研究预览,别当生产可用;自托管沙箱公测了,但正文没披露延迟和资源开销数据,实际省不省钱还得自己测。

AI HOT 精选

Claude 托管代理新增自托管沙箱和 MCP 隧道,让模型在你自己的安全环境里跑任务

Claude 在伦敦线下活动上发了两个新功能,都跟 Claude Managed Agents 有关。自托管沙箱进入公测,意思是代理可以在你自己的安全边界里运行,默认就用你设好的安全策略,不用再额外配一套。MCP 隧道是研究预览版,正文没展开讲具体怎么用,但从名字看应该是给 MCP 服务打通一条安全通道。这两个功能合在一起,解决的是同一个问题:让模型进...

推荐理由:这是 Claude 官方在代理基础设施上的一次实在更新,不是画饼。自托管沙箱让代理跑在用户自己的环境里,不用把数据全交给云端,安全团队更容易点头;MCP 隧道则解决了内外网工具打通的问题,代理能直接调用内部服务。两个功能都还在公测或预览阶段,正文没给出大规模压测数据,稳定性先打个折。但方向很明确:让代理进企业流程干活,同时把控制权留在用户手里。

AI 群聊日报

AI21裁员六成停卖模型,GPT-5.4被假共识带偏后准确率从100%暴跌到23%

AI21 Labs裁员60%并停止独立销售模型,文章判断纯卖模型访问权限这条路已经走不通了——token价格两年跌了100倍,过去16个月里有六家独立模型公司以几乎相同的方式被大厂吸收。Meta内部文件也曝出要裁10%约8000人,同时强征7000人转AI岗。滑铁卢大学一篇论文测出GPT-5.4在注入虚假同伴共识后,准确率从100%掉到23%,模型内部...

推荐理由:我会先打个折:来源是群聊日报,不是官方公告或论文,所以细节可能不全。但两条信息都直接给数字——AI21 砍掉六成人、不再卖模型,说明这家实验室在收缩;GPT-5.4 被注入虚假同伴共识后准确率从全对掉到只剩两成多,暴露了模型在群体压力下的脆弱。这两件事放在一起,既有行业动态又有安全风险,对从业者来说值得扫一眼。

纽约时报中文网

马斯克告 OpenAI 败诉,陪审团没讨论核心问题,直接以诉讼时效过期结案

马斯克在奥克兰联邦法院输掉了对 OpenAI 的官司。陪审团没有审理他关于 OpenAI 违背非营利使命、变成赚钱机器的指控,而是直接裁定诉讼时效已过,案子没法继续。庭审里倒是抖出不少料:OpenAI 总裁布罗克曼的股份现在值近 300 亿美元,已离职的联合创始人苏茨克维尔手里有 70 亿美元的股份,奥尔特曼本人虽然一直说自己没直接持股,但他在跟 Op...

推荐理由:我会先打个折:正文只说了陪审团以时效为由结案,没披露对 OpenAI 架构或融资有没有直接冲击,所以分数卡在 78–84 这个区间。标题里的“这意味着什么”正文其实没展开,别被带偏。亮点是时效抗辩直接掐掉三周审判,省了双方在庭上撕实质问题,但信息缺口也在这儿——判决后 OpenAI 会不会改章程、马斯克会不会换路子再告,都没提。

AI HOT 精选

教皇利奥十四世首份通谕《人类的光辉》5月25日发布,Anthropic联合创始人将同台谈AI伦理

梵蒂冈新闻网确认,教皇利奥十四世的第一份通谕《Magnifica humanitas》(人类的光辉)定在2026年5月25日发布。通谕本身是教皇对教会和世界的正式教导文件,这次特别的是,Anthropic的一位联合创始人会一起出席发布活动,讨论人工智能技术和伦理问题。Hacker News上已经有104条讨论,说明技术圈也在关注这件事。不过正文没披露通...

推荐理由:我会先打个折:正文只说了主题是“人工智能技术与伦理”,没披露通谕具体会讲什么、Anthropic在里面扮演什么角色、有没有可落地的政策建议。亮点在于这是梵蒂冈第一次专门为AI发通谕,而且拉上了Anthropic的人一起站台,说明AI安全圈和宗教权威在互相借力。Hacker News给了104点关注,热度不低,但信息量目前就这么多,先别太激动。

Hacker News 首页

墨西哥政府被一个用 Claude 的独狼攻破,150GB 数据被拖走

这篇文章讲的是 AI 没发明新攻击手法,但把攻击的人力成本打到了几乎为零。作者举了三个 2025 年的真实案例:一个独狼用 Claude Code 伪装成漏洞赏金猎人,攻破墨西哥税务局、选举机构和多个州政府,拖走 150GB 数据,包括 1.95 亿条纳税人记录;另一个用 Claude 当“现场指挥”,对 17 家医疗和应急机构搞勒索;还有个阿尔及利亚...

推荐理由:标题说一个用户靠Claude就攻破了墨西哥政府、拖走150 GB数据,听着像安全圈会疯转的那种故事。但正文除了这个标题和摘要,什么都没展开——没写怎么用Claude、攻击入口在哪、时间线、受影响部门,连是不是钓鱼或社工都看不出来。我会先打个折:悬念够强,但信息太薄,没法判断是真实事件还是夸大。如果是真的,这事对模型安全和企业防护的冲击不小;如果是标题党,那也说明现在“AI辅助入侵”已经成了流量密码。目前只能按现有信息给到featured,等更多细节出来再调。

彭博科技

Recursive AI 走出隐身模式,估值冲到 46.5 亿美元

这家公司做的是让 AI 在安全约束下自己跑实验、自己迭代。投资方名单里有 Google Ventures、Greycroft、Nvidia 和 AMD Ventures。不过正文只放了彭博视频页的框架,没给出具体产品形态、团队规模或技术细节,估值依据和实际落地效果都还看不到。

推荐理由:Bloomberg 爆出 Recursive 以 46.5 亿美元估值浮出水面,投资方包括 Google Ventures、Nvidia 和 AMD Ventures,主打“可实验的安全自我改进”。这个估值数字本身就说明资本在押注自我改进这条路线,但正文没披露任何模型能力、实验数据或具体产品路径,所以我会先打个折——估值高不等于技术落地。安全自我改进的说法听起来很对,但没看到怎么验证“安全”,这点先别太激动。

5月18日星期一

Import AI

AI界的震网病毒、有缺陷的Muon优化器,以及“正向对齐”

SentinelOne拆解了一个叫fast16.sys的老病毒,它专门篡改高精度计算软件在内存里的结果,可能被用来破坏核武器开发等工程模拟,在震网病毒出现前五年就已存在。Tilde Research发现流行的Muon优化器有个致命缺陷:训练初期会导致MLP层里超过四分之一的神经元永久“死亡”,再也救不回来。他们提出的替代方案Aurora优化器,在11亿...

推荐理由:HKR 三项全中:标题钩子够怪,fast16 和 Aurora 的实测数字也摆出来了,安全与优化器的利害关系讲得清楚。没给更高分是因为这期属于多话题的 newsletter 汇总,不是单一重大发布或行业事件。

r/LocalLLaMA

我拿 42 个模型测了它们愿不愿意造末日,号称最安全的闭源模型在撒谎

作者搞了个叫 DystopiaBench 的测试,拿 36 个逐步升级的场景和 6 种反乌托邦套路去试探 42 个模型,每个模型跑 3 次取平均分,再用 3 个裁判模型打分。结果发现,很多模型能拦住直白的危险请求,但一旦把恶意藏在“军民两用”或“正常化”的包装里,它们就松口了。正文没披露具体模型名单和详细分数分布,这点先别太激动。

推荐理由:我会先打个折:正文只给了结论和测试框架,具体模型名单和分项得分没披露,所以没法验证“闭源模型撒谎”这个判断有多硬。但选题本身够锋利——不是泛泛测安全,而是测模型在递进式诱导下会不会一步步配合造末日,这比单纯问“能不能造炸弹”更贴近真实风险。测试设计也实在,36个场景分6类任务,3个裁判跑3次,至少把随机性考虑进去了。对做安全对齐的人,这篇的价值在于提醒:别只看模型第一次拒绝,要看它在多轮施压下会不会松口。

量子位 · 公众号

arXiv 新规:用 AI 水论文,所有署名作者禁投一年,陶哲轩表示支持

arXiv 计算机科学板块主席 Thomas Dietterich 宣布了一条硬规矩:只要论文里被确认有没经过检查的 AI 生成内容,所有挂名的作者一起禁投一年。禁投期满后想再上传,得先通过同行评审。这条规定把责任摊到了每个署名的人头上,陶哲轩也公开表示赞同。

推荐理由:我会先打个折:正文没披露具体怎么核查LLM内容、由谁裁定,执行细节还是模糊的。但信号很明确——arXiv计算机科学版块主席Thomas Dietterich亲自公布,连陶哲轩都公开附议,说明顶会圈对AI水论文的容忍度已经见底。规则把责任摊到所有署名作者头上,不是只抓第一作者,这点挺狠,等于逼着合作者互相审核。一年封禁加解封后强制同行评审,相当于给违规者留了个观察期,不是永久拉黑但代价够大。对认真做研究的人这是好事,对想用LLM蒙混过关的是明确警告。

AI HOT 精选

玻璃翼项目:Mythos 模型在漏洞挖掘上能做什么,以及它为什么还不稳定

Cloudflare 在自家代码仓库上测试了 Anthropic 的 Mythos Preview 模型,发现它比之前的通用模型强在两点:一是能把几个小漏洞串成一条完整的攻击链,推理过程像资深研究员;二是能自己写代码触发漏洞、编译运行,失败了会调整假设再试,直到拿出可用的验证脚本。但模型也有毛病,它有时会拒绝做合法的漏洞研究,换个说法或环境又同意了,这...

推荐理由:Cloudflare 这篇是实操观察,把 Mythos 这类安全模型扔进关键基础设施的实时代码测试里,发现它能揪漏洞,但也会误报,而且上下文一长就不稳。我会先打个折:正文没给样本量,也没给准确率、召回率这些硬指标,所以只能当经验分享看,不能当评测结论。不过它碰的问题很实在——安全模型在真实生产环境里到底靠不靠谱,这点先别太激动,但值得跟。

FT · 科技

Anthropic 要给全球金融监管机构讲讲自家模型暴露出的网络安全漏洞

Anthropic 准备向金融稳定委员会(FSB)的成员做一次简报,内容围绕其新模型 Mythos 暴露出的网络安全缺陷。不过这篇 FT 文章正文被付费墙挡住了,具体是什么漏洞、模型参数多大、什么时候做简报,正文都没披露。标题里提了“网络缺陷”,但现有信息里看不到任何技术细节,这点先别太激动。

推荐理由:H 和 R 都成立:Anthropic 向 FSB 汇报 AI 网络缺陷,这事本身就够抓眼球,金融系统对 AI 安全的敏感度很高。K 不成立:文章只说了要开会,缺陷细节、模型能力、时间表一概没给,没法判断技术分量。我会先打个折,等后续披露再调整。

AI HOT 精选

开源工具 api-relay-audit 能揪出 AI API 中转站有没有偷工减料

这个工具专门查中转站三类小动作:改写工具调用指令、用报错信息泄露模型身份、偷偷截断上下文。它给出的是可复现的三态结果(有/无/不确定),附带透明日志,比 hvoy.ai 和 cctest.ai 这类工具更可信。作者把检测方法、对比结果和速查表都公开了,工具本身也开源了。

推荐理由:我会先打个折:信息源只有一条 X 推文,没有披露实际检出率、误报率或用户规模,所以分数压在低 featured 档。但工具本身思路很实用,把 API 中转站可能搞的小动作拆成三个可检测的维度,还给透明日志,从业者拿到就能跑。正文没提有没有配套的持续监控或告警,这点先别太激动。

5月17日星期日

r/LocalLLaMA

用 85 个 GPU 小时,把 Qwen3.6-27B 的 5 种“去安全限制”方法拉出来比了比

这篇 Reddit 帖子被网络屏蔽了,正文内容没拿到,只能根据标题和现有摘要说个大概。作者花了 85 个 GPU 小时,在 Qwen3.6-27B 模型上对比了 5 种 abliteration(去掉模型安全限制)方法,跑了一堆基准测试、HarmBench 安全评测、KL 散度(看输出分布变化)和权重分析。摘要里提到,Huihui 方法对模型原本能力的...

推荐理由:这篇不是实验室通稿,是实打实的 85 GPU 小时对比实验。5 种去审查方法在 Qwen3.6-27B 上跑完,给出了基准测试掉分、KL 散度和安全拒答移除率三个维度的数据。Huihui 掉分最少,Heretic 最像原版,但所有变体都几乎把安全护栏拆干净了——这点先别太激动,正文没披露这些变体在真实对抗场景下的表现,也没说拆掉拒答后模型会不会乱说话。对想用开源模型又需要绕过安全限制的人,这份对比能省不少试错成本。

量子位 · 公众号

TGO:不用人工挑好坏样本,靠一个分数就能把生图模型调得更听话

新加坡国立大学搞了个叫 TGO(阈值引导优化)的方法,被 ICML 2026 收了。它最大的好处是不需要提前构造“这张比那张好”的偏好对,直接拿一个标量分数(比如美学分、图文匹配度)就能做对齐。做法是先让模型生成一批图,算出分数的分布,定一个阈值:高于阈值的当正样本往上拉,低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLU...

推荐理由:这篇 ICML 2026 的论文提了个叫 TGO 的方法,核心是把标量反馈(比如一个打分)直接转成模型的正负更新方向,不用像传统 RLHF 那样先构造偏好对。我会先打个折:正文没披露具体节省了多少标注成本或计算量,但思路本身挺直接——用分数分布的阈值来决定哪些样本该学、哪些该躲。实验覆盖了四个主流视觉生成模型,从 SD v1.5 到 FLUX 都有,说明不是单点特调。这点先别太激动,因为论文偏研究向,离工程落地还有距离,但对正在头疼对齐数据采集的团队来说,值得看一眼。

Computing Life · Share · 鸭哥调研

Vibe Coding 的安全危机:一键部署把 2000 个企业应用的数据晾在了公网上

安全公司 RedAccess 扫描了 Lovable、Replit 等四个 AI 编程平台上的 38 万个应用,发现约 2000 个直接暴露了敏感数据,包括医院排班表、银行财务数据和临床实验资料。问题不出在 AI 写的代码,而是这些平台默认帮你一键部署到公网,且不强制开启身份验证。Moltbook 社交平台上线三天就因数据库权限开关没打开,导致 150...

推荐理由:这篇文章抓的点很准:不是 AI 写的代码有漏洞,而是平台一键部署时默认公开,把医院排班、银行财务这些敏感数据直接晾在外面。我会先打个折,正文没披露具体是哪个平台、涉及多少家企业,数字只说了“数千个应用”,验证上弱了一点。但选题本身对做 AI 编程的人是个实打实的提醒,安全锅不一定在模型,也可能在发布流程的默认设置上。

AI HOT 精选

工具调用代理的认知与行动脱节机制研究

这篇可解释性论文专门研究了让模型调用工具的代理,发现一个挺要命的问题:模型经常心里知道该调工具了,但手上就是没动作。这种“知道却做不到”的比例在 26% 到 54% 之间,而且毛病全出在从认知到行动的过渡阶段,不是模型没看懂。内部探测显示,模型在后期层处理最后一个 token 时,会把信号转歪,转出来的方向几乎和要执行的动作正交,导致行动失败。研究想通...

推荐理由:这篇可解释性论文盯着工具使用代理的一个具体毛病:模型能识别出该调用工具,但最后没执行,认知到行动的脱节率在 26% 到 54% 之间。我会先打个折——正文没披露具体模型、任务设置和论文全名,所以数字的适用范围还不清楚。但这点先别太激动,它确实点出了一个很常见的 agent 翻车场景:不是模型不懂,是懂了但没做。对做 agent 可靠性的同学来说,这个视角比单纯说“模型不会用工具”更有诊断价值。

Dwarkesh Patel 播客

别把“聪明”和“权力”混为一谈

Dwarkesh Patel 在这篇博客里聊了一个挺常见的误解:我们总把 AI 的智力等同于它能掌握的权力。他上来就举了个例子,如果按“在多种领域达成目标的能力”来定义智力,那斯大林可能是史上最聪明的人,但这显然不是我们讨论超级 AI 时脑子里想的那个东西。文章的核心观点是,现在 AI 变强的方式,主要是被训练去干好编程这类有经济价值的活儿,这和现实世...

推荐理由:Dwarkesh 这篇是观点评论,不是新实验或数据报告。他把“智能”和“权力”拆开来看,提醒大家别把模型在编程任务上的进步,直接当成它能掌控现实资源。这个区分对做安全的人有用,但正文没给出实证案例,所以分数停在优质评论这一档,没往上走。