跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 401–420 条 · 共 582 条

4月24日星期五

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

FT · 科技

英国正跟 Anthropic 谈,想让银行用上 Mythos 模型做网络安全测试

英国政府正在和 Anthropic 接触,讨论让英国银行能接触到 Mythos 模型。目前公开的说法是用途会限定在网络安全测试上。不过这篇报道正文被付费墙挡住了,Mythos 具体能做什么、怎么部署、哪些银行能参与、什么时候落地,这些关键信息都没披露。这件事的重点不是银行要搞一个通用的 AI 工具,而是金融业能不能拿到一个前沿的、攻防兼备的安全模型的受...

推荐理由:FT 报道英国正和 Anthropic 谈,想让银行在网络安全测试场景下用 Mythos。我会先打个折:正文没写模型到底能干什么、怎么部署、给谁用、什么时候上线,所以现在只能当个信号看。但这件事的钩子在于,它不是普通 AI 采购,而是高敏感安全工具的受控入口,金融业拿到这种权限本身就值得关注。风险点也很明显,一旦落地,合规和供应商准入问题会立刻被放大。

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。

4月23日星期四

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

纽约时报中文网

Anthropic 造了个能找软件漏洞的模型 Mythos,现在只给美国用,连盟友都急了

Anthropic 发布了一个叫 Mythos 的模型,专门用来发现银行、电网和政府软件里的隐藏漏洞。公司说它太危险,不能公开,目前只跟美国 11 家科技公司和 40 多家关键基础设施机构共享,海外只有英国拿到了访问权。英国安全研究所的测试证实,Mythos 能完成以前任何 AI 都做不到的复杂网络攻击。欧盟、德国等盟友还没拿到模型,只能干着急;中国和...

推荐理由:这篇不是常规模型发布,更像一次准地缘政治的网络能力管制实验。Anthropic 把 Mythos 圈在极小范围,只给美国及英国部分机构用,还拉上 11 家合作方修漏洞,说明他们自己都怕这东西被滥用。正文没披露具体评测方法和基准分数,所以“比核弹还糟糕”这种说法先打个折,但 18 个月内类似能力扩散的预估值得盯紧。

OpenAI News

OpenAI 为 GPT-5.5 的生物安全漏洞开悬赏,最高 2.5 万美元

OpenAI 搞了一个针对 GPT-5.5 的生物安全漏洞悬赏计划,想找能一次性绕过五道生物安全题的通用越狱提示词。测试只能在 Codex Desktop 上进行,成功者可以拿到 2.5 万美元,部分突破也可能酌情给点小奖。申请从 2026 年 4 月 23 日开放到 6 月 22 日,测试窗口是 4 月 28 日到 7 月 27 日。不过正文没披露具...

推荐理由:OpenAI 给 GPT-5.5 开生物安全漏洞赏金,HKR 三项全中:钩子够尖锐,2.5 万美元封顶是实打实的数字,生物风险红队测试也确实是行业敏感点。分数停在 80,因为摘要没披露报名条件、评测协议、覆盖范围和截止时间,这些缺口让我没法给更高。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

The Verge · AI

Anthropic 的漏洞挖掘模型 Mythos 进了多个联邦机构,唯独漏了美国网络安全局 CISA

Axios 的消息说,Anthropic 那个专门找漏洞的模型 Mythos Preview 已经在商务部、国安局(NSA)等几个联邦机构用上了,但负责全国网络防御的 CISA 反而没拿到访问权限。文章没解释为什么偏偏跳过 CISA,也没提模型的具体性能、收费方式和部署规模。目前特朗普政府正在和 Anthropic 谈更广泛的合作,但 CISA 在现政...

推荐理由:我会先打个折:正文只说了谁在用、谁没在用,模型本身长什么样、花多少钱一概没提。但这条消息的看点不在技术,而在安排——管网络安全的部门反而没拿到漏洞发现模型,这要么是流程卡壳,要么是有意绕开。对从业者来说,这比一个模型刷榜更值得留意,因为它直接关系到联邦 AI 采购的走向和权限分配。

4月22日星期三

Hacker News 首页

LLM 生成的安全报告太多,Linux 内核开始删掉一批老旧的网络代码

内核维护者正在提议删掉一批没人维护的网络组件,包括 ISA、PCMCIA 以太网驱动、两个 PCI 驱动、业余无线电子系统(ax25)、ATM 和 ISDN。直接原因不是 LLM 帮忙清理代码,而是这些老代码长期没人管,现在又被 LLM 生成的安全报告淹没了。其中一份补丁说,业余无线电代码一直是 bug 和 syzbot 的吸铁石,没人站出来处理 AI...

推荐理由:LWN 这篇文章讲了一个 AI 带来的副作用:LLM 自动生成的安全缺陷报告大量涌入,但没人手去验证处理,内核维护者干脆提议把没人维护的老旧网络代码全删了,包括业余无线电协议、ATM、ISDN 这些。标题容易让人以为 LLM 在帮忙清理代码,实际是这些代码长期没人管、本来就是 bug 磁铁,现在被 AI 报告一冲,维护压力直接爆表,删掉反而更省事。我会先打个折:这不是技术突破,而是一个维护成本压过代码价值的现实案例。

The Verge · AI

Anthropic 最危险的模型 Mythos 被一群 Discord 用户白嫖了两周

事情很简单:Anthropic 的一个承包商权限没管好,加上网上公开的搜索技巧,让一小撮 Discord 用户摸到了内部模型 Claude Mythos Preview。这个模型能找出主流操作系统和浏览器里的漏洞并利用它们,听起来确实吓人。但报道里没写清楚到底有多少人拿到了权限、用了多久、Anthropic 现在有没有把漏洞堵上。核心问题其实是访问控制...

推荐理由:标题党归标题党,但这事本身是实打实的访问控制翻车。正文没披露到底多少人摸到了模型、摸了多久、修没修好,所以我会先打个折。真正值得盯的不是“最危险的模型”这种定性,而是入侵路径太简单了:承包商权限加常规侦查工具就进去了。如果是真的,说明 Anthropic 在第三方权限管理和模型隔离上出了纰漏,这对所有做前沿模型的公司都是一记警钟。

FT · 科技

保险公司开始给 AI 和“LLMjacking”相关的网络攻击理赔设上限

Beazley 和 QBE 这两家保险公司打算在网络安全险里,对由 AI 和“LLMjacking”(偷用别人大模型算力)引发的损失设置赔付上限。文章正文被付费墙挡住,没披露具体上限金额、触发条件,也没说什么时候开始执行。核心争议在于保单条款怎么界定“跟 AI 有关的损失”——这个定义会直接决定企业能拿到多少赔偿。

推荐理由:FT 这条消息本身是个信号:Beazley 和 QBE 这些承保方开始把 AI 和“LLMjacking”单独拎出来设赔付上限,说明 AI 风险已经进入核保条款,不再是概念炒作。我会先打个折——正文没给具体上限数字、触发条件和生效时间,所以没法判断力度有多大。这点先别太激动,真正值得盯的是后续保单措辞怎么定义 AI 相关事件,而不是标题里的技术热词。

机器之心 · 公众号

ICLR 2026 | ProSafePrune:用低秩剪枝治大模型过度防御,不训练、不拖慢推理

合肥工业大学和讯飞团队提出 ProSafePrune,一种低秩参数剪枝方法,专门解决大模型“过度防御”——把正常请求也误判为有害而拒绝回答。做法是用 SVD 把模型中间层的参数空间拆成安全、有害和伪有害三个子空间,然后剪掉重叠的“过度有害”方向。在 LLaMA-2-7B 上,OR-Bench 合规率从 11.0% 跳到 73.0%,安全评分只掉了不到 ...

推荐理由:我会先打个折:这是篇研究论文,不是产品发布,所以放 featured 而不是 p1。但 HKR 三项全中——用剪枝来缓解过度拒答这个思路本身就够反直觉,正文给了 7B-70B 的规模、OR-Bench 从 11.0% 到 73.0% 的跳升,以及 SVD 拆子空间的机制,信息量够。更关键的是它不增加训练和推理成本,这点对实际部署太友好了,从业者一看就懂价值在哪。安全分数只是“小幅下降”,MMLU 还升了,说明不是牺牲有用性换的。

彭博科技

日本财相本周约谈大银行,专门聊 Anthropic 新模型 Mythos 可能带来的风险

日本财务大臣片山皋月计划最早本周内召集国内主要银行开会,议题直指 Anthropic 最新模型 Mythos 对金融业的威胁。目前公开信息里没写 Mythos 具体能干什么、风险是哪种类型,也没提会不会出台监管措施。但这件事本身说明,日本可能要把前沿模型的风险正式摆到银行桌面上谈了。

推荐理由:Bloomberg 的信源给这条消息加了分:日本财务大臣要见大银行,点名讨论 Anthropic 的 Mythos 模型,这在政策层面是个实打实的信号,所以 H 和 R 都过了。分数停在 72,因为 K 太薄了——正文没披露 Mythos 的能力、风险类型和处置方向,我会先打个折。标题容易让人以为出了大事,但真正值得盯的是日本金融监管有没有把前沿模型塞进银行风险会议议程,这点先别太激动,等后续细节出来再说。

彭博科技

澳大利亚央行盯上 Anthropic 的 Mythos 模型,担心它被用来搞网络攻击

澳大利亚储备银行(RBA)正在关注 Anthropic 的 Mythos AI 模型。起因是 Anthropic 自己说这个模型有能力发动复杂的网络攻击,但彭博这篇报道的正文被付费墙挡住了,看不到具体的技术细节、评估范围和落地时间表。我会先打个折:目前只知道监管机构在盯着,但没披露他们打算怎么盯、盯到什么程度,也没说 Mythos 到底在什么条件下会构...

推荐理由:澳洲联储在盯着 Anthropic 的 Mythos AI,理由是这模型被说成能执行复杂网络攻击。我会先打个折:正文只给了彭博 RSS 摘要里那句能力声明,监测范围、技术细节、时间表全都没写。所以这条新闻的看点在于“央行下场盯模型”这个动作本身,而不是已经坐实了什么风险。对从业者来说,这更像一个信号——监管对模型安全能力的关注正在从纸面讨论走向具体盯防,但具体怎么盯、盯到什么程度会动手,现在全是空白。

FT · 科技

Anthropic 正在调查自家 Mythos 模型被未授权访问的事

FT 这篇报道正文被付费墙挡住了,只看到标题和摘要片段。已知信息是:Anthropic 在查一起针对其 Mythos 模型的未授权访问,并且之前因为担心这个新工具的“黑客能力”而限制了它的发布。具体有多少账号受影响、模型能力被限制到什么程度、时间线是怎样的,正文没披露。

推荐理由:FT 报道 Anthropic 在查 Mythos 的未授权访问,摘要补了一句关键信息:发布受限就是因为怕它的黑客能力。HKR 三项全中,但正文没披露到底哪些账户受影响、模型能力边界在哪、处置时间线是什么,信息缺口不小,所以重要性停在 84,放 featured 而不是更高。

彭博科技

Anthropic 的新模型 Mythos 被未授权用户访问了

Bloomberg 拿到内部文件和知情人士消息,说有一小撮未授权用户摸到了 Anthropic 还没正式发布的 Mythos 模型。Anthropic 内部认为这模型能力强到能搞出危险的网络攻击,所以这事不是普通的产品泄露,是访问控制出了问题。不过报道里没写到底多少人、通过什么路径、在什么时间段访问的,也没说 Anthropic 后续怎么堵的窟窿。

推荐理由:Bloomberg 爆出的不是常规产品消息,而是 Anthropic 的安全事故。未授权访问一个被内部判定为网络攻击级危险的大模型,本身就够抓眼球,也够讨论一阵。HKR-H 和 HKR-R 直接拉满,因为这事天然有传播力和讨论价值。HKR-K 靠的是新披露的访问事实和风险定性,但具体人数、路径、时间线正文全没给,信息缺口不小,所以知识增量有,但别指望能复盘全貌。

FT · 科技

顶尖律所 Sullivan & Cromwell 向法官承认用了 AI 生成内容,结果出现“幻觉”

这家收费每小时超 2000 美元的律所,在一起破产案中因为 AI 工具出错向法官道歉。正文被付费墙挡住,没披露具体用了哪款 AI、出了多少错、法院后续怎么处理。但能看出一个尴尬的事实:即使有高收费的人工审核,也没拦住 AI 瞎编的内容被提交上去。

推荐理由:标题写“幻觉”容易让人以为又是模型乱编,但这事更值得盯的是流程问题——每小时 2000 多美元的人工审核,照样漏掉了软件驱动的错误。信息缺口很大:工具、错误数量、法院后续都没披露,所以别急着往模型能力上归因。FT 的信源权威性能撑到 73 分和 featured,但缺这么多关键事实,分数没法再往上走。

The Verge · AI

YouTube 把 AI 换脸检测工具开放给名人,让他们自己搜、自己申请下架

YouTube 要把去年测试的 AI 换脸监测工具正式开放给好莱坞明星和公众人物。名人登记后,系统会自动扫描平台上用 AI 生成或替换了他们脸的视频,然后由本人或团队提交下架请求。注意,提交了不代表一定删——YouTube 会按隐私政策审核,不是所有请求都批准。这个工具去年秋天先给创作者试过,今年三月扩到了政治人物和记者,现在轮到明星。正文没披露具体什...

推荐理由:这是一次平台安全功能的扩展,不是模型新闻。YouTube 让已加入计划的名人能用工具搜仿冒视频并申请删除,审核仍走隐私规则流程。HKR 三项都成立,但整体还是一次中等体量的产品更新,所以重要性给到 74,放在 featured 层级。正文没披露具体覆盖多少名人、什么时候正式上线,这点先别太激动。

TechCrunch · AI

Clarifai 删掉了从 OkCupid 拿来的 300 万张用户照片,这些照片曾被用来训练人脸识别模型

Clarifai 跟 FTC 和解后,删了 300 万张照片和用这些数据训出来的模型。照片是 2014 年从约会软件 OkCupid 要来的,当时 OkCupid 的高管还投了 Clarifai。说白了就是投资人和被投公司之间私下传了用户数据,拿去训人脸识别 AI。正文没披露和解的具体条款、怎么验证删除是否彻底,也没说删模型对现有产品性能有多大影响。

推荐理由:故事钩子强,事实也扎实,合规链条是AI团队现在真得盯的事。Featured合适,但正文没写和解条款、怎么验证删除、模型受影响多大,这些缺口把分数压在70多分。

4月21日星期二

Hacker News 首页

Brex 开源 CrabTrap:给 AI 智能体加一个 HTTP 代理,用 LLM 当裁判实时拦截危险请求

Brex 把内部用的安全工具 CrabTrap 开源了。它本质上是一个 HTTP 代理,插在你的 AI 智能体和外部服务之间,每次智能体要发请求都得先过它这关。它会对照你写的安全策略做判断,允许或拦截,而且判断方式分两条路:先走静态规则直接匹配,匹配不上再交给一个 LLM 裁判来拍板。后台日志会标清楚每个决定是规则拦的,还是模型判的。部署起来很快,官方...

推荐理由:这篇东西的看点不在开源本身,而在执行面选在了 HTTP 代理层。对从业者来说,这比 SDK 内置检查更通用,但正文没给延迟和误判数据,我会先打个折。钩子够抓人,机制也实在,所以 HKR 全亮,但分数停在 78 是因为关键性能指标全缺,别太激动。