# Anthropic 派黑客 Nicholas Carlini 给美国政府演示怎么攻破自家模型，好让监管放心

> 原标题：The hacker sent by Anthropic to calm the government's nerves about AI safety

- 来源：Hacker News 首页
- 发布时间：2026-06-17T19:22:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38971
- 原文：https://www.wsj.com/tech/ai/anthropic-mythos-safety-nicholas-carlini-20bceaa3

## 摘要

WSJ 报道，Anthropic 让安全研究员 Nicholas Carlini 去给美国政府官员现场演示越狱和模型攻击，想证明他们能管住 AI 的安全风险。Carlini 之前在 Google Brain，专门研究对抗样本和模型攻击。报道没说他具体展示了哪些攻击手法，也没提政府那边看完是什么反应。

## 推荐理由

WSJ 独家，讲 Anthropic 让安全研究员 Nicholas Carlini 去给美国政府现场演示越狱和模型攻击，想用这种方式证明自己能管住安全风险。我会先打个折：报道没说他到底演示了什么攻击，也没写政府那边看完是更放心还是更紧张，所以信息量其实有限。但选题本身有张力——派黑客去安抚监管，这个叙事角度在当下的 AI 安全讨论里挺少见，从业者会愿意点开看一眼。

## 锐评

这条消息的核心动作很直接：Anthropic 让 Nicholas Carlini 去给美国政府官员现场演示越狱和模型攻击。Carlini 之前在 Google Brain 专门研究对抗样本，属于业内顶尖的攻击者视角。派他去，相当于对政府说“你看，最懂怎么搞破坏的人在我们这儿，所以我们知道怎么防”。

但 WSJ 这篇报道目前只有 RSS 摘要，正文没披露他具体展示了哪些攻击手法，也没提政府官员看完演示后的反应或后续动作。这就让整件事的实质效果打了个问号——演示本身不等于安全承诺，政府是否买账、有没有提出新的监管要求，这些关键信息都缺失。

对从业者来说，这条值得关注的点在于：头部 AI 公司开始用“以攻促防”的方式做政府关系，而不是只交白皮书。但别急着下结论，等看到具体攻击案例和政府反馈再说。
