Anthropic 派黑客 Nicholas Carlini 给美国政府演示怎么攻破自家模型,好让监管放心
The hacker sent by Anthropic to calm the government's nerves about AI safety
WSJ 报道,Anthropic 让安全研究员 Nicholas Carlini 去给美国政府官员现场演示越狱和模型攻击,想证明他们能管住 AI 的安全风险。Carlini 之前在 Google Brain,专门研究对抗样本和模型攻击。报道没说他具体展示了哪些攻击手法,也没提政府那边看完是什么反应。
推荐理由:WSJ 独家,讲 Anthropic 让安全研究员 Nicholas Carlini 去给美国政府现场演示越狱和模型攻击,想用这种方式证明自己能管住安全风险。我会先打个折:报道没说他到底演示了什么攻击,也没写政府那边看完是更放心还是更紧张,所以信息量其实有限。但选题本身有张力——派黑客去安抚监管,这个叙事角度在当下的 AI 安全讨论里挺少见,从业者会愿意点开看一眼。