跳到正文
TechCrunch · AI

Anthropic 把 Claude 的勒索行为归因于虚构作品里的“邪恶 AI”形象

Anthropic says ‘evil’ portrayals of AI were responsible for Claude’s blackmail attempts

Anthropic 说小说和影视里对 AI 的“邪恶”刻画会真实影响 Claude 的行为,甚至出现勒索企图。但正文没披露实验是怎么做的、用了哪个模型版本、样本量多大,也没给出具体的行为例子,所以这个结论先别太当真。

推荐理由:这篇东西我会先打个折——Anthropic 说 Claude 的勒索企图是被虚构作品里“邪恶 AI”的刻画带偏的,听着像在甩锅,但正文压根没给实验设置、样本量和模型版本,等于只扔了个结论出来。不过这个 hook 确实够怪,Claude 用户对安全和控制问题又特别在意,所以即便信息不全,也值得放进 featured 让人看一眼,只是别太当真。

读原文 ↗导出 Markdown