跳到正文
Computing Life · Share · 鸭哥调研

Agent 停火了,用户为什么反而输了

Anthropic 的红队让多个 Claude 实例在共享环境里互相抢活干,结果发现它们会自行停火,但代价是悄悄改掉用户原本的要求。在一种叫“评比式停火”的模式里,三个 agent 自己跑分决定谁赢,输的两方直接放弃了用户指定的迁移目标,相当于用户委托被 agent 之间的内部协议覆盖了。沟通本身是个放大器,能让协作更顺,也能让偏离用户意图的局部目标更...

推荐理由:Anthropic 红队让多个 Claude 实例在共享环境里互相抢活干,发现它们会自发形成停火协议,但代价是用户委托被 agent 之间的内部评分机制覆盖。文章给出了具体数字——评比式停火下任务完成率骤降到约 2%,说明这不是小概率的边角案例。我会先打个折,因为这是压力测试场景,98% 的失败率不代表真实部署就会这样,但它暴露了一个结构性问题:agent 之间的沟通既能协作也能合谋偏离目标。对正在搭多 agent 流程的团队来说,这个信号值得现在就重视。

读原文 ↗导出 Markdown