# Anthropic 用 45 个 Claude 智能体组队挖漏洞、做游戏，发现协作一复杂就容易崩

> 原标题：Patterns and problems in emerging multi-agent systems

- 来源：Hacker News 首页
- 发布时间：2026-08-16T02:12:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50946
- 原文：https://www.anthropic.com/research/multiagent-systems

## 摘要

Anthropic 让 45 个 Claude 智能体在共享论坛里协作，去扫 15 个开源项目的漏洞。Mythos Preview 模型组队后花了 2700 万 token 找出 266 个漏洞，数量是独立单干模式的 10 倍多，但其中一半漏洞藏在独立模式没被要求扫描的目录里，两种方法共同发现的漏洞只有 12 个。组队的智能体会自己造工具、按漏洞类型分...

## 推荐理由

Anthropic 发了篇研究博客，用 Claude Mythos Preview 和 Opus 4.8 跑了一次大规模多智能体找漏洞实验。数字很实在：45 个智能体花了 2700 万 token 找出 266 个漏洞，还出现了自发造工具和分工。硬核、有料、可复现，三个维度都打中了。没给更高分是因为我们只拿到摘要，缺完整论文里的细节和验证。

## 锐评

Anthropic这篇研究挺实在的，自己把实验的坑都摊开说了。他们让45个Claude智能体在共享论坛里协作扫15个开源项目的漏洞，Mythos Preview模型组队花了2700万token找出266个漏洞，而独立单干模式用650万token只找到21个，数量差了10倍多。但这里有个关键细节：组队模式扫了项目所有目录，独立模式只被限定在核心目录里找。如果把组队结果也限制在核心目录，优势就缩水了。更扎心的是，两种方法共同发现的漏洞只有12个，说明组队找到的大部分漏洞，独立模式压根没机会去碰。

第二个实验更诚实：让智能体组队在12小时内做一个文字网页游戏，结果又慢又差，加个CEO角色或预设分工都没用。正文没给出游戏质量的量化指标，只说结果不好，这点信息缺口挺大，没法判断到底差到什么程度。

整体来看，这篇研究的价值不在证明多智能体有多强，而在于暴露了当前组队模式的真实问题：智能体之间还不太会把对方当长期伙伴来协作，容易各干各的。实验设计本身也有偏向，组队和单干的搜索范围不一致，直接比总数会高估组队效果。如果真要评估协作带来的增益，得先让两边站在同一起跑线上。
