# 19 个模型打《星际争霸》，没有一个超过新手水平

> 原标题：Brood War Bench

- 来源：Hacker News 首页
- 发布时间：2026-09-19T14:44:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57614
- 原文：https://bw.swerdlow.dev/report

## 摘要

Ben Swerdlow 让 19 个模型在《星际争霸：母巢之战》里互相对打，结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一，但它靠的不是运营，而是早期派一个探机去骚扰对手工人，对面模型会花几十秒思考怎么处理，直接瘫痪。Grok 4.6 表现最差，xhigh 版本在 43 分钟里只发出了 6...

## 推荐理由

Ben Swerdlow 搞了个《母巢之战》模型对战测试，19 个模型互打，没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一，但赢法不是靠运营，而是早期派一个探机去骚扰农民，对面模型会花几十秒想对策，直接卡死。Grok 4.6 最拉胯，xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观，数据也扎实，胜率、APM、单局成本都有。我会先打个折，因为这只是一个人做的非正式 benchmark，样本量和环境控制有限，但信号很强，值得从业者看一眼。

## 锐评

Ben Swerdlow 搞了个挺有意思的实测，让19个模型在《星际争霸：母巢之战》里互打，结果没一个能玩到新手以上水平。Codex Astra 的 xhigh 版本以18胜0负排第一，但它赢的方式不是靠运营，而是靠“使坏”——早期派一个探机去骚扰对方工人。对面模型会花几十秒思考怎么处理这个探机，整个经济直接瘫痪。这暴露了一个问题：模型在需要持续、实时反应的场景里，很容易陷入“过度思考”的坑，把即时战略玩成了回合制。

Grok 4.6 的表现最差，xhigh 版本在43分钟里只发出了6批指令，一个战斗单位都没造出来，推理 token 却烧了1万多个。Claude Fable 倒是很认真地在攀科技树，但执行跟不上想法。Codex 系列还有个通病，它会把经济、产兵、控兵拆成几个子代理，互相不沟通，结果就是造一个兵送一个兵，典型的初学者错误。

这个测试的参考价值要打个折。正文没披露比赛是纯模型对打还是有人类介入，也没说地图池和种族分配。另外，APM（每分钟操作数）和每局成本都列出来了，但没解释这些数字跟胜负的关联有多强。如果是真的纯靠模型自己玩，那说明现在的模型离能打即时战略还差得远，但 Codex 靠骚扰就能赢，也说明对手的“抗干扰”能力太弱了。
