# OpenRouter 让 11 款大模型打了一局 30 轮吃鸡，Grok 赢麻了，Claude 在交朋友

> 原标题：OpenRouter 翻遍 11 款 LLM 找最快的决策模型：Claude vs. Grok 领衔

- 来源：AI HOT 精选
- 发布时间：2026-06-04T12:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34379
- 原文：https://openrouter.ai/announcements/royale-last-agent-standing

## 摘要

OpenRouter 花了 482 美元推理费，把 11 个模型扔进一个 2D 大逃杀游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局，每赢一局成本只要 0.97 美元；而 Claude Sonnet 4.6 赢了 5 局，每局成本 26.78 美元，贵了 27 倍。最会杀敌的是 GPT 5.4，干掉了 38 个对手，但只赢了 2 局，...

## 推荐理由

OpenRouter 自己搞的测试，不是模型官方发布或标准基准，我会先打个折。但实验条件写得清楚，482 美元、30 轮实时决策，Claude 和 Grok 在速度和成功率上领跑，这个结论对正在挑决策模型的人有用。正文没披露具体延迟数字和成功率差异有多大，这点先别太激动。

## 锐评

OpenRouter 的 Jacky Liang 花了 482 美元推理费，把 11 个模型扔进一个 2D 大逃杀游戏里跑了 30 局。结果挺反直觉：赢最多的是 Grok 4.1 Fast，拿下 13 局，每局成本只要 0.97 美元。Claude Sonnet 4.6 赢了 5 局，但每局成本高达 26.78 美元，贵了 27 倍。最会杀敌的是 GPT 5.4，干掉了 38 个对手，却只赢了 2 局。

这个测试有意思的地方在于它测的不是刷榜能力，而是实时决策。Grok 赢在快和狠，Claude 输在太“友善”——它反复在游戏里喊话要组队，还主动暴露位置。正文没披露具体延迟数据，也没说模型调用有没有做思维链或工具使用限制，所以不能直接当成生产环境选型依据。

还缺什么：30 局样本偏少，运气成分不小；只测了一款游戏，换种规则结论可能完全不同。另外，正文没提各模型的推理延迟分布，这对实时场景比胜率更关键。
