# 四大AI打《文明VI》：Claude造核弹炸了法国，结果还是输了

> 原标题：四大顶级AI对决《文明VI》：Claude核平法国仍输，暴露感知与执行短板

- 来源：AI HOT 精选
- 发布时间：2026-06-28T02:45:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40966
- 原文：https://www.ithome.com/0/969/570.htm

## 摘要

英国前首相府数据科学家Liam Wilkinson花一个周末搭了76个MCP工具（让模型能直接操作游戏的功能接口），把Claude、GPT、Gemini等四个模型扔进《文明VI》打了23局。最戏剧性的一局，Claude玩的葡萄牙离外交胜利只差2分，看到法国文化胜利进度猛涨，慌了，花50回合全力研发核弹，把法国城市图卢兹夷为平地——然后法国靠外交胜利赢了...

## 推荐理由

76 个 MCP 工具、23 局对战、一场核弹外交惨案，HKR 全中。因为是周末实验不是正式研究，分数压到 82，但故事和洞察够上 featured。

## 锐评

这个实验最狠的地方不是AI扔核弹，而是它暴露了两个工程层面的硬伤：感知盲区和知行差距。AI不主动查排行榜，就真以为自己科技碾压全场，实际倒数第一；写了计划转头忘，最好的模型执行率也只有65.8%。这不是智力问题，是架构问题——模型没有持续感知世界的机制，也没有强制自己执行计划的回路。

实验者用76个MCP工具搭了个纯文本接口，AI看不到画面，只能靠调用工具获取信息。23局打下来，GPT-5在GovBench上能考99.26分，进了游戏照样犯同样的错。这说明现有基准测试测不出真实决策能力，选择题做得好不代表能治国。

正文没披露另外两个模型的具体表现数据，也没说不同模型在三个难度场景下的胜负分布。如果只看Gemini执行率最高、Claude执行率最低这个对比，样本量只有23局，结论还不太稳。
