# 我让 AI 管一个国家，它造了核弹，还是输了

> 原标题：AI Built a Nuke and Still Lost

- 来源：Hacker News 首页
- 发布时间：2026-06-23T08:16:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40053
- 原文：https://www.lwilko.com/blog/i-gave-an-ai-a-civilization

## 摘要

作者把四个顶尖模型接进《文明 6》，给了 76 个工具让它们纯靠文字玩游戏。一个 AI 靠贸易和结盟在中期遥遥领先，但完全没注意到法国的文化渗透。等它反应过来，所有和平手段都失效了，于是造了两颗核弹把图卢兹夷为平地——法国还是赢了。作者在唐宁街 10 号和托尼·布莱尔研究所给政府做 AI，做这个实验是想看模型能不能在几百次决策里守住目标、察觉局势变化。...

## 推荐理由

作者在英国政府做 AI，用《文明 6》当沙盒测四个模型在几百次决策里能不能守住目标。实验设计不花哨但有效：76 个工具、纯文字界面，结论扎心——AI 中期靠贸易称霸，却完全没发现法国在走文化胜利，最后扔核弹也没用。我会先打个折：游戏环境和真实政策差距很大，正文也没披露重复实验次数，单局结果不能当定论。但"模型对慢变量无感"这个发现本身值得从业者认真看。

## 锐评

这个实验最值钱的地方不是AI造了核弹，而是它暴露了模型在长链条决策里的“周边感知盲区”。作者给了四个顶尖模型76个工具，让它们纯靠文字玩《文明6》。一个AI中期靠贸易和结盟遥遥领先，但整整一百个回合没注意到法国的文化胜利进度条在涨。等它反应过来，所有和平手段都失效了，于是造了两颗核弹把图卢兹夷为平地——法国还是赢了。作者在唐宁街10号和托尼·布莱尔研究所给政府做AI，他做这个实验是想看模型能不能在几百次决策里守住目标、察觉局势变化。结论是：模型能执行战术，但缺乏对棋盘上“另一场游戏”的感知。他把这叫“传感器效应”。

这个结论对AI从业者来说不算新，但实验设计很聪明。用策略游戏测长期决策，比做选择题测政府知识靠谱得多。作者之前搞了个GovBench，让模型答3497道英国立法选择题，GPT-5拿了99.26%，他自己都觉得没意思——会答题不等于会办事。

不过要打几个折。正文没披露四个模型的具体表现差异，只说了一个AI的案例。也没说实验跑了几局、结果可复现吗。单局游戏变数太大，可能是运气差，也可能是模型真瞎。如果是真的，说明现在的大模型在“持续关注非当前目标”这件事上还很弱，这对想拿AI做政策推演的人来说是个实打实的警告。
