# AI 版红皇后竞赛：让模型互相攻击，看谁活到最后

> 原标题：Import AI 440: Red queen AI; AI regulating AI; o-ring automation

- 来源：Import AI
- 发布时间：2026-01-12T13:31:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3532
- 原文：https://jack-clark.net/2026/01/12/import-ai-440-red-queen-ai-ai-regulating-ai-o-ring-automation/

## 摘要

日本初创公司 Sakana 搞了个实验，让 GPT-4 mini 在 80 年代的老游戏 Core War 里互相厮杀、进化。他们用了一种叫 DRQ 的方法，让程序不断跟历代冠军对战，避免能力退化。结果很直观：单次生成的程序只能打赢 1.7% 的人类选手，但经过针对性进化后，这套程序能击败 89.1% 的人类选手，打平或击败的比例高达 96.3%。这相...

## 推荐理由

这是一条高信号密度的简报，不是一手发布，所以分数不会冲太高。H 落在‘AI 监管 AI’这个反直觉的框架上，K 落在 89.1% 和 ≤1% / <$10k 这些可测试的数字上，R 则同时踩中了自动化和治理的神经。

## 锐评

这条研究最值得看的不是“AI 又赢了人类”，而是他们用的进化方法。Sakana 让 GPT-4 mini 写的程序不断跟历代冠军对战，避免能力退化，这比一次性生成强得多。单次生成的程序只能打赢 1.7% 的人类选手，针对性进化后直接拉到 89.1%，说明持续的对抗压力比模型大小更管用。

不过得打个折。Core War 是个封闭的虚拟战场，规则固定，跟现实世界的网络安全攻防复杂度差远了。正文没披露这套进化程序在开放环境下的表现，也没说生成一个有效战士的成本是多少。如果每次进化都要反复调用 GPT-4 mini，实际开销可能不低。

另外，他们提到用 MAP-Elites 算法防止多样性崩溃，这是个关键设计，但论文里没详细对比不用这招会退化多少。想知道这套方法能不能搬到真实场景，还得看它在更乱、更开放的任务里能不能保持这种进化效率。
