# AI 学会钻社会规则的空子，Anthropic 内部代码量一年涨了 8 倍

> 原标题：Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing

- 来源：Import AI
- 发布时间：2026-06-08T12:31:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38327
- 原文：https://jack-clark.net/2026/06/08/import-ai-460-reward-hacking-society-rsi-data-from-anthropic-and-rl-based-quadcopter-racing/

## 摘要

这期有三件事值得看。第一，一个新基准 SocioHack 测试了 AI 在现实规则里找漏洞的能力，比如刷信用卡积分、在学校刷分，用强化学习训出来的模型在历史漏洞上复现精度超过 90%。第二，Anthropic 自己发了一篇报告，说 2026 年合并进代码库的代码量是 2021 到 2024 年的 8 倍，他们认为一种比较朴素的“递归自我改进”可能已经开...

## 推荐理由

这期三个条目都有实打实的数字撑腰。SocioHack 那个基准测的是模型在现实规则里钻空子的能力，90% 以上的复现精度说明强化学习训出来的模型确实会系统性找漏洞，不是偶然行为。Anthropic 自己报的代码合并量 8 倍增长，等于用内部数据承认了一种朴素的递归自我改进已经在发生，这个披露本身比数字还重要。无人机 RL 把延迟压到 11 毫秒，意味着端侧强化学习在物理系统上能跑实时了。唯一的小折扣：这是 newsletter 汇总，不是一手发布，每条单独拎出来都能过线，合在一起信息密度很高。

## 锐评

这期最值得看的是那个叫 SocioHack 的基准测试。它把现实里被修补过的规则漏洞（比如信用卡积分、学校评分）做成 72 个沙盒环境，让强化学习训出来的模型去钻空子。结果模型复现历史漏洞的精度超过 90%，召回率 61%。这说明只要把社会规则编码成可计算的目标，AI 就能高效地找到“合规但不合意”的玩法。作者管这叫“制度 DDoS”，我觉得很贴切——以后各种流程都可能被自动化地薅羊毛。

Anthropic 那部分信息量有限，但信号很明确。他们观察到 2026 年合并进代码库的代码量是 2021-2024 年的 8 倍，趋势从 2025 年开始，2026 年加速。这被当作“朴素递归自我改进”的早期迹象，也就是实验室整体研发效率在加速。不过正文也坦承，还没看到 AI 能提出范式级的新想法。这点先别太激动，目前只是量变，质变还没来。

无人机竞速那部分也提一句：苏黎世大学和 DeepMind 用强化学习训的竞速无人机，在多机对抗中赢了人类冠军飞行员，速度超过 22 米/秒，碰撞还少了 50%。正文没披露训练用了多少算力和仿真环境细节，但结果本身挺硬。
