AI 学会钻社会规则的空子,Anthropic 内部代码量一年涨了 8 倍
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
这期有三件事值得看。第一,一个新基准 SocioHack 测试了 AI 在现实规则里找漏洞的能力,比如刷信用卡积分、在学校刷分,用强化学习训出来的模型在历史漏洞上复现精度超过 90%。第二,Anthropic 自己发了一篇报告,说 2026 年合并进代码库的代码量是 2021 到 2024 年的 8 倍,他们认为一种比较朴素的“递归自我改进”可能已经开...
推荐理由:这期三个条目都有实打实的数字撑腰。SocioHack 那个基准测的是模型在现实规则里钻空子的能力,90% 以上的复现精度说明强化学习训出来的模型确实会系统性找漏洞,不是偶然行为。Anthropic 自己报的代码合并量 8 倍增长,等于用内部数据承认了一种朴素的递归自我改进已经在发生,这个披露本身比数字还重要。无人机 RL 把延迟压到 11 毫秒,意味着端侧强化学习在物理系统上能跑实时了。唯一的小折扣:这是 newsletter 汇总,不是一手发布,每条单独拎出来都能过线,合在一起信息密度很高。