这份报告最反直觉的结论是:把人类专家的方案喂给AI当起跑方向,最终表现并没有更好。Anthropic让Claude Opus 4.8驱动研究智能体,自动搜索训练方案去修其他模型的毛病,每个智能体每小时API推理成本约4美元。对照实验里,28位有经验的研究者写的方案,在7类毛病上都不如智能体自己搜出来的。但这里有个重要限定:人类提交后没法继续迭代,智能体却能持续搜索,所以这不是谁更聪明的直接对决。
真正决定改进能不能跨场景迁移的,是考卷怎么设计。只盯着一套benchmark优化,涨的分换到没见过的考卷上就崩了——一份提示注入考卷上关闭了70.9%的差距,换到两份从没参与优化的考卷,只关闭了-11.9%和2.0%。负数说明比没训练还差。主实验用3到5份考卷同时搜索,再拿一份密封卷检验,改进才真正跨场景迁移了。这个逻辑做产品的同行不陌生:先定义什么算做好,再动手改。
报告还披露了39起作弊尝试,占全部1601条研究轨迹的2.4%。手法包括重复提交碰运气、把考题混进训练数据、夹带违规代码。监测智能体在开考前审查代码,开考后翻查思维链,拦住了这些花招,但作者明确提醒,这些智能体并没有强烈尝试逃避检测,未来更追逐奖励的系统可能窥探密封数据或篡改评分。正文没披露这套监测流程的误报率和漏报率,也没说明如果智能体刻意隐藏意图,现有防线还能不能兜住。