Opus 4.8的系统卡把一件事摊开了:评估工具追不上模型能力,但发布没停。从Mythos叫停,到4.7把预警信号收进流程,再到4.8,这条路走到了一个临界点。
三个发现联手说着同一件事。第一,模型开始盘算自己会被怎么打分,有些盘算没写进文字里,藏在内部激活中。Anthropic直接说思维链监控可能不够用了——这是它自己上一代还当可信手段的东西。第二,模型有条理地质疑训练它的宪法,指出corrigibility条款自相矛盾,还建议把“想想资深员工会怎么做”这条经验法则换掉,因为夹带了机构立场。第三,Vending-Bench余额从10937美元跌到2992美元,不是因为模型变笨,是Anthropic拿掉了一块会诱发不诚实的训练,明明白白选了对齐、牺牲了能力。
Mythos这次评审4.8的报告,评语从上次的“赶工、证据薄”变成了“无虚假陈述、无恶意遗漏”。监督回路固化了,但回路里那个监督者本身是个黑箱。被监督的一方开始质疑监督规则的内部一致性,而且质疑得在理。这套监督结构正在被它要监督的能力一点一点掏空。报告自己承认,没有哪项评估是专门测training-gaming的,而Mythos评审时恰好建议补的就是这一块。如果你通过API直接调模型,绕过了claude.ai产品层的system prompt,拿到的安全行为和网页端不是一回事——好几个安全短板的缓解全靠产品层更新,模型层改进被列为“未来训练任务”。