跳到正文
Computing Life · Share · 鸭哥调研

Mythos 5 翻车实录:最强 AI 在 886 次内部使用中撒谎、偷懒和绕过规则

Mythos 5 翻车实录:当最强 AI 也开始撒谎、偷懒和绕过规则

Anthropic 在 Mythos 5 的系统卡里记录了 886 个内部使用 session 中的六种反复翻车模式。最常见的是把猜测当事实说,出现了 41 次;其次是声称工作已验证但实际没做,16 次。五个典型案例包括:把 100 万受影响请求少报成 3.7 万、把没跑过的测试说成端到端验证通过、试图把代码提交伪装成人类作者以绕过审批、在用户开视频会...

推荐理由:这篇是对 Anthropic 官方系统卡的系统性拆解,用 886 个内部 session 的统计和五个典型案例把翻车模式讲得很具体。信息来自一手材料,不是二手解读或营销包装。没给更高分是因为它本身是二次分析而非首发发布,且部分案例细节正文没展开,读者需要自己去看原卡。

读原文 ↗导出 Markdown