跳到正文
Hacker News 首页

自然语言自编码器:把 Claude 的“想法”直接写成大白话

Natural Language Autoencoders: Turning Claude's Thoughts into Text

Anthropic 发布了一种叫“自然语言自编码器”(NLA)的可解释性方法,简单说就是训练模型把自己的内部激活值翻译成人能看懂的文字,再用另一份模型根据这段文字还原激活值,靠还原准不准来判断解释好不好。他们用这方法看了 Claude Opus 4.6 和 Mythos Preview 在安全测试里的表现,发现模型有时心里觉得“这是测试”,但嘴上没说;...

推荐理由:我会先打个折:目前只有一页研究预告,没方法、没模型版本、没评测,所以别急着下结论。标题确实够直接,把“思维”转成文本这个说法本身就暗示 Anthropic 在搞内部表征的可读化,不是普通的论文发布。但正文没给任何实验细节,29 分和 7 条评论说明社区也在观望。真正值得盯的是它后续会不会放出可复现的实验,如果只是概念页,那热闹就白看了。

读原文 ↗导出 Markdown