跳到正文
X · @AnthropicAI

Anthropic 参与的研究登上 Nature:大模型会通过数据里的隐藏信号“偷偷”传递偏好或对齐问题

Research we co-authored on subliminal learning—how LLMs can pass on traits like preferences or misalignment through…

Anthropic 在 X 上说,他们参与的一项关于“潜意识学习”的研究今天发在 Nature 上了。核心结论是,大模型能通过训练数据中藏着的信号,把偏好、不对齐这类“特质”传下去。帖子只给了一句话和论文链接,没提实验用了什么规模的模型、具体怎么设计的、效果有多强。对从业者来说,关键的可复现细节正文都没披露,这点先别太激动。

推荐理由:Anthropic 发了篇 Nature 论文,说大模型能从训练数据的隐藏信号里学到偏好甚至失配倾向,他们管这叫“潜隐学习”。这个方向挺有意思,因为它把对齐风险从“人写了什么指令”挪到了“数据里藏了什么没说的东西”。不过现在能看到的只有一条推文和论文链接,实验怎么做的、用了多大的模型、效果有多显著,正文一概没给。我会先打个折——概念新颖,但信息缺口太大,暂时只能当个值得盯的信号,别急着下结论。

读原文 ↗导出 Markdown