# Anthropic 参与的研究登上 Nature：大模型会通过数据里的隐藏信号“偷偷”传递偏好或对齐问题

> 原标题：Research we co-authored on subliminal learning—how LLMs can pass on traits like preferences or misalignment through…

- 来源：X · @AnthropicAI
- 发布时间：2026-04-15T19:09:31.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3238
- 原文：https://x.com/AnthropicAI/status/2044493337835802948

## 摘要

Anthropic 在 X 上说，他们参与的一项关于“潜意识学习”的研究今天发在 Nature 上了。核心结论是，大模型能通过训练数据中藏着的信号，把偏好、不对齐这类“特质”传下去。帖子只给了一句话和论文链接，没提实验用了什么规模的模型、具体怎么设计的、效果有多强。对从业者来说，关键的可复现细节正文都没披露，这点先别太激动。

## 推荐理由

Anthropic 发了篇 Nature 论文，说大模型能从训练数据的隐藏信号里学到偏好甚至失配倾向，他们管这叫“潜隐学习”。这个方向挺有意思，因为它把对齐风险从“人写了什么指令”挪到了“数据里藏了什么没说的东西”。不过现在能看到的只有一条推文和论文链接，实验怎么做的、用了多大的模型、效果有多显著，正文一概没给。我会先打个折——概念新颖，但信息缺口太大，暂时只能当个值得盯的信号，别急着下结论。

## 锐评

Anthropic 参与的一项研究今天发在 Nature 上，核心结论是大模型能从训练数据中“偷学”到一些隐藏信号，把偏好、不对齐这类特质传下去。他们管这叫“潜意识学习”。帖子本身信息量极低，只有一句话加一个论文链接，没提用了什么规模的模型、实验怎么设计的、效果有多强。对从业者来说，关键的可复现细节正文都没披露，这点先打个折。

从安全对齐的角度看，这个方向确实值得关注——如果模型真能从数据里学到你没打算教它的东西，那数据清洗和偏好注入的假设就得重新审视。但 Nature 发论文不代表结论就铁板钉钉，还得看实验设置是否贴近真实训练场景、信号强度在多大样本下才生效。这些正文都没说，只能等读论文再判断。
