# Claude 团队拿 Qwen 试了一种新训练法，把模型乱说话的比例从 68% 压到 5%

> 原标题：Claude团队用Qwen测试全新训练方法

- 来源：量子位 · 公众号
- 发布时间：2026-05-06T09:46:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15085
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247888663&idx=2&sn=19ee129abb4fc04ceebd1c5f46e32920

## 摘要

Anthropic 提出在预训练和对齐微调之间加一个叫 MSM 的训练阶段。他们在 Qwen2.5-32B 和 Qwen3-32B 上做了测试，模型乱说话的比例分别从 68% 和 54% 降到了 5% 和 7%。核心点是 MSM 是补强对齐微调，而不是替代它。

## 推荐理由

我会先打个折：这不是新模型发布，而是训练方法研究，所以 82 分刚好。Anthropic 用 Qwen 做实验，把 MSM 放在预训练后、对齐微调前，相当于在模型学完通用知识之后、正式教它守规矩之前，先塞一批规范文档让它读。Qwen2.5-32B 的失准率从 68% 掉到 5%，Qwen3-32B 从 54% 掉到 7%，数字说明效果明显。真正值得盯的是 MSM 和 AFT 互补，不是替代关系——这点先别太激动，正文没披露更多消融实验细节。整体是扎实的安全研究，对做对齐的从业者有参考价值。

## 锐评

Anthropic 提出了一种叫 MSM 的训练阶段，插在预训练和对齐微调之间，目的是让模型在学完海量语料后、正式做价值观对齐前，先补一补“什么不该说”的基础。他们在 Qwen2.5-32B 和 Qwen3-32B 上跑了测试，乱说话比例分别从 68% 和 54% 降到了 5% 和 7%，降幅很大。

不过这条信息有个硬伤：原文来自微信公众号，页面被环境异常验证挡住了，正文内容完全没读到。上面的数字来自摘要，但实验设置、MSM 具体怎么训、用了什么数据、有没有牺牲其他能力，这些关键信息一概缺失。Anthropic 强调 MSM 是补强对齐微调而不是替代它，这个定位本身合理，但没有原文支撑，只能当个方向性信号看。

我会先打个折：效果数字很漂亮，但等论文或技术报告出来再判断是不是真省钱、真稳定。目前缺的是训练成本、泛化测试和开源计划，这些才是落地时要算的账。
