# 港中文新优化器 Pion 在“等谱流形”上更新大模型，解决 AdamW 和 Muon 训练崩溃问题

> 原标题：AdamW和Muon的失稳根源有解了，港中文新优化器Pion：在等谱流形上更新大模型

- 来源：机器之心 · 公众号
- 发布时间：2026-05-30T02:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30673
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651035907&idx=3&sn=65acfbec433231599b75c459972619e2

## 摘要

香港中文大学等团队搞了个新优化器叫 Pion，核心思路是不动权重矩阵的奇异值，只在“等谱流形”上做正交等价变换来更新参数。他们拿一个 6000 万参数、没用归一化层的类 LLaMA 模型试跑，Pion 稳定训练了 96 亿个 token，而 AdamW 和 Muon 都崩出 NaN 了。正文没披露更大规模模型或具体下游任务上的效果，所以这点先别太激动，...

## 推荐理由

我会先打个折：这篇是优化器数学，不是产品发布，所以分数在 78–84 之间。但它的钩子很直接——AdamW 和 Muon 会训崩，而 Pion 用“在等谱流形上更新”这个思路稳住了。正文给了 60M 模型、9.6B token 的无归一化实验，证明能避免 NaN，这对做训练的人有实际参考价值。信息量够，痛点准，所以 HKR 全过。

## 锐评

这条新闻讲的是港中文等团队的新优化器 Pion，它换了个思路：更新模型参数时不动权重矩阵的奇异值，只在“等谱流形”上做正交等价变换。打个比方，就像拧魔方，只转面不拆块，保持整体结构不乱。他们拿一个 6000 万参数、没用归一化层的类 LLaMA 模型试跑，Pion 稳定训练了 96 亿个 token，而 AdamW 和 Muon 都崩出 NaN 了。这个对比挺直观，说明 Pion 在抑制训练不稳定上确实有东西。

但正文没披露更大规模模型或具体下游任务上的效果。6000 万参数在现在的大模型语境里算很小的，能不能 scale up 到几十亿、几百亿参数，以及去掉归一化层后在实际任务上表现如何，都还是未知数。另外，文章也没提训练速度、显存开销这些工程指标，光看稳定性不够。

如果后续能在更大模型上复现，并且证明去掉归一化层能省算力或简化架构，那这条才值得认真看。现在只能说在小模型上开了个好头，别急着下结论。
