# OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit，8B 模型性能保住全精度 97%

> 原标题：BitCPM-CANN: Native 1.58-Bit Large Language Model Training on Ascend NPU

- 来源：r/LocalLLaMA
- 发布时间：2026-05-24T15:24:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/26457
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tmf63y/bitcpmcann_native_158bit_large_language_model/

## 摘要

OpenBMB 放出了 BitCPM-CANN，一个在华为昇腾 NPU 上原生跑通的 1.58-bit（三值）大模型训练方案。他们用和 MiniCPM4 一样的架构与数据，从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能，3B 版本在 BBH 上打平，3B...

## 推荐理由

我会先打个折：目前只有 Reddit 帖子作为来源，没有吞吐量、显存占用或复现细节，所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型，不是推理时量化，而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上，说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说，这是个值得跟的信号。

## 锐评

这条消息值得点开看，因为它解决了一个很实际的问题：不用英伟达显卡，能不能做极低比特训练。OpenBMB 把之前 GPU 上的方案搬到了华为昇腾 NPU，用和 MiniCPM4 一样的架构和数据，从零训了四个尺寸的三值模型。1B 到 8B 的版本在 11 个测试集上平均保住全精度 95.7% 到 97.2% 的性能，3B 版本在 BBH 上甚至打平，训练吞吐只从 155 TFLOP/s 降到 148，多了 4.5% 的开销。推理时权重内存能省到原来的八分之一，端到端大概省六倍。

不过现在能看到的只有 Reddit 帖子和一篇 PDF，官方还没发正式公告。帖子里也没给出具体定价、API 开放时间或者模型权重下载后的实际跑分体验。另外 0.5B 版本数学掉得比较明显，只保住 90.1%，论文自己也说这是容量瓶颈而非量化器的问题，小尺寸模型在复杂推理上还是吃力。

还缺的东西：在更多国产硬件上的复现结果、长文本和代码生成这类更贴近实际使用的评测，以及社区拿到权重后的真实反馈。如果后续能补上这些，这条“标题新闻”才算真正落地。
