# 首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布

> 原标题：首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布

- 来源：AI HOT 精选
- 发布时间：2026-05-22T14:36:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25648
- 原文：https://x.com/rohanpaul_ai/status/2057833050692800926

## 摘要

ModelBest、清华和OpenBMB搞了个BitCPM-CANN，从0.5B到8B都有，全程用华为昇腾910B NPU训练，没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值，内存比BF16省了约6倍，能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%，这点挺实在。我会先打个折：正文没披露具体推理延迟和功耗数据，也...

## 推荐理由

HKR三项都站得住：昇腾910B全栈训练1.58比特开源模型这个角度够新，数据也扎实。没给P1是因为目前只有发布事实，缺少独立复现或实际落地效果的佐证，所以先放在featured。

## 锐评

这条消息的看点不是1.58比特量化本身——三元权重（每个参数只取-1、0、+1三种值）在学术圈不算新——而是整个训练栈都跑在华为昇腾910B NPU上，从量化算子到框架都是原生构建，没走英伟达CUDA生态的移植路线。这对国内算力自主可控的叙事有直接支撑。模型家族覆盖0.5B到8B，内存比BF16省了约6倍，塞进手机、车载设备跑确实有想象空间。基准测试保住了全精度模型的95-97%，这个数字看着不错，但正文没披露具体用了哪些benchmark、对比的baseline是什么版本，也没给推理延迟和端侧功耗数据。1.58比特模型在边缘设备上跑得快不快、烫不烫手，才是工程落地要回答的核心问题。另外，训练数据来源、清洗流程和许可证也没提，开源了代码和权重，但复现链条还不完整。整体看，这是一次硬件生态+模型架构的联合站队，技术验证意义大于即战力。
