# 华为搞了个 HiFloat4 训练格式，在自家昇腾芯片上跑赢了西方主导的 MXFP4

> 原标题：Import AI 454: Automating alignment research; safety study of a Chinese model; HiFloat4

- 来源：Import AI
- 发布时间：2026-04-20T12:30:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10419
- 原文：https://jack-clark.net/2026/04/20/import-ai-454-automating-alignment-research-safety-study-of-a-chinese-model-hifloat4/

## 摘要

华为的研究员在自家昇腾 NPU 上测试了一种叫 HiFloat4 的 4 比特训练格式，跟西方主导的 MXFP4 格式比，HiFloat4 的精度损失更小。具体来说，在 Llama 和 Qwen 模型上，HiFloat4 跟全精度 BF16 基准的误差能控制在 1% 左右，而 MXFP4 即使加了随机舍入等一堆稳定技巧，误差也有 1.5%。这背后可能跟...

## 推荐理由

Jack Clark用三件事拼出一期：Anthropic拿Claude Opus 4.6做自动化对齐研究，800小时花约1.8万美元把PGR从人类基线0.23提到0.97，说明小团队也能跑对齐实验；HiFloat4在华为昇腾NPU上推理损失约1.0%，比MXFP4的约1.5%好，但正文没披露更多硬件细节；中国模型安全研究部分给出了安全评估框架，但具体模型名和测试集没展开。整体是研究评论而非一手发布，信息密度够，适合放进精选。

## 锐评

这条新闻最值得看的是 Anthropic 让 Claude Opus 4.6 自己去跑对齐实验，结果把人类研究员一周才做到 0.23 的 PGR 直接干到了 0.97。800 小时总耗时、1.8 万美元总花费，摊下来每小时才 22 美元，比雇人便宜太多。但先别急着喊“AI 研究员已上岗”——测试范围很窄，只在 Qwen 3-4B 和 Qwen 1.5-0.5B 这对弱监督强模型上跑通，数学任务 PGR 0.94 还行，代码任务掉到 0.47，说明泛化能力还差一截。正文没披露这些 AI 研究员产出的方法到底有没有新意，还是只是暴力搜索已有技巧的组合。另外，华为 HiFloat4 那条也值得留意：在自家昇腾 NPU 上把 4 比特训练误差压到 BF16 基准的 1% 左右，比西方主导的 MXFP4 的 1.5% 更优。这背后是出口管制逼出来的效率焦虑，但论文只测了三个模型，最大才 30B MoE，离证明大规模可用还有距离。
