# DeepSeek V4 推迟发布，重写底层代码，就为了跑在华为昇腾 950PR 上

> 原标题：DeepSeek 下一代模型 V4 将跑在华为芯片上。

- 来源：X · @dotey（宝玉）
- 发布时间：2026-04-04T01:14:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3626
- 原文：https://x.com/dotey/status/2040236453528064241

## 摘要

V4 跳票了几个月，原因是 DeepSeek 把模型底层模块重写了一遍，专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上，预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍，有 112GB 显存，带宽 1.4TB/s，还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用，一个原本...

## 推荐理由

这条消息 H、K、R 都站得住：华为芯片部署是强钩子，底层重写和芯片规格有料，国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道，模型规模、价格和实测性能都没披露，我会先打个折。

## 锐评

这条消息的核心不是 V4 本身有多强，而是 DeepSeek 把模型底层模块重写了一遍，专门适配华为昇腾 950PR 和寒武纪硬件，并且没给英伟达早期访问权限。这意味着国产芯片在推理环节第一次拿到了前沿模型的独家适配机会，不再是跟在英伟达后面捡漏。

昇腾 950PR 的纸面参数挺好看：单卡算力号称是 H20 的 2.87 倍，112GB 显存，1.4TB/s 带宽，还是国内唯一支持 FP4 推理的芯片。FP4 的好处很实在——一个原本要 140GB 显存的 700 亿参数模型，压缩到 35GB 就能跑，同样的卡能塞更大的模型或者扛更多并发。但代价是功耗 600W，差不多是 H20 的两倍，电费和散热成本会直接反映到推理价格上。

不过这里有几个关键信息缺口。第一，V4 的参数量和实测 benchmark 都没披露，说能和 Claude、ChatGPT 掰手腕还只是传闻。第二，金融时报之前报道过 DeepSeek 用昇腾芯片训练 R2 时反复翻车，稳定性差、芯片间互联慢、软件工具链不成熟，最后训练还是退回英伟达。这次 V4 只说了推理跑在华为芯片上，训练环节是不是也搞定了，正文没提。第三，FP4 推理虽然省显存，但精度损失到底多大、对长上下文编程这类任务有没有影响，也没有实测数据。所以这件事方向是对的，但离"推理环节国产替代"真正落地，还得看 V4 发布后的实际跑分和价格。
