# 马斯克 55 万张英伟达 GPU 的集群，实际有效利用率只有 11%

> 原标题：大型挂机现场：马斯克的55万英伟达GPU，利用率才11%

- 来源：机器之心 · 公众号
- 发布时间：2026-05-05T03:59:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14917
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031346&idx=2&sn=868e92d74f06c9a2d5cdb11adaed90e1

## 摘要

The Information 的报道说，xAI 手里大概 55 万张英伟达 GPU，但模型浮点运算利用率（MFU）只有 11%，折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比，Meta 的利用率是 43%，Google 是 46%。不过原文因为微信环境验证失...

## 推荐理由

这篇不是模型发布或产品更新，是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人，再加上Meta和Google的43%、46%做参照，信息密度高。我会先打个折：正文没披露xAI具体怎么算的MFU，也没说这个11%是瞬时值还是长期均值，但瓶颈拆解（HBM、跨节点通信、软件栈）让文章站得住脚，所以给到82分。

## 锐评

xAI手里55万张英伟达GPU，模型浮点运算利用率（MFU）只有11%，折算下来真正在跑训练的就6万张左右。这个利用率低得离谱，Meta是43%，Google是46%，xAI连人家四分之一都不到。报道把原因归结为显存读写慢、服务器之间通信拖后腿、训练时空等和软件栈不统一。这些确实是分布式训练的老大难，但55万张卡同时踩坑，说明工程整合出了大问题。

不过得打个折：原文因为微信环境验证失败，我实际没看到完整内容，只能根据摘要判断。The Information的报道通常靠谱，但具体数据采集方式和对比口径都没披露。比如MFU是峰值算力还是持续算力算的，训练什么规模的模型，这些都会影响数字。另外11%是某个时间点的快照还是长期平均，也没说清楚。

如果这个数字属实，xAI的算力成本效率就太差了。但更值得追问的是：他们到底在训什么模型需要55万张卡，以及这个利用率是工程能力问题，还是架构选择导致的必然代价。
