# 算力最优不等于集群最优：MoE 架构怎么选，得看真实集群能跑多快

> 原标题：Compute-Optimal Is Not Cluster-Optimal

- 来源：Hacker News 首页
- 发布时间：2026-08-13T17:40:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50538
- 原文：https://szha.ai/blog/compute-optimal-is-not-cluster-optimal/

## 摘要

Sheng Zha 的新论文 MOSAIC 把系统性能直接塞进了缩放法则里。以前的做法是先按理论算力预算挑架构，再交给系统团队去调优，但集群计费看的是 GPU 小时，不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现：如果只看理论算力，稀疏度越高越好，最优解会被推到搜索边界。但在真实的 512 张 GPU 集群上，...

## 推荐理由

Sheng Zha 这篇 MOSAIC 干了一件很实际的事：把集群的真实开销塞进缩放法则里重新算一遍。以前大家先按理论算力挑架构，再丢给系统团队去调优，但集群计费看的是 GPU 小时，不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现：如果只看理论算力，稀疏度越高越好，最优解会被推到搜索边界；但在真实的 512 张 GPU 集群上，通信开销和低利用率会把最优稀疏度往回拉一大截。这个结论对做预训练预算的人挺有用——选架构时就得把系统效率算进去，不然账单会教你做人。信息量扎实，实验规模也够，不是纯理论炫技。分数给 ...

## 锐评

Sheng Zha 这篇新论文 MOSAIC 的核心判断很直接：以前挑模型架构只看理论计算量（FLOPs），但集群计费看的是 GPU 小时，这两个数经常对不上。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则，发现如果只盯着理论算力，稀疏度越高预测损失越低，最优解会被推到搜索边界，等于没给出有效建议。但把同样的候选架构放到 512 张 GPU 的真实集群上跑，最稀疏的设计反而是最慢的，墙钟时间比最密集的设计慢了 1.70 倍。

MOSAIC 的做法是把“可交付算力”作为预算，同时优化模型架构、训练数据量和分布式并行策略。博客里举了个具体例子：在四台 p6-B200 节点上跑五天，稀疏度超过约 0.96 的配置根本跑不完自己配方所需的算力，边界最优解在物理上不可行。

这篇博客是论文的通俗版介绍，没给出联合缩放法则的具体拟合公式和误差范围，也没讨论不同集群规模下结论的稳定性。如果要在自己的硬件上复现这套思路，还需要看原论文里的算子级性能模型和并行布局搜索的具体实现。
