算力最优不等于集群最优:MoE 架构怎么选,得看真实集群能跑多快
Compute-Optimal Is Not Cluster-Optimal
Sheng Zha 的新论文 MOSAIC 把系统性能直接塞进了缩放法则里。以前的做法是先按理论算力预算挑架构,再交给系统团队去调优,但集群计费看的是 GPU 小时,不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现:如果只看理论算力,稀疏度越高越好,最优解会被推到搜索边界。但在真实的 512 张 GPU 集群上,...
推荐理由:Sheng Zha 这篇 MOSAIC 干了一件很实际的事:把集群的真实开销塞进缩放法则里重新算一遍。以前大家先按理论算力挑架构,再丢给系统团队去调优,但集群计费看的是 GPU 小时,不是理论浮点运算次数。他们在约 150 次 MoE 预训练实验上拟合出联合缩放法则后发现:如果只看理论算力,稀疏度越高越好,最优解会被推到搜索边界;但在真实的 512 张 GPU 集群上,通信开销和低利用率会把最优稀疏度往回拉一大截。这个结论对做预训练预算的人挺有用——选架构时就得把系统效率算进去,不然账单会教你做人。信息量扎实,实验规模也够,不是纯理论炫技。分数给 ...