一台 PC 工作站上的 13 小时训练实验:为什么做优化的前提是测量?
Zach Mueller 在一台装了 4 张 RTX PRO 6000 的 PC 工作站上,把一个 500M 参数的 MoE 模型训练时间从单卡估算的 62 小时压到了四卡 13.2 小时。他没靠猜,全程用 PyTorch Profiler 找瓶颈:单卡时数据加载和框架开销占了约 8% 的步长时间,靠预分词、固定内存和融合优化器降到 43 小时;上四卡...
推荐理由:一个扎实的工程优化案例,从 62 小时压到 13.2 小时全程靠测量驱动,不是凭感觉调参。我会先打个折:这是个人博客的实验,不是官方基准,但数据够具体,对正在折腾本地训练的人有直接参考价值。