# 摩尔线程开源 MusaCoder，用国产 GPU 集群训练出能自动写底层算子代码的模型

> 原标题：摩尔线程开源 MusaCoder 代码大模型，9B/27B 参数基于国产 GPU 全链路训练

- 来源：AI HOT 精选
- 发布时间：2026-06-10T08:21:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37324
- 原文：https://www.ithome.com/0/962/509.htm

## 摘要

摩尔线程放出了 MusaCoder，一个专门用来生成 GPU 底层算子代码的模型，有 9B 和 27B 两个版本。它的完整训练流程全跑在自家的 MTT S5000 集群上，没依赖国外硬件。这个模型的作用是，你给它一个 PyTorch 的标准算子，它能自动写出对应的 CUDA 或 MUSA 原生高性能代码，省去手写底层代码的麻烦。在 KernelBenc...

## 推荐理由

摩尔线程开源了 MusaCoder，一个用自家 MTT S5000 集群从头训练的代码模型，专门把 PyTorch 标准算子自动转成 CUDA 或 MUSA 原生高性能代码。这件事的看点在于全链路国产化——芯片、训练、模型输出都是自己的，不是拿开源模型微调。我会先打个折：正文没披露训练成本、数据规模和具体延迟，KernelBench 的分数也没给全，所以性能到底多强还不好说。但如果是真的，对做国产 GPU 算子开发的人挺省钱。

## 锐评

MusaCoder 做的事很直接：你给它一个 PyTorch 的标准算子，它帮你把对应的 CUDA 或摩尔线程自家的 MUSA 高性能代码写出来，省去手写底层指令的麻烦。模型有 9B 和 27B 两个尺寸，论文和权重都公开了。

比较硬的一点是，它的完整后训练流程全在国产 MTT S5000 集群上完成，没依赖英伟达硬件。官方给出的 KernelBench 跑分里，27B 强化学习版 Overall Pass@8 到了 93.2%，声称超过了 Claude Opus 4.7 和 DeepSeek-V4 Pro。但这个 KernelBench 是专门测 GPU 算子生成的基准，不代表通用编程能力，而且正文没披露对比时其他模型的采样参数和提示词是否统一，这点需要看论文才能确认。

对做底层 AI 编译和算子开发的人来说，这是个值得跑一下的模型。但它的实际可用性还缺一手信息：生成的代码在真实业务场景下的正确率和加速比到底怎么样，正文没提。
