# Meta 用 GPT、Claude 和 Llama 自动写底层算子，开发时间从几周缩到几小时，部分性能比 PyTorch 基线快 17 倍

> 原标题：Import AI 439: AI kernels; decentralized training; and universal representations

- 来源：Import AI
- 发布时间：2026-01-05T13:32:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3533
- 原文：https://jack-clark.net/2026/01/05/import-ai-439-ai-kernels-decentralized-training-and-universal-representations/

## 摘要

Meta 公开了一套叫 KernelEvolve 的系统，专门自动生成和优化 AI 底层算子（kernel），用来在自家不同芯片上跑推荐模型、服务广告。它会接收需求，然后调用内部和外部的大模型（Llama、GPT、Claude）生成候选算子，通过验证后把好的结果存进知识库，让后续生成越来越准。Meta 说这套系统把新算子的开发时间从几周压到了几小时，生...

## 推荐理由

我会先打个折：这是 newsletter 对技术工作的转述，不是一篇独立论文，所以停在 80 分。但 HKR 三项都站得住——让模型写算子这件事本身就新鲜，数字和流程交代得够具体，去中心化训练那条线又直接碰到算力成本和权力集中的神经。正文说去中心化训练按每年 20 倍在涨，但跟前沿训练还差约 1000 倍，这点先别太激动，差距能不能继续缩小才是政策影响的关键。

## 锐评

Meta 公开的 KernelEvolve 系统，核心是把写算子这件事自动化了。它接收需求，调用内外多个大模型生成候选代码，跑验证后把好结果存进知识库，让后续生成越来越准。Meta 说这套系统已经在生产环境里持续运行，覆盖 NVIDIA、AMD 和自家 MTIA 芯片，服务几百个模型、每天几十亿用户。最直接的效果是省钱：算子开发从几周缩到几小时，部分场景性能比 PyTorch 基线高出 17 倍。

但得看清楚，这是 Meta 在自家广告推荐场景下的优化，不是通用工具。论文里提到的 KernelBench 满分，是在一个 250 题的公开测试集上拿的，不代表所有场景都能复现。另外，系统依赖 GPT 和 Claude 这些外部模型，正文没披露调用成本和延迟，也没说如果外部模型挂了有没有降级方案。

真正值得盯的信号是“持续自优化的基础设施”。Meta 描述的是一个不停机、自己迭代的优化循环，边际性能提升直接换算成百万美元级的成本削减和广告收入增长。如果这套思路扩散到其他大厂，AI 基建的竞争会从拼模型转向拼底层效率。至于去中心化训练那部分，Epoch AI 的分析说它每年增长 20 倍，但算力规模仍比前沿训练小约 1000 倍，差距在缩小，但还没到能威胁集中式训练的份上。
