# EMO：让专家模型自己长出模块，用八分之一专家就能干活

> 原标题：EMO：为涌现模块化预训练的专家混合模型

- 来源：AI HOT 精选
- 发布时间：2026-05-08T16:03:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16425
- 原文：https://huggingface.co/blog/allenai/emo

## 摘要

AllenAI 放出了一个叫 EMO 的混合专家模型（MoE），总参数量 140 亿，每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科（比如数学、代码）去分专家，而是让模型自己从 1 万亿 token 的数据里长出模块。结果是，跑特定任务时你只用挑出 12.5% 的专家，性能就接近全模型水平；而同样架构、同样数据训出来的普通 MoE...

## 推荐理由

AllenAI 和 Hugging Face 放出的 EMO，是个 14B 总参数、1B 活跃参数的 MoE 模型，用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家，推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节，这点先别太激动。它更像一个研究发布，不是前沿模型发布，所以给 featured 低档。

## 锐评

AllenAI 放出的 EMO 模型，核心卖点是让混合专家模型（MoE）的专家模块自己从 1 万亿 token 的数据里“长”出来，而不是按人类划好的数学、代码等学科去分。结果是，跑特定任务时你只用挑出 12.5% 的专家，性能就接近全模型水平。这听着挺省钱，因为总参数 140 亿，每次推理只激活 10 亿，再砍掉大部分专家，推理成本能压得很低。

但文章没给出具体任务上的性能对比数字，只说“接近全模型水平”，这个“接近”到底差多少，在哪些基准上测的，都没提。另外，它强调专家没按人类学科分工，那这些自己长出来的模块到底专精什么，文章只说标准 MoE 专家常去学介词、标点这类低层模式，EMO 的专家是不是真学到了更高层的技能，还得看后续验证。

目前放出了模型、技术报告和可视化工具，代码也在 GitHub 上。想试用的可以直接去 Hugging Face 拉模型，但建议先在自己关心的任务上跑一下，看看那 12.5% 的专家子集到底能不能打。
