# 腾讯推出MoT架构，2B参数的具身模型在22项评测里拿了16项第一

> 原标题：MoE不够看了，腾讯推出MoT：2B具身模型22项评测16项最佳

- 来源：量子位 · 公众号
- 发布时间：2026-04-09T04:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6231
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247881936&idx=3&sn=f0d96438cc47c19e904c2a1fa200259a

## 摘要

腾讯混元与Robotics X联合发布了HY-Embodied-0.5，核心是一个叫MoT-2B的模型。它总参数量4B，实际干活时只激活2B，在22项具身智能评测中拿了16项第一。训练数据量不小：用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本，还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

## 推荐理由

我会先打个折：这还是一次模型发布，不是那种当天就改变行业格局的大事，所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身，而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项，数字和训练细节也给得实在。对做端侧机器人的从业者来说，这套专门为具身重做的架构和训练链路比通用模型微调有意思得多，所以 H、K、R 都站得住。

## 锐评

腾讯混元和Robotics X联合放出的HY-Embodied-0.5，核心是一个叫MoT-2B的模型。总参数量4B，实际推理时只激活2B，在22项具身智能评测里拿了16项第一。这个成绩挺亮眼，但先打个折——原文被微信验证页挡住了，评测细节、任务类型、对比基线这些关键信息都没法核实。

从摘要看，技术栈不是简单拿视觉语言模型微调，而是重新搭了一套面向边缘设备的具身方案。训练数据量不小：超1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本，还用了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这些技术名词堆在一起，说明团队在压缩模型体积和保持性能之间做了不少工程活。

缺的东西也很明显：没看到实际机器人上的部署效果，不知道2B参数在真实硬件上的延迟和功耗表现。22项评测的具体内容、对手模型是谁、评测环境是仿真还是真机，这些都没披露。另外，MoT相比MoE到底在具身场景下有什么独特优势，摘要里也没说清楚。这些信息缺口让“16项第一”的含金量暂时只能打个问号。
