# 腾讯混元开源 AngelSpec，让大模型推理速度翻倍，草稿模型权重也一并放出

> 原标题：腾讯混元开源 AngelSpec 投机解码框架

- 来源：AI HOT 精选
- 发布时间：2026-07-29T12:43:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47390
- 原文：https://x.com/TencentHunyuan/status/2082447023626944936

## 摘要

腾讯混元把投机解码框架 AngelSpec 完整开源了，训练和部署代码都有。在自家的 Hy3-A21B 模型上，用 DFly 方案跑出了端到端 1.98 到 2.4 倍的加速，比自回归解码快了一倍多；跟 DFlash 比，吞吐量也高出 10.5% 到 11.8%。简单说就是让模型一边猜一边验证，用一个小草稿模型先快速生成候选结果，再由大模型把关，省时又...

## 推荐理由

腾讯混元把 AngelSpec 完整开源，附带训练和部署代码，在 Hy3-A21B 上端到端加速 1.98-2.4 倍，吞吐量比 DFlash 高 10% 以上。投机解码是当前推理优化的热门方向，一个完整的开源方案对做部署的人很有参考价值，但话题偏技术优化，普通从业者不一定直接感受到影响。

## 锐评

腾讯混元这次把投机解码的整套东西都放出来了，不只是论文，训练和部署代码、草稿模型权重全有。在 Hy3-A21B 这个 210 亿参数的模型上，用他们自己的 DFly 方案，端到端加速做到了 1.98 到 2.4 倍，比普通自回归解码快了一倍多。跟另一个方案 DFlash 比，吞吐量也高出 10.5% 到 11.8%。投机解码的原理不复杂，就是让一个小草稿模型先快速猜一串结果，大模型再一次性验证，猜对了就省时间，猜错了就扔掉重来。

数字看着不错，但得注意几点。加速比是在他们自家的模型和方案上测的，换别的模型、别的硬件能跑出多少还不清楚。正文没披露测试用的 GPU 型号和批次大小，这些对实际部署影响很大。另外，草稿模型本身也要占显存，小团队用的时候得算算这笔账。

还缺一些关键信息：草稿模型的接受率是多少，猜对的概率高不高直接决定加速效果稳不稳；不同任务类型下表现差异大不大，比如长文本生成和短对话可能完全两回事。这些数据有了，才能判断这框架是不是真能在生产环境省钱。
