# 蚂蚁百灵开源三款新模型，用混合注意力架构把推理速度拉到 340 tokens/s

> 原标题：蚂蚁百灵发布 Ling & Ring 2.6 技术报告

- 来源：AI HOT 精选
- 发布时间：2026-06-16T02:23:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38500
- 原文：https://mp.weixin.qq.com/s/j8ZXKvDZzMkSSiUyXecqGA

## 摘要

蚂蚁百灵发了 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的技术报告，代码和权重都公开了。三款模型用了同一种 Hybrid Linear Attention 架构，把 Lightning Attention 和 MLA 按 7:1 的比例拼在一起，主要为了在长文本上跑得快、省资源。Ling-2.6-flash 在 ...

## 推荐理由

蚂蚁百灵这次开源了三款模型，核心卖点是把 Lightning Attention 和 MLA 按 7:1 的比例揉成一个 Hybrid Linear Attention，主要为了在长文本上省资源、跑得快。报告给了具体参数和效率数据，代码权重都公开，信息扎实，所以给了 featured。没打更高是因为蚂蚁的模型在社区关注度上还比不上那几个顶流实验室，实际业务里的表现也得再观察，我会先打个折。

## 锐评

这次蚂蚁百灵公开的技术报告挺实在，把Ling-2.6-flash、Ling-2.6-1T和Ring-2.6-1T的架构、训练流程和Agent强化学习细节都摊开了。三款模型用的都是Hybrid Linear Attention，简单说就是把Lightning Attention和MLA（多头潜在注意力）按7:1的比例拼在一起，目的是在处理长文本时既省显存又跑得快。Ling-2.6-flash在4块H20显卡上解码速度到了340 tokens/s，这个数字对需要低延迟的线上业务比较友好。Ling-2.6-1T在Artificial Analysis Intelligence Index上的token效率比前代提升了约4倍，说明训练时用更少的算力就能达到相近效果，但报告正文没披露具体的训练总成本和数据规模，这点先别太激动。Ring-2.6-1T high在PinchBench拿了87.60，ClawEval得了63.82，这两个分数在同类开源模型里算能打，不过报告没给出和同尺寸竞品的横向对比，也没说明这些评测任务和实际业务场景的对应关系。代码和权重都公开了，后续可以自己跑一下验证。
