# 蚂蚁周俊：万亿模型跑15分钟烧掉一辆特斯拉，他们用“Token密度”把长文本成本从指数压到线性

> 原标题：蚂蚁集团周俊AICon演讲：从Token数量到Token密度，万亿参数模型效率优先

- 来源：AI HOT 精选
- 发布时间：2026-07-08T01:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43006
- 原文：https://mp.weixin.qq.com/s/dsIfi4C-T5Q4emmIh-7yzg

## 摘要

蚂蚁集团副总裁周俊在AICon上算了一笔账：万亿参数模型每跑15分钟，算力成本就抵得上一辆特斯拉。团队不再拼Token数量，转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构，把256K长上下文的计算开销从指数级拉回到线性级，省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...

## 推荐理由

周俊在AICon上的演讲不是画饼，而是算了一笔实打实的成本账，并给出了一个具体的架构方案来降本。那个“15分钟一辆特斯拉”的比喻让成本问题变得很直观，混合线性注意力的设计也有干货。但这是演讲复盘，不是产品发布或开源，没有真实场景的验证数据，所以分数卡在featured门槛上，不往上拔了。

## 锐评

周俊在 AICon 上给了一个很直观的比喻：万亿参数模型跑 15 分钟，算力成本抵一辆特斯拉。这个说法把大模型烧钱的程度讲清楚了。他们没去继续堆 Token 数量，而是提了一个“Token 密度”的概念，核心是让模型少说废话、多干正事。

技术实现上，他们用 7 份 Lightning Attention 加 1 份 MLA 搭了一套混合线性注意力架构，把 256K 长上下文的计算开销从指数级拉回到线性级。省下来的算力可以留给推理环节。Kpop 算法把工具调用的 Token 和自然语言 Token 分开处理，再配合思维链剪枝和自蒸馏，Token 输出量减少约 4 倍，但能力没降。千亿参数模型在 BFCL 等 Agent 基准上跑赢了部分更大的模型，小模型 flash 吞吐提到 2.4 倍，五轮对话成本降了 10 倍以上。

这些数字如果属实，对做 Agent 落地的人挺有吸引力，尤其是长上下文和工具调用频繁的场景。但正文没披露具体测试环境、对比基线的细节，也没看到开源权重或第三方验证。演讲里的数据先打个折看，等有公开复现报告再下结论。
