蚂蚁周俊:万亿模型跑15分钟烧掉一辆特斯拉,他们用“Token密度”把长文本成本从指数压到线性
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先
蚂蚁集团副总裁周俊在AICon上算了一笔账:万亿参数模型每跑15分钟,算力成本就抵得上一辆特斯拉。团队不再拼Token数量,转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构,把256K长上下文的计算开销从指数级拉回到线性级,省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...
推荐理由:周俊在AICon上的演讲不是画饼,而是算了一笔实打实的成本账,并给出了一个具体的架构方案来降本。那个“15分钟一辆特斯拉”的比喻让成本问题变得很直观,混合线性注意力的设计也有干货。但这是演讲复盘,不是产品发布或开源,没有真实场景的验证数据,所以分数卡在featured门槛上,不往上拔了。