# 华为泰勒实验室等提出 SHAPE，给大模型推理加一道“推理税”，答得更准还能少写废话

> 原标题：ACL 2026｜答得更准还写得更短？华为泰勒实验室提出SHAPE，给LLM推理装了个「推理税」

- 来源：机器之心 · 公众号
- 发布时间：2026-04-28T07:41:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11352
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651030763&idx=3&sn=df1ef8d5322e93d1ea0856799361b4ea

## 摘要

华为泰勒实验室、北大和上海财大在 ACL 2026 发了一篇论文，提出 SHAPE 方法，核心思路是给模型的长篇推理加一道“推理税”。具体做法是：先用熵值把推理过程切成段，再用短距离试探估算每段的潜力，然后对后期又长又没带来实质进展的段落做动态长度打折，最后把奖励分配到每个 token 上。结果平均准确率涨了约 3%，同时 token 用量砍了约 30...

## 推荐理由

这篇论文最抓人的地方不是那 3% 的准确率提升，而是它把“模型靠啰嗦刷分”这件事直接拎出来收税。SHAPE 用熵值把推理过程切成段，拿短 rollout 估算每段的“势能”，高势能的后期长段落会被长度折扣重罚，逼着模型别在确认步骤上浪费 token。结果就是数学题答得更准，输出还短了约三成。我会先打个折：正文没披露这 30% 的 token 节省是在哪些模型和数据集上测的，也没说短 rollout 本身的计算开销有多大，所以实际部署省不省钱还得看具体场景。但思路本身很直接，把推理效率问题从“事后裁剪”挪到了“训练时就定价”，对做推理优化的团队来说是...

## 锐评

这篇论文的核心思路挺直接：模型在推理后期容易陷入“车轱辘话”式的自我确认，浪费算力还不一定对。SHAPE的做法是把推理过程按信息量（熵值）切段，对后期又长又没带来实质进展的部分做动态打折，相当于告诉模型“说废话要扣分”。结果平均准确率涨了约3%，同时token用量砍了约30%，这个数字如果稳定，对推理成本控制确实有吸引力。

但目前的判断只能基于摘要。微信原文被环境验证页挡住了，我没看到具体的实验设计、用了哪些模型、在什么数据集上测的，也没看到这30%的token缩减是否在所有任务上都成立，还是只在某些长链推理任务上明显。另外，“短距离试探估算潜力”这个操作本身也会引入额外推理开销，论文有没有算这笔账，正文没披露。

如果这个方法真能在不牺牲准确率的前提下稳定压缩推理长度，对需要控制延迟和成本的落地场景会有用。但得等看到完整论文和消融实验，才能判断这个“推理税”是不是普适的，还是只在特定设定下有效。
