# ICML 2026 论文：PRISM 框架让扩散语言模型做推理时扩展不再烧算力

> 原标题：ICML 2026｜拒绝大力出奇迹，PRISM框架让dLLM也能高效Test-Time Scaling

- 来源：机器之心 · 公众号
- 发布时间：2026-05-11T04:09:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17716
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032226&idx=2&sn=772b44d2bf16aac0a694b87df0a929e2

## 摘要

这篇 ICML 2026 的论文给扩散语言模型（dLLM）提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层：先让模型并行生成多条推理路径，再对每条路径局部“回退重写”不靠谱的步骤，最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上，LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

## 推荐理由

这篇 ICML 论文给扩散语言模型做 test-time scaling，核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%，靠的是三层搜索、局部 remasking 和自验证，把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折：这只是单模型单数据集的实验，正文没披露在其他 benchmark 或更大模型上的表现，泛化性还不好说。但思路本身对做推理优化的人有参考价值，尤其适合预算有限又想压榨小模型推理能力的场景。

## 锐评

这篇 ICML 2026 论文给扩散语言模型（dLLM）找了一条更省钱的推理时扩展路线。核心思路是把搜索过程拆成三层：先并行生成多条推理路径，再对每条路径里不靠谱的步骤做局部“回退重写”，最后让模型自己当裁判打分筛选。在数学题集 GSM8K 上，LLaDA-8B-Instruct 的准确率从 67.58% 提到了 85.30%，提升幅度不小。

最直接的好处是省算力。传统方法每多一条候选路径，成本就线性往上翻，PRISM 把复杂度从 O(NT) 压到了 O(N+KT)，K 是最终保留的候选宽度。这意味着候选路径可以多开几条，但实际重写的步骤只集中在少数关键位置，不用全量重跑。

不过正文没披露验证环境的具体细节，也没说这套方法在更大模型或非数学任务上表现如何。GSM8K 本身是个老基准，8B 模型跑出 85% 不算天花板，换到更难的数据集上能稳住多少还不清楚。另外，模型自评打分的可靠性也是个潜在坑——如果裁判自己就偏，筛选出来的路径未必是最优的。这点先别太激动，等看到更多任务和模型规模的消融实验再说。
