# 阿里开源 PromptEcho：用冻结的视觉语言模型给文生图训练打分，省掉额外训练成本

> 原标题：阿里开源PromptEcho：用冻结多模态大模型为文生图训练提供高质量Reward

- 来源：机器之心 · 公众号
- 发布时间：2026-05-06T04:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15058
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031464&idx=3&sn=1403f06cf74aec5f22aae0b31717230f

## 摘要

PromptEcho 的做法很直接：拿一个现成的、参数冻结的 Qwen3-VL-32B 模型，让它“读”一遍原始提示词，算出模型自己生成这些词的概率（交叉熵），然后把这个概率的负值当作连续奖励信号，喂给文生图模型做训练。好处是不用再单独训一个评分模型，省事。在 5000 张海报测试里，文字准确率从 68% 提到了 75%。不过正文没披露这个奖励信号跟人...

## 推荐理由

我会先打个折：这不是一个新模型发布，而是训练侧的 reward 方法开源，所以重要性给 78 算合理。钩子在于冻结大模型直接当 reward 用，省成本；知识密度够，把 teacher-forcing CE 怎么变成连续 reward 讲明白了，还给了 10 万张图的规模和具体数字；相关性上，文生图圈对廉价 reward 和文字准确率这两个需求很实在，75% 虽然不算完美，但方向对。正文没披露这个 reward 方法在更大规模训练下的稳定性，这点先别太激动。

## 锐评

PromptEcho 的思路挺取巧：拿一个冻结的 Qwen3-VL-32B 模型，让它“读”一遍原始提示词，算出模型自己生成这些词的概率，概率越高说明图文越匹配，把这个概率的负值当奖励信号喂给文生图模型。好处是省掉了单独训评分模型的麻烦，5000 张海报测试里文字准确率从 68% 提到了 75%，说明对文字生成这类硬指标确实有提升。

但正文没披露这个奖励信号跟人类评分的相关性有多高，也没说在其他风格或更复杂的图像任务上表现怎么样。交叉熵高只能说明模型“觉得”图文匹配，不代表人看着舒服。这点先别太激动，如果后续能补上人工评估的对比数据，说服力会强很多。另外，32B 的模型跑一次前向传播的成本不算低，大规模训练时会不会成为瓶颈，正文也没提。
