# TGO：不用人工挑好坏样本，靠一个分数就能把生图模型调得更听话

> 原标题：无需构造偏好对：TGO用标量反馈对齐视觉生成模型｜ICML&#39;26

- 来源：量子位 · 公众号
- 发布时间：2026-05-17T10:22:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22631
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247891358&idx=2&sn=d63e568f68be834df8cd92ecc2e35ddc

## 摘要

新加坡国立大学搞了个叫 TGO（阈值引导优化）的方法，被 ICML 2026 收了。它最大的好处是不需要提前构造“这张比那张好”的偏好对，直接拿一个标量分数（比如美学分、图文匹配度）就能做对齐。做法是先让模型生成一批图，算出分数的分布，定一个阈值：高于阈值的当正样本往上拉，低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLU...

## 推荐理由

这篇 ICML 2026 的论文提了个叫 TGO 的方法，核心是把标量反馈（比如一个打分）直接转成模型的正负更新方向，不用像传统 RLHF 那样先构造偏好对。我会先打个折：正文没披露具体节省了多少标注成本或计算量，但思路本身挺直接——用分数分布的阈值来决定哪些样本该学、哪些该躲。实验覆盖了四个主流视觉生成模型，从 SD v1.5 到 FLUX 都有，说明不是单点特调。这点先别太激动，因为论文偏研究向，离工程落地还有距离，但对正在头疼对齐数据采集的团队来说，值得看一眼。

## 锐评

这篇 ICML 2026 的工作解决了一个很实际的痛点：做视觉模型对齐时，不用再人工构造“A 比 B 好”的偏好对，直接拿一个标量分数（比如美学评分、图文匹配度）就能开训。做法是先让模型生成一批图，算出分数分布，定个阈值，高于阈值的当正样本往上拉，低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLUX、Wan 1.3B 和 Meissonic 上都跑了实验，覆盖图像和视频生成，说明方法通用性不错。

不过正文没披露具体阈值怎么定、对分数分布敏感度如何，也没给出和传统偏好对方法在相同预算下的直接对比。这点先别太激动——省掉偏好对标注是省了人工，但如果阈值调不好，正负样本划分可能很糙，最终效果会打折扣。另外，实验用的分数模型本身有没有偏、能不能代表真实用户偏好，正文也没展开。
