跳到正文
Hacker News 首页

RLCD 是什么?Jev 背后的秘密

What Is RLCD? The Secret Behind Jev

传统奖励模型输出一个绝对分数,但这个分数在不同问题或模型间没有稳定含义,真正有用的是相对比较。PPRM 把比较显式化为偏好概率,RLCD 进一步扩展到多个候选,用 Plackett-Luce 目标做多选偏好建模,再加概率校准。Jev 把这个奖励模型做成了产品:带类型输出、可并行推理,不再藏在生成器后面。正文没披露 Jev 的具体性能数字和部署成本。

读原文 ↗导出 Markdown