跳到正文
热点事件历史事件

RLCD 是什么?Jev 背后的秘密

1 篇报道1 个报道来源5 天前更新

先了解这件事

事实说明

传统奖励模型输出一个绝对分数,但这个分数在不同问题或模型间没有稳定含义,真正有用的是相对比较。PPRM 把比较显式化为偏好概率,RLCD 进一步扩展到多个候选,用 Plackett-Luce 目标做多选偏好建模,再加概率校准。Jev 把这个奖励模型做成了产品:带类型输出、可并行推理,不再藏在生成器后面。正文没披露 Jev 的具体性能数字和部署成本。

报道时间线

沿着报道,了解事件的不同侧面。

9月24日
  1. Hacker News 首页
    RLCD 是什么?Jev 背后的秘密

    传统奖励模型输出一个绝对分数,但这个分数在不同问题或模型间没有稳定含义,真正有用的是相对比较。PPRM 把比较显式化为偏好概率,RLCD 进一步扩展到多个候选,用 Plackett-Luce 目标做多选偏好建模,再加概率校准。Jev 把这个奖励模型做成了产品:带类型输出、可并行推理,不再藏在生成器后面。正文没披露 Jev 的具体性能数字和部署成本。