跳到正文
热点事件历史事件

Jev模型的概率校准在不同数据分布下失效

2 篇报道1 个报道来源5 天前更新

先了解这件事

报道摘要

Jev 是 TypeSafe 推出的一个分类模型,不用自己准备训练数据就能用,直接给非结构化输入打出带概率的标签。但作者指出,它标榜的“校准概率”站不住脚:模型在训练数据上校准过,不代表在你的生产数据上还能校准。不同公司的数据分布不一样,Jev 却会对相同输入吐出相同的概率,这本身就矛盾。更离谱的是,有人测出 Jev 认为抛一枚公平硬币正面朝上的概率是...

摘自 Hacker News 首页

报道时间线

沿着报道,了解事件的不同侧面。

9月25日
  1. Hacker News 首页
    Jev:一个只输出概率、不写句子的“系统一”模型,主打校准度而非准确率

    TypeSafe AI 发布了 Jev,一个非自回归的“系统一”模型。它不聊天、不写文章、不逐步推理,而是对输入的结构化问题一次性给出答案,并附上每个答案的概率。作者认为,对于生产环境中的分类器,真正的瓶颈不是准确率,而是校准度——即模型给出的概率是否诚实。Jev 的训练目标(RLCD)直接优化这个。它的延迟是 70–500 毫秒,每百万输入 toke...

9月23日
  1. Hacker News 首页
    Jev 模型声称的概率校准,换一批数据就不灵了

    Jev 是 TypeSafe 推出的一个分类模型,不用自己准备训练数据就能用,直接给非结构化输入打出带概率的标签。但作者指出,它标榜的“校准概率”站不住脚:模型在训练数据上校准过,不代表在你的生产数据上还能校准。不同公司的数据分布不一样,Jev 却会对相同输入吐出相同的概率,这本身就矛盾。更离谱的是,有人测出 Jev 认为抛一枚公平硬币正面朝上的概率是...