热点事件历史事件
Jev模型的概率校准在不同数据分布下失效
2 篇报道1 个报道来源5 天前更新
先了解这件事
报道摘要
Jev 是 TypeSafe 推出的一个分类模型,不用自己准备训练数据就能用,直接给非结构化输入打出带概率的标签。但作者指出,它标榜的“校准概率”站不住脚:模型在训练数据上校准过,不代表在你的生产数据上还能校准。不同公司的数据分布不一样,Jev 却会对相同输入吐出相同的概率,这本身就矛盾。更离谱的是,有人测出 Jev 认为抛一枚公平硬币正面朝上的概率是...
摘自 Hacker News 首页
报道时间线
沿着报道,了解事件的不同侧面。
9月25日
- Hacker News 首页Jev:一个只输出概率、不写句子的“系统一”模型,主打校准度而非准确率
TypeSafe AI 发布了 Jev,一个非自回归的“系统一”模型。它不聊天、不写文章、不逐步推理,而是对输入的结构化问题一次性给出答案,并附上每个答案的概率。作者认为,对于生产环境中的分类器,真正的瓶颈不是准确率,而是校准度——即模型给出的概率是否诚实。Jev 的训练目标(RLCD)直接优化这个。它的延迟是 70–500 毫秒,每百万输入 toke...
9月23日
- Hacker News 首页Jev 模型声称的概率校准,换一批数据就不灵了
Jev 是 TypeSafe 推出的一个分类模型,不用自己准备训练数据就能用,直接给非结构化输入打出带概率的标签。但作者指出,它标榜的“校准概率”站不住脚:模型在训练数据上校准过,不代表在你的生产数据上还能校准。不同公司的数据分布不一样,Jev 却会对相同输入吐出相同的概率,这本身就矛盾。更离谱的是,有人测出 Jev 认为抛一枚公平硬币正面朝上的概率是...