Jevstiller:把 Jev 分类接口蒸馏成本地小模型,并承诺 98% 的回答跟 Jev 一致
Show HN: Jevstiller – Distill Jev into a local model, with a disagreement bound
Jevstiller 在 Jev 分类 API 前面放了一个本地小模型,把每次请求从约 300 毫秒压到 CPU 上约 15 毫秒。它训练的东西很简单:一个冻结的 bge-small 编码器,上面接一个多分类逻辑回归头,用 Jev 返回的完整概率分布来教,而不是只学最终标签。每攒够 2000 条新答案就重训一次,上线前先拿真实流量做影子测试。关键在路由...
推荐理由:一个模型蒸馏的实操案例,把 300 毫秒的 API 调用压到 CPU 上 15 毫秒,还给出了统计上的分歧保证,数字和工程细节都够硬。不过 Jev 的用户群比较小,这篇文章更像是给做推理优化的工程师看的参考,不是那种人人都会点进去的热门话题。