花 500 美元微调一个 9B 开源模型,在商品目录审核上干掉了顶尖闭源模型
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review
Fermisense 用 GRPO 强化学习微调了一个 9B 开源模型做商品目录审核,质量得分达到 87.3%,而他们测试的最强闭源模型组合只拿到 76.9%。成本差距更夸张:微调模型审一千条商品只要 0.5 美元,闭源方案则要 19 到 172 美元,便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活...
推荐理由:HKR 三条全中,数字具体、方法明确、成本对比清晰。没给更高分是因为这是 Fermisense 自家博客,没有第三方复现或交叉验证,而且他们自己就在卖这个方案,利益相关得打个折。不过文章本身信息量够,对做企业落地的读者有直接参考价值,放在 featured 里合适。