# 花 500 美元微调一个 9B 开源模型，在商品目录审核上干掉了顶尖闭源模型

> 原标题：A $500 RL fine-tune of a 9B open model beat frontier models on catalog review

- 来源：Hacker News 首页
- 发布时间：2026-07-28T02:18:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47016
- 原文：https://fermisense.com/when-machines-take-the-wheel/

## 摘要

Fermisense 用 GRPO 强化学习微调了一个 9B 开源模型做商品目录审核，质量得分达到 87.3%，而他们测试的最强闭源模型组合只拿到 76.9%。成本差距更夸张：微调模型审一千条商品只要 0.5 美元，闭源方案则要 19 到 172 美元，便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活...

## 推荐理由

HKR 三条全中，数字具体、方法明确、成本对比清晰。没给更高分是因为这是 Fermisense 自家博客，没有第三方复现或交叉验证，而且他们自己就在卖这个方案，利益相关得打个折。不过文章本身信息量够，对做企业落地的读者有直接参考价值，放在 featured 里合适。

## 锐评

Fermisense 这篇博客的核心结论很直接：用 GRPO 强化学习微调一个 9B 开源模型，专门做商品目录审核，质量得分 87.3%，而他们测试的最强闭源模型组合只有 76.9%。成本差距更夸张，微调模型审一千条商品只要 0.5 美元，闭源方案要 19 到 172 美元，便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活的模型，比对着通用大模型反复调提示词更准也更省钱。

不过得注意，这是厂商自己发的技术博客，不是第三方评测。文章没披露测试用的商品目录具体长什么样、质量评分标准怎么定的、有没有人工复核，也没说这个 87.3% 的质量分在实际业务里意味着多少人工纠错成本。另外，Ramp 那组“AI 投入前四分之一的公司收入翻倍”的数据，只给了起点和终点的指数曲线，没披露样本量、行业分布和收入基数，相关性不等于因果，这点先别太激动。

还缺什么：微调模型在不同品类、不同语言商品上的泛化能力没提；GRPO 训练的具体配置和超参没给；和最近其他小模型微调方案的横向对比也没有。如果这些缺口能补上，这个“500 美元干翻闭源”的故事会更有说服力。
