# 花 9 美元让 Gemini 教出一个本地模型，替代它自己

> 原标题：I had Gemini train its own replacement for $9

- 来源：Hacker News 首页
- 发布时间：2026-09-17T13:17:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57120
- 原文：https://www.petervijeh.com/projects/reddit-ner

## 摘要

作者用 Gemini 3.1 Pro 给 4290 条 Reddit 评论打上刀具品牌、型号和钢材的标签，花了 9 美元。然后用这些标签微调了一个叫 GLiNER 的开源命名实体识别模型。训练好的模型在本地跑，跟 Gemini 的标注结果对比，F1 分数达到 0.83，而直接零样本跑 GLiNER 只有大约 0.65。训练在 Tesla T4 上跑了 ...

## 推荐理由

一篇很实在的微调实战记录。作者用 Gemini 3.1 Pro 给 Reddit 刀具评论打标，只花了 9 美元就攒出 4290 条训练数据，把开源 NER 模型 GLiNER 的 F1 从 0.65 提到了 0.83。我会先打个折：领域太窄（刀具品牌型号钢材），分数不能给太高。但方法本身是通用的——用大模型蒸馏标签、微调小模型、本地部署省 API 钱——对从业者来说直接能用。正文没披露训练脚本细节和推理延迟，这点有点可惜。

## 锐评

这篇实验的价值在于展示了一条很省钱的路径：用付费大模型做一次性标注，产出的数据足以把一个开源小模型（GLiNER）的 F1 分数从大约 0.65 拉到 0.83。9 美元的 API 费用加上约 2.5 美元的 GPU 时间，换回一个能在自己机器上跑的模型，经济账算得过来。

但文章最大的信息缺口也很明显：所有分数都是跟 Gemini 的标注结果对比，没人手动核查过 Gemini 标得对不对。这意味着 0.83 衡量的是学生模仿老师的能力，不是学生答对题的能力。如果 Gemini 本身错了一批，模型跟着错反而得分，纠正了反而扣分。另外，十次训练里有五次完全失败，其中两次栽在一个叫 words_mask 的张量上——文档暗示它是二值掩码，实际需要的是词索引，填错了损失值就卡在 70 不动。这个坑对想复现的人来说很关键。

还缺什么：没有报告人工标注的准确率基线，也没提团队规模和定价。如果后续能补上人工抽检的数据，这个方法的可信度会高很多。
