# 用约3美元API调用微调Qwen2.5-7B，在特定任务上达到Claude Haiku 96%的表现

> 原标题：Fine-tuned Qwen2.5-7B to 96% of Claude Haiku on a domain-specific task using ~$3 of API calls and zero human labelers

- 来源：r/LocalLLaMA
- 发布时间：2026-06-10T00:01:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/36714
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u1m8bd/finetuned_qwen257b_to_96_of_claude_haiku_on_a/

## 摘要

一位Reddit用户用1040组偏好样本（DV-DPO，一种让模型学会回答风格的方法）微调了Qwen2.5-7B，成本按Claude Haiku的API价格算大约3美元，没花钱请人标注。在特定领域任务上，这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上，生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

## 推荐理由

这条信息本身是个Reddit帖子，任务范围和评测细节正文没展开，所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起，对想省钱又不想雇人标数据的团队来说，是个值得看一眼的信号。

## 锐评

这条帖子的亮点是成本控制：用1040组偏好样本（DV-DPO，一种让模型学会回答风格的方法）微调Qwen2.5-7B，按Claude Haiku的API价格算只花了约3美元，没花钱请人标注。在某个未披露的领域任务上，综合得分达到Haiku的96%，部署在4-bit量化的T4机器上，生成一次回答延迟11秒。

但信息缺口很明显。正文没披露具体是什么任务，也没说评测指标怎么算的。96%这个数字如果来自单一场景、小样本测试，泛化能力要打问号。11秒延迟对实时交互来说偏慢，T4本身也是较老的推理卡。

还缺对比基线：跟原版Qwen2.5-7B比提升多少？跟其他同尺寸模型比呢？另外帖子来源是Reddit个人用户，没有代码或权重链接，可复现性存疑。如果任务定义清晰、评测靠谱，这个成本效率确实值得关注，但眼下只能当个有趣的实验参考。
