# 实测外挂资料库客服机器人：最贵的模型表现最差，真正管用的是这几招

> 原标题：Evaluated a RAG chatbot and the most expensive model was the worst performer. Notes on what actually moved the needle.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-15T12:24:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21420
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tdusvx/evaluated_a_rag_chatbot_and_the_most_expensive/

## 摘要

作者搭了一个客服用的外挂资料库（RAG）问答机器人，用模型当裁判打分，把质量分从 6.62 拉到了 7.88，同时单次会话成本从 $0.002420 砍到 $0.000509，降了将近八成。最反直觉的发现是：最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度，以及用五款模型做了一轮横向...

## 推荐理由

我会先打个折：这是个人实验，不是大规模生产验证，样本量和场景都有限。但作者把调优过程拆得很细，从最贵的模型翻车开始，一步步讲怎么换模型、调检索参数、改 prompt，最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说，这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集，这点有点可惜，但不妨碍它作为一份诚实的调参笔记入选。

## 锐评

这条分享很实在，作者没在比跑分，而是实打实搭了个客服用的外挂资料库（RAG）问答机器人，用模型当裁判打分，把质量分从6.62拉到7.88，同时单次会话成本从0.002420美元砍到0.000509美元，降了将近八成。最反直觉的发现是：最贵的模型反而是表现最差的，说明在特定任务里砸钱不一定管用。

真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度，以及用五款模型做了一轮横向对比。这些都不是什么魔法，而是工程上的细活。不过正文没披露具体用了哪五款模型、评分标准怎么设计的，也没说测试集规模和领域覆盖，所以这个7.88分能泛化到什么程度要打个问号。另外，成本只算了API调用费，没算检索和去重的计算开销，实际落地时总成本会更高。

整体来看，这是一份接地气的工程笔记，适合正在折腾RAG落地的从业者参考。但结论别直接照搬，先看看你自己的资料库结构和用户问题类型是不是跟作者类似。
