实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招
Evaluated a RAG chatbot and the most expensive model was the worst performer. Notes on what actually moved the needle.
作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...
推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。