# 开源模型当程序员助手够格吗？Hugging Face 拿自家代码库做了个摸底测试

> 原标题：AI 智能体够格吗？在自有工具上评测开源模型

- 来源：AI HOT 精选
- 发布时间：2026-06-18T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39167
- 原文：https://huggingface.co/blog/is-it-agentic-enough

## 摘要

Hugging Face 把自家的 transformers 库当成考场，让开源模型驱动的编程助手去写代码、调接口、自己改 bug，看它们到底要绕多少弯路、花掉多少 token 才能把活干完。他们没只看最终答案对不对，而是把整个解题过程拆开看：不同模型、不同版本的库、不同任务下，成功率和成本差了多少。结论是，库的文档写得好不好、接口设计得顺不顺，会直接...

## 推荐理由

Hugging Face 把自家 transformers 库当成编程助手的考场，让开源模型去写代码、调接口、改 bug，没只看最终答案，而是把整个解题过程拆开算账：不同模型、不同库版本下，成功率和 token 消耗差了多少。结论很实在——库的文档和接口设计顺不顺，直接决定模型要多花多少成本才能把活干完。这不是能力突破，是评测方法上的创新，对实际做 agent 的人选模型很有用，所以给到 78 分。

## 锐评

这篇博客没给最终模型排名，更像一份评测方法论：把开源模型驱动的编程助手扔进真实的 transformers 库任务里，不看最终答案对不对，而是拆开整个过程算账——成功要花多少 token、走多少弯路。他们用 pi coding agent 搭了一套开源评测流水线，对比了不同模型、不同库版本下的表现。

一个关键发现是，库本身的文档质量和接口设计会直接影响智能体的成功率。他们举了个例子：给 CLI 工具加了个“技能提交”功能后，任务完成得更顺了。这说明与其死磕模型能力，不如先把工具链打磨好。

不过正文没披露具体模型间的胜负数据，也没说这套评测跑了多少样本、任务难度分布如何。如果是真的，这个思路挺省钱——不用迷信大模型，把自家工具的说明书写清楚可能更管用。但缺少量化结果，暂时只能当方法论参考，没法直接拿来选模型。
