# Needle：一个 26M 参数的小模型，专门做工具调用，能在普通电脑上跑到每秒 1200 token

> 原标题：Show HN: Needle: We Distilled Gemini Tool Calling into a 26M Model

- 来源：Hacker News 首页
- 发布时间：2026-05-12T18:03:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19045
- 原文：https://github.com/cactus-compute/needle

## 摘要

Cactus 开源了一个叫 Needle 的工具调用模型，参数量只有 2600 万，小到可以在消费级设备上跑。它的推理速度很快，预填充阶段每秒能处理 6000 个 token，生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的，相当于把大模型怎么调用 API、怎么选函数这套本事，压缩进了一个极小的模型里。模型权...

## 推荐理由

我会先打个折：这是 Show HN 和 GitHub 自报的数据，没有独立评测或大厂背书，所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型，prefill 6000 tok/s、decode 1200 tok/s，MIT 开源，意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent，不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少，也没说支持哪些工具类型，这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度，对做本地 agent 的人来说值得看一眼。

## 锐评

Cactus 开源的这个 Needle 模型，思路很直接：把 Gemini 的工具调用能力，通过蒸馏压缩到一个只有 2600 万参数的小模型里。好处是推理极快，预填充每秒 6000 token，生成每秒 1200 token，在消费级设备上就能跑，而且用 MIT 协议放出了权重，商用门槛很低。

但这条消息最该打折扣的地方是，正文没披露它在具体工具调用基准上的准确率。速度快、体积小是事实，可如果调用 API 时经常选错函数或填错参数，那再快也没用。另外也没说蒸馏数据是怎么构造的，样本量和多样性都不清楚，这直接关系到模型能不能扛住真实场景里五花八门的工具描述。

目前看，它适合拿来做本地原型验证，或者对延迟极度敏感、任务范围又很窄的场景。想直接替代大模型做通用工具调用，还得等作者补上评测数据和失败案例分析。
