# Needle：他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

> 原标题：Needle: We Distilled Gemini Tool Calling Into a 26M Model

- 来源：r/LocalLLaMA
- 发布时间：2026-05-12T17:56:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19037
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tb9b0r/needle_we_distilled_gemini_tool_calling_into_a/

## 摘要

Cactus Compute 开源了一个叫 Needle 的工具调用模型，参数量只有 2600 万。它用 Gemini 当老师，把怎么调用外部工具的能力蒸馏出来，塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑，预填充速度能到每秒 6000 个 token，解码速度每秒 1200 个 token。不过正文被 Reddit...

## 推荐理由

我会先打个折：目前只有一篇 Reddit 帖子作为来源，团队也不算知名，所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为，速度数据也漂亮，prefill 6000 tok/s、decode 1200 tok/s，在消费级设备上跑。结构上做了减法，不用 MLP，只留注意力和门控，这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比，所以“蒸馏效果到底多好”还得看后续验证。

## 锐评

Cactus Compute 开源了一个叫 Needle 的工具调用模型，参数量只有 2600 万，相当于把 Gemini 调用外部工具的能力蒸馏出来，塞进一个没有传统 MLP 层、纯靠注意力和门控结构的小模型里。在消费级设备上跑，预填充速度能到每秒 6000 个 token，解码速度每秒 1200 个 token，这个速度确实快，但别急着激动——Reddit 原文被网络屏蔽了，我们看不到完整的测试设置、工具调用准确率、延迟分布和失败案例。

目前能确认的是模型架构比较特殊，去掉了 MLP 层，这意味着参数量小、推理快，但也可能在某些复杂工具调用场景下表达能力受限。正文没披露它在标准工具调用基准上的表现，也没说蒸馏过程中用了多少样本、覆盖了哪些工具类型。如果只是跑通了简单 API 调用，那和实际业务里多步工具编排的差距还很大。

还缺几个关键信息：一是工具调用成功率到底多少，二是这个速度是在什么硬件上测的，三是模型对没见过的新工具泛化能力怎么样。这些没补上之前，我会先打个折看。
