# Cactus 开源 Needle 3：8-29MB 的自动化模型，在手机工具调用上跑赢 DeepSeek V4 Flash

> 原标题：Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash

- 来源：Hacker News 首页
- 发布时间：2026-09-18T00:11:44.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57421
- 原文：https://cactuscompute.com/needle

## 摘要

Cactus 开源了一个叫 Needle 3 的微型模型，专门给手机、手表、机器人这类小设备做自动化。整个模型压缩后只有 8 到 29 MB，用的是他们自家的“简单注意力网络”。它有个特别的设计叫“智能阶梯”：从 2 层到 20 层，每一层都是一个能独立干活的子网络。开发者可以按需选择，比如只取 4 层微调一下，在手机工具调用的跑分上就能超过 Deep...

## 推荐理由

一个 8-29 MB 的微型模型声称在手机工具调用上打平 DeepSeek V4 Flash，体积性能比很吸引人，智能阶梯的架构也给了开发者按需裁剪的灵活性。我会先打个折，因为目前只有项目页面的自报数据，没有第三方跑分或实际产品里的验证，这点先别太激动。

## 锐评

Cactus 开源的 Needle 3 是个专门给手机、手表、机器人等小设备用的自动化模型，压缩后只有 8 到 29 MB。它最特别的设计叫“智能阶梯”：从 2 层到 20 层，每一层都是一个能独立干活的子网络。开发者可以按需取用，比如只拿 4 层微调一下，在手机工具调用的跑分上就能超过 DeepSeek V4 Flash。在树莓派 5 上，它完全离线跑，解码速度能达到每秒 400 到 4000 个 token。

这个模型不追求闲聊，而是专攻工具调用、结构化信息提取和文本向量化。它能把“调暗卧室灯光并锁门”这种指令拆成两个具体的函数调用，也能把一段杂乱的通知提取成结构化的字段。模型架构用的是他们自家的“简单注意力网络”，声称每个 token 的计算量比同配置的 Transformer 少一半以上。

不过，文章没提训练这 3600 亿 token 专有数据集花了多少钱，也没说明数据具体包含什么。在没看到微调成本和数据透明度之前，它“跑赢大模型”的结论需要打个折。另外，所有基准测试都来自他们自己选的三个工具调用和三个信息提取套件，缺乏第三方或更广泛场景的验证。
