# 周末试了 Apodex 4B 和 35B mini：能联网搜好几层答案的小模型，不乱编

> 原标题：Spent the weekend on the Apodex 4b, plus a quick look at the 35b mini

- 来源：r/LocalLLaMA
- 发布时间：2026-06-12T08:25:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37834
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u3pdvp/spent_the_weekend_on_the_apodex_4b_plus_a_quick/

## 摘要

作者在单张 3090 上跑了 Apodex 1.0 的开源模型。4B-SFT 被接进一个带搜索工具的 ReAct 流程里，专门用来回答那种答案藏在三层链接后面的复杂问题。跟其他 4B 量级的模型比，它在最后一步瞎编的情况少得多。官方宣称在 BrowseComp 和 BrowseComp-ZH 基准上能打赢所有开源 30B 级别的模型，作者自己拿几个问题...

## 推荐理由

一篇在单张 3090 上跑 Apodex 4B 的第一手实验，给出了 BrowseComp 上的具体对比和“瞎编更少”的结论。因为只是单篇社区帖子，没有论文或多方确认，35B 部分也仅一笔带过，所以放在 featured 的低分段。

## 锐评

这条分享来自 Reddit 用户周末实测，跑在单张 3090 上。核心发现是 Apodex 4B-SFT 被接进一个带搜索工具的 ReAct 流程后，处理那种答案藏在好几层链接后面的复杂问题时，最后一步瞎编的情况比同类 4B 模型少得多。官方宣称在 BrowseComp 和 BrowseComp-ZH 两个基准上能打赢所有开源 30B 级别模型，作者自己拿几个问题试了试，说确实对得上。

35B mini 版的设计有点意思：每次推理只激活大约 3B 参数，但完整权重文件还是 35B，导致在单卡上必须大量走 CPU 卸载，速度慢到只能跑一次性查询，没法当日常工具用。目前还没有官方 gguf 格式，作者自己转换了 0.8B 和 2B 版本，4B 则留在 vLLM 里跑。

作者特别提到一个设计思路：用来检查答案的上下文和生成答案的上下文不是同一套。这个模式有几个团队在推，现在出现在小到单卡能跑的模型上，值得留意。不过正文没披露训练数据来源和具体去偏方法，也没说 BrowseComp 上的胜出是全面碾压还是只在某些子任务上。如果官方后续放出 gguf 和更细的消融实验，这条线的实用性会更清楚。
