周末试了 Apodex 4B 和 35B mini:能联网搜好几层答案的小模型,不乱编
Spent the weekend on the Apodex 4b, plus a quick look at the 35b mini
作者在单张 3090 上跑了 Apodex 1.0 的开源模型。4B-SFT 被接进一个带搜索工具的 ReAct 流程里,专门用来回答那种答案藏在三层链接后面的复杂问题。跟其他 4B 量级的模型比,它在最后一步瞎编的情况少得多。官方宣称在 BrowseComp 和 BrowseComp-ZH 基准上能打赢所有开源 30B 级别的模型,作者自己拿几个问题...
推荐理由:一篇在单张 3090 上跑 Apodex 4B 的第一手实验,给出了 BrowseComp 上的具体对比和“瞎编更少”的结论。因为只是单篇社区帖子,没有论文或多方确认,35B 部分也仅一笔带过,所以放在 featured 的低分段。