# 新浪开源 VibeThinker-3B：推理能力能塞进小模型，但知识储备不行

> 原标题：新浪开源VibeThinker-3B：推理可压缩，事实知识不能

- 来源：AI HOT 精选
- 发布时间：2026-06-28T07:44:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41009
- 原文：https://the-decoder.com/sinas-open-model-vibethinker-3b-aims-to-show-reasoning-compresses-well-but-factual-knowledge-doesnt

## 摘要

新浪微博放出了一个 30 亿参数的小模型 VibeThinker-3B，在数学和编程题上能跟 DeepSeek V3.2、Kimi K2.5 这些大几百倍甚至上千亿参数的模型打平。它是在阿里的 Qwen2.5-Coder-3B 基础上，靠多阶段后训练（先监督微调学各种任务，再用强化学习专攻数学、编程、理科推理，最后自我蒸馏合并技能）把性能拉上去的。在 ...

## 推荐理由

新浪这个VibeThinker-3B最抓人的点是30亿参数能在数学和编程上跟DeepSeek V3.2、Kimi K2.5这些大模型打平，对做端侧部署或者想省推理成本的人是个实打实的信号。训练方法也交代得比较清楚，不是黑盒，而且他们自己验证了一个结论：推理能力可以压缩到小模型里，但事实知识不行，这点对选型有参考价值。没给更高分是因为目前只有这一篇报道，模型在更杂的任务上表现还不清楚，先打个折。

## 锐评

新浪微博放出的VibeThinker-3B只有30亿参数，但在AIME26这类数学竞赛和LiveCodeBench编程题上，分数能跟DeepSeek V3.2、Kimi K2.5这些大几百倍甚至上千亿参数的模型打平。它的做法是在阿里的Qwen2.5-Coder-3B基座上做多阶段后训练：先监督微调学各种任务，再用强化学习专攻数学、编程和理科推理，最后自我蒸馏把技能合并。

这个结果说明，结构化的逻辑推理可能就靠那几套模式，小模型也能学会。但一到GPQA-Diamond这种考广泛事实知识的题，它立刻被大模型甩开。团队自己下的判断是：推理好压缩，事实知识不行。

正文没披露训练用了多少数据、花了多少钱，也没说自我蒸馏阶段有没有引入新数据。另外，所有对比都基于公开基准测试，实际干活时的稳定性还没验证。如果是真的，在特定推理任务上用小模型替代大模型能省不少算力，但别指望它当百科全书用。
