# VibeThinker-3B：一个30亿参数模型，在可验证推理上打平或超过DeepSeek V3.2等大模型

> 原标题：VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO

- 来源：Hacker News 首页
- 发布时间：2026-06-23T02:01:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39928
- 原文：https://arxiv.org/abs/2606.16140

## 摘要

这篇技术报告放出了一个叫VibeThinker-3B的小模型，只有30亿参数，但在数学竞赛题（AIME26得分94.3，加长思考时间能到97.1）、编程题（LiveCodeBench v6的Pass@1是80.2）和没见过的LeetCode比赛（通过率96.1%）上，成绩直接对标甚至超过了DeepSeek V3.2、GLM-5和Gemini 3 Pro...

## 推荐理由

一个3B模型在数学和编程推理上对标甚至超过大模型，反差故事够强，数字也扎实，方法可复现。扣分是因为单篇报告还没被社区复现，82分合适。

## 锐评

这篇论文放出了一个叫VibeThinker-3B的小模型，只有30亿参数，但在AIME26数学竞赛上拿了94.3分（加长思考时间能到97.1），LiveCodeBench v6编程测试Pass@1达到80.2，甚至在没见过的LeetCode新题上通过率96.1%。这些成绩直接对标DeepSeek V3.2、Gemini 3 Pro这些大几十倍甚至上百倍的模型。

训练方法用了三招：先按难度递进做监督微调（SFT），再用GRPO做多领域强化学习，最后用模型自己生成的数据做离线蒸馏。作者还提了一个假说，认为可验证的推理能力可以压缩进很小的参数核心里，但开放领域的知识还是需要大参数来覆盖。

不过正文没披露训练数据规模、总计算量和推理延迟。一个3B模型能跑出这个分，如果是真的挺省钱，但没这些数字就没法判断复现成本和实际部署体验。另外IFEval指令遵循得分93.4，说明推理能力拉上去之后，模型没变傻，这点算是个加分项。
