跳到正文
Hacker News 首页

VibeThinker-3B:一个30亿参数模型,在可验证推理上打平或超过DeepSeek V3.2等大模型

VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO

这篇技术报告放出了一个叫VibeThinker-3B的小模型,只有30亿参数,但在数学竞赛题(AIME26得分94.3,加长思考时间能到97.1)、编程题(LiveCodeBench v6的Pass@1是80.2)和没见过的LeetCode比赛(通过率96.1%)上,成绩直接对标甚至超过了DeepSeek V3.2、GLM-5和Gemini 3 Pro...

推荐理由:一个3B模型在数学和编程推理上对标甚至超过大模型,反差故事够强,数字也扎实,方法可复现。扣分是因为单篇报告还没被社区复现,82分合适。

读原文 ↗导出 Markdown