# 刘壮陈丹琦团队开源Vero：一个通用视觉推理强化学习框架，没用到任何思考数据就刷新了SOTA

> 原标题：刘壮陈丹琦新作：开源通用视觉推理RL框架，0思考数据刷新SOTA

- 来源：量子位 · 公众号
- 发布时间：2026-04-11T01:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6298
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247882420&idx=2&sn=f341ba942885c69e34e63bf80b8ba655

## 摘要

普林斯顿刘壮和陈丹琦团队开源了Vero，一个用强化学习训练视觉推理模型的通用框架。它从59个数据集里筛出60万条样本，按六类任务分别给奖励，单阶段RL训练后，在30个基准里有23个超过了Qwen3-VL-8B-Thinking。最值得看的是它没用到任何私有的思考数据，纯靠任务路由奖励机制让模型学会推理。不过正文没披露训练成本和基座模型的具体配置，这点先...

## 推荐理由

我会先打个折：正文没披露训练成本和基座模型配置，复现条件还不清楚。但“零思考数据”这个说法本身就有冲击力，加上23/30的基准成绩和明确的方法细节，对从业者来说是个值得关注的开源信号。所以给featured、82分，不往上拉是因为关键复现信息还缺着。

## 锐评

刘壮和陈丹琦团队这次开源的 Vero，是一个用强化学习训练视觉推理模型的通用框架。它从 59 个数据集里筛出 60 万条样本，按六类任务分别给奖励，单阶段 RL 训练后，在 30 个基准里有 23 个超过了 Qwen3-VL-8B-Thinking。最值得看的是它没用到任何私有的思考数据，纯靠任务路由奖励机制让模型学会推理，这意味着复现门槛低，不用去搞昂贵的私有标注。

不过正文没披露训练花了多少钱、用了什么基座模型的具体配置，也没说这 60 万条样本是怎么筛的、质量如何。这些信息直接决定这个框架能不能在别家模型上跑通。另外，23/30 的胜率虽然好看，但剩下 7 个基准输在哪、是不是关键任务，正文也没展开。

整体看，思路干净，开源也加分，但缺的成本和配置信息让实际参考价值打了折扣。如果后续能补上训练预算和基座消融实验，这个框架对做视觉推理的团队会很有用。
