美团 LongCat 开源 VitaBench 2.0:一个测 AI 能不能长期记住你、主动问你的基准
美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
这个基准模拟了 56 个虚拟用户,每人平均有 1580 天的交互记录、2093 个事件,任务有 819 个,偏好会动态变化超过 2000 次,还给模型配了 66 个可调用的工具。目前最强的 Claude-Opus-4.6 在开卷考试下平均分刚过 0.5,说明整体还不太行。开了思考模式对个性化任务不一定加分,一到需要主动提问的场景,所有模型分数都断崖式下...
推荐理由:美团 LongCat 开源的这个基准规模够大、设计也贴近真实场景,不是又一个刷分的玩具榜。56 个虚拟用户每人上千天的交互数据,任务和偏好变化都给了具体数字,Claude Opus 4.6 刚过 0.5 的成绩说明挑战确实硬核。我会先打个折,因为目前只看到一篇微信文章,没有其他来源交叉验证,基准本身的长期稳定性和社区接受度还要再观察。分数没给更高也是这个原因——信息源单一,但内容本身对从业者有直接参考价值。