# 美团 LongCat 开源 VitaBench 2.0：一个测 AI 能不能长期记住你、主动问你的基准

> 原标题：美团 LongCat 开源 VitaBench 2.0：长期动态智能体基准新标杆

- 来源：AI HOT 精选
- 发布时间：2026-06-25T11:58:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40601
- 原文：https://mp.weixin.qq.com/s/HoiUxYnyJuh2_xdxmg8s8Q

## 摘要

这个基准模拟了 56 个虚拟用户，每人平均有 1580 天的交互记录、2093 个事件，任务有 819 个，偏好会动态变化超过 2000 次，还给模型配了 66 个可调用的工具。目前最强的 Claude-Opus-4.6 在开卷考试下平均分刚过 0.5，说明整体还不太行。开了思考模式对个性化任务不一定加分，一到需要主动提问的场景，所有模型分数都断崖式下...

## 推荐理由

美团 LongCat 开源的这个基准规模够大、设计也贴近真实场景，不是又一个刷分的玩具榜。56 个虚拟用户每人上千天的交互数据，任务和偏好变化都给了具体数字，Claude Opus 4.6 刚过 0.5 的成绩说明挑战确实硬核。我会先打个折，因为目前只看到一篇微信文章，没有其他来源交叉验证，基准本身的长期稳定性和社区接受度还要再观察。分数没给更高也是这个原因——信息源单一，但内容本身对从业者有直接参考价值。

## 锐评

VitaBench 2.0 把评测拉到了接近真实生活的尺度：56个虚拟用户，每人平均1580天的交互记录、2093个事件，任务有819个，偏好还会动态变化超过2000次。这不是让模型答几道题，而是看它能不能在长达数年的时间跨度里，记住一个人的习惯变化、在合适的时候主动问问题、调用66个工具去完成具体的事。

目前最强的 Claude-Opus-4.6 在开卷模式下平均分刚过0.5，说明整体水平还很低。两个值得注意的发现：一是开了思考模式对个性化任务不一定加分，有时候反而帮倒忙；二是所有模型一到需要主动提问的场景，分数就断崖式下跌——模型还是更擅长被动回答，不太会主动搞清楚用户到底要什么。

正文没披露这56个虚拟用户是怎么生成的、偏好变化的规律是否贴近真人分布，也没说819个任务的难度分级和具体类型占比。这些信息缺口会影响我们对基准本身质量的判断。另外，评测只跑了 Claude-Opus-4.6 一个最强模型的数据，其他模型的横向对比没给全，这点先别太激动。
