# 东南大学和北大搞了个机器人精细操作评测框架，说传统只看成功率的办法会把能力高估七成

> 原标题：刺破成功率幻象，直面具身智能的「真灵巧」，机器人精细操作评测新范式来了！

- 来源：机器之心 · 公众号
- 发布时间：2026-06-05T04:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34713
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651037190&idx=3&sn=53e0adcbf4b30f3515ff236734530c0c

## 摘要

这篇推文本身被微信的环境验证挡住了，正文内容没抓到。从标题和已有的英文摘要看，MetaFine 是一个诊断式的元评测框架，专门拆开看机器人在精细操作上的理解、感知和行为三个环节，而不是只给一个“成功/失败”的二元结果。研究团队说，传统只看最终成功率的评测方式，对精细操作能力的评估会虚高最多 70%。具体怎么测的、用了哪些任务和模型，正文没披露，没法展开。

## 推荐理由

标题和摘要抛出的 70% 虚高数字很有冲击力，MetaFine 的三轴诊断思路也确实比只看成功率进了一步。但正文被微信环境验证挡住，具体任务、模型和实验细节全是缺口，没法核实。所以它是一篇有钩子、有新知但信息不完整的二次评论帖，放在 featured 门槛上刚好，不宜再拔高。

## 锐评

这条新闻讲的是东南大学和北大搞了个叫 MetaFine 的评测框架，专门拆开看机器人在精细操作上的理解、感知和行为三个环节，而不是像以前那样只看最后成没成功。团队说传统只看成功率的评测方式，对精细操作能力的评估会虚高最多 70%，这个数字挺吓人，说明很多机器人可能只是蒙对了结果，实际手活儿并不行。

但问题来了：正文被微信的环境验证挡住了，我根本没看到原文。具体怎么测的、用了哪些任务、测了哪些模型、样本量多大，这些关键信息全缺。70% 这个虚高比例是怎么算出来的，是实验室环境还是真实场景，也没法核实。

对做机器人评测的人来说，这个思路值得关注——把成功拆成多个环节来诊断，比给个及格分有用得多。但在看到完整论文之前，我只能给这条新闻打个折，建议直接去找原论文看。
