# 南洋理工搞了个模糊指令测试，机器人成功率最多暴跌 36.9%

> 原标题：成功率最高暴跌36.9%！南洋理工首个“模糊指令”测试，直击具身智能落地软肋

- 来源：量子位 · 公众号
- 发布时间：2026-04-28T12:56:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11839
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887537&idx=4&sn=c33b83af20538a881c2f7a64fae4b6b7

## 摘要

南洋理工 MARS 实验室发了 REI-Bench，专门测机器人怎么理解人话里的模糊指令。他们把模糊程度分了 9 个等级，拿 4 套机器人规划框架搭上 6 个小模型跑了一遍。结果 LLaMA3.1-8B 加 SayCan 这套组合，在多轮对话里成功率从 57.7% 掉到 46.9%。最要命的是隐含指代——比如“把那个拿过来”但不说清是哪个——基线成功率...

## 推荐理由

这篇论文没造新模型，而是用一套模糊指令基准把现有方案拉出来遛了一遍。36.9%的成功率跌幅很直观，说明机器人一碰到指代不清、上下文省略的人类说话方式就崩。测试覆盖了4种规划框架和6个轻量模型，对照做得扎实，不是单点自嗨。对做具身智能的人来说，这个基准比刷榜分数更有参考价值，因为它暴露的是真实部署里绕不开的问题。

## 锐评

这条新闻值得点开，因为它测的不是实验室里的完美指令，而是人平时说话那种“把那个拿过来”的模糊劲儿。南洋理工MARS实验室发布的REI-Bench，把指令的模糊程度分了9个等级，拿4套机器人规划框架搭配6个小模型跑了一遍。结果挺直观：LLaMA3.1-8B加SayCan这套组合，在多轮对话里成功率从57.7%掉到46.9%。最拉胯的是隐含指代，基线成功率直接跌到36.9%，掉了7.4个百分点。

我会先打个折：正文没披露测试用了多少条指令、场景覆盖多广，也没说这个基准是否开源了代码和数据。另外，只测了8B以下的小模型，更大模型或者专门针对具身智能微调过的模型表现如何，目前还不知道。

这点先别太激动。36.9%这个数字说明，机器人想真正走进家里干活，光能听懂字面意思远远不够，得能结合上下文猜你到底指的是哪个杯子。但文章没提人类在同样模糊指令下的表现作为对照，缺了这个基线，我们不好判断这36.9%到底有多差。
