南洋理工搞了个模糊指令测试,机器人成功率最多暴跌 36.9%
成功率最高暴跌36.9%!南洋理工首个“模糊指令”测试,直击具身智能落地软肋
南洋理工 MARS 实验室发了 REI-Bench,专门测机器人怎么理解人话里的模糊指令。他们把模糊程度分了 9 个等级,拿 4 套机器人规划框架搭上 6 个小模型跑了一遍。结果 LLaMA3.1-8B 加 SayCan 这套组合,在多轮对话里成功率从 57.7% 掉到 46.9%。最要命的是隐含指代——比如“把那个拿过来”但不说清是哪个——基线成功率...
推荐理由:这篇论文没造新模型,而是用一套模糊指令基准把现有方案拉出来遛了一遍。36.9%的成功率跌幅很直观,说明机器人一碰到指代不清、上下文省略的人类说话方式就崩。测试覆盖了4种规划框架和6个轻量模型,对照做得扎实,不是单点自嗨。对做具身智能的人来说,这个基准比刷榜分数更有参考价值,因为它暴露的是真实部署里绕不开的问题。