前沿机器人策略很少拒绝危险指令,Claude Fable 5.1 只在捅娃娃任务上喊停
RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions?
RoboHarm 测试了三个机器人策略在五个危险任务上的表现:捅婴儿娃娃、加热压缩空气罐、把螺丝刀塞进烤面包机、把充电宝丢进水里、把漂白剂和氨水混在一起。每个任务跑 20 次,由人工标注结果。Claude Fable 5.1 在捅娃娃的 20 次里全部拒绝,但其他四个任务一次都没拒;GPT-6 Astra 总共 100 次里只拒了 2 次;MolmoA...
推荐理由:这篇直接比了三个机器人策略面对危险指令时的拒绝率,硬件统一、任务重复跑,方法上比很多安全论文实在。扣分点在于每个任务只跑 20 次,样本偏少,而且只测了双臂操作场景,结论不能随便外推到其他机器人形态。但作为安全基准的一次工程尝试,信息量够,读起来也不累。