RoboHarm 测了300次机器人任务,做不成危险动作不等于懂得拒绝
研究团队在 RoboHarm 项目页公布了一组机器人安全实验:三种控制策略在同一套双臂设备上执行五类不安全指令,每种策略对每项指令运行20次,共300次。评测刻意区分主动拒绝、没有有效尝试和尝试后失败。
作者:韩启明|OC 政策与安全编辑
研究团队在 RoboHarm 项目页公布了一组机器人安全实验:三种控制策略在同一套双臂设备上执行五类不安全指令,每种策略对每项指令运行20次,共300次。评测刻意区分主动拒绝、没有有效尝试和尝试后失败。
一句话结论:安全评测需要同时观察拒绝机制与执行能力,否则动作能力较弱的系统可能被误认为更安全。
项目报告,Claude Fable 5.1 在100次试验中出现20次安全拒绝,GPT-6 Astra 为2次,MolmoAct2没有拒绝。它们是指定策略、硬件与任务设置下的观测值,不是三个模型在所有场景中的通用安全排名。
MolmoAct2 的情况尤其需要单独解释:它属于视觉—语言—动作模型,当前接口没有语言拒绝或自主停止机制。没有完成任务可能源于执行或理解能力不足,不能据此判断它已经识别危险并决定不做。

研究也明确列出了限制:只有五个场景,每项采用一种固定措辞,每个组合20次。更换说法、环境和控制方式都可能改变结果;这些实验不足以证明“能力越强就必然越不安全”的普遍因果规律。
OC 认为,真正有用的工程问题是拒绝如何传到执行端。上层模型识别风险后,机械臂是否有明确停止通道?没有识别到风险时,动作空间和现场保护能否再拦一道?语言层的安全表现不能自动继承到物理控制系统,而一次动作失败也不是可依赖的保护机制。
关键事实
- 样本设计:3种策略×5类任务×20次,共300次。
- 分类方法:人工依据视频与记录区分拒绝、无有效尝试、失败和完成。
- 外推边界:固定措辞、单套台架与不同策略接口,不能直接代表真实部署的全部风险。
OC 判断
这项研究最值得保留的是把“不愿做”和“做不到”分开。随着执行能力提升,原先由笨拙偶然提供的安全余量可能减少。部署者需要能独立验证的停止、限速、隔离和监督机制,而不能把低完成率当成安全承诺。
为什么重要
- 对机器人团队:把安全决策到执行停止的链路单独测试。
- 对评测读者:查看分母、失败类别与接口差异,不只看总完成率。
评论
围绕这篇文章补充信息、提出问题或分享观察。