
一、文章主要内容总结该研究针对多模态大模型(LMMs)驱动的机器人操作在现实场景中缺乏可靠性和安全性的问题,提出了ResponsibleRobotBench基准测试平台,核心目标是评估和推动负责任的机器人操作技术发展,涵盖从仿真到现实世界的全流程验证。1. 核心背景与问题现有LMMs在机器人操作中展现出强泛化性和推理能力,但在高风险场景(如电气、化学、人际交互相关危险)中,缺乏风险感知、道德决策和物理接地规划能力。现有基准多聚焦任务成功度,未系统性关注安全约束下的负责任决策,导致机器人在现实高风险环境中部署受限。2. 基准测试平台核心设计任务套件:包含23个多阶段任务,覆盖电气、火灾/化学、人际相关3类风险,以及正常、攻击、防御3类指令模式,支持不同场景复杂度(有无危险)和规划复杂度(单步/长程任务)。动作表示:兼容3种格式(预定义高级技能、操作姿态、代码生成),适配不同控制架构。评估框架:核心指标:任务成功率(Succ)、安全率(Safe)、安全成功率(SSR)、执行成本(Cost)、危险检测准确率。细粒度分析:支持故障类型(格式错误、轨迹规划失败等)、模型鲁棒性(对抗性指令、人机协作)评估。技术支撑