开发者说|机器人真的听懂指令了吗?InstructMove 让语言成为动作选择的必要条件

2026/09/23

11.jpg



概述

机器人成功完成动作,就意味着它听懂了指令吗?在一些测试场景中,场景里只有一个明显目标,机器人即使不理解指令,也可能仅凭“视觉捷径”完成任务。但在真实生活中,面对多个合理候选目标,机器人必须根据指令判断“操作谁、如何操作”。


InstructMove正是围绕这一问题展开:让机器人必须结合指令,才能完成任务。为此,我们提出机器人指令理解与操作评测基准InstructMove,在同一场景中设置多个可操作候选目标,让语言成为确定正确目标的必要信息。我们进一步构建高质量资产库,以及可规模化生成训练轨迹和开展评测的仿真套件;评分体系覆盖“找对目标—正确操作—完成任务”等关键环节,帮助研究者判断问题究竟出在“没听懂”,还是“没做好”。


通过对π₀、π₀.₅、GR00T N1.7和Motus四种代表性操作策略的评测,我们发现,空间关系理解以及将正确目标选择转化为稳定操作,仍是当前模型的明显挑战。反事实实验进一步表明,即使指令为空或目标不存在,模型仍会频繁发起抓取:它们已经能在一定程度上根据语言决定“抓什么”,却还没有学会在无效指令下“何时不该抓”。


此外,InstructMove仿真数据的实用价值也在真机测试中得到验证:在200条真实轨迹的基础上加入2,000条仿真轨迹后,真实环境中的目标Reach从19/50提升至34/50,Lift从11/50提升至18/50,为机器人“听懂指令、精准行动”提供了有效的数据支撑。


• 开源代码:

https://github.com/HorizonRobotics/RoboOrchardSim

• 文章地址

https://arxiv.org/abs/2608.22990



总体框架

InstructMove围绕Text-Indispensable原则构建了一套从任务设计到模型评测的完整流程:首先利用多个可操作候选目标,构造必须依赖语言消歧的场景;随后通过高质量资产库、约束驱动的布局生成和专家轨迹合成,规模化生成训练与评测数据;最后采用分阶段指标和反事实指令诊断,分别分析模型的目标grounding、操作控制与语言依赖性。


汇总页2-2.jpg



Text-Indispensable 任务设计

InstructMove的核心原则是Text-Indispensable——文本不可缺失。在每个任务场景中,系统都会放置多个视觉上合理、物理上可操作的候选目标,但只有一个目标与当前指令完全匹配。因此,机器人不能仅凭“哪个物体最显眼”或“哪个目标最容易抓取”完成任务,而必须真正理解语言所提供的关键信息。


围绕这一原则,InstructMove将指令跟随能力拆解为四类互补任务:通过类别描述辨认目标物体,通过颜色、形状、大小或材质区分同类物体,通过参照物理解左右、前后和远近等空间关系,以及同时判断“抓什么、放哪里”的组合式抓取放置。指令承载的信息由类别描述进一步扩展到属性、空间关系和多目标组合约束。场景中的干扰物并非无关背景,而是专门设计的语义或空间干扰项:它们同样可以被接近和抓取,却不满足当前指令。机器人即使成功操作了某个物体,只要目标与指令不一致,任务仍被判定为失败。


5.jpg



Benchmark 构建:

从资产、场景到轨迹与评测

为将Text-Indispensable评测原则落地,InstructMove构建了一套覆盖资产筛选、场景生成、专家轨迹合成与分阶段评测的完整基础设施。四个环节共享统一的任务定义:资产库提供丰富且可操作的候选物体,约束生成器构造具有语义歧义的场景,运动规划模块生成可执行的专家轨迹,阶段指标则进一步区分语言grounding与操作控制能力。由此,InstructMove形成了从任务构建、训练数据生成到模型评测的一体化闭环。


6.jpg


高质量仿真资产:

兼顾语义准确性与物理可操作性


InstructMove联合无问智科,基于可交互3D世界生成引擎EmbodiedGen (https://github.com/HorizonRobotics/EmbodiedGen) ,共同构建并发布了一套面向机器人操作的高质量仿真资产库。候选资产共计3,253个,覆盖7个生活领域、18个大类和106个候选类别,包括日常器具、食品、玩具及办公用品等常见物体,并额外涵盖多类容器与放置目标。


不同于仅关注视觉外观的3D资产库,InstructMove同时检验资产的语义准确性与物理可操作性。系统利用大模型生成并交叉验证物体的类别、颜色、形状、材质和几何特征等语义信息,同时检查真实尺度、碰撞体、物理稳定性与抓取可行性;对于模型判断不一致或自动检查异常的资产,再由人工复核与修正。经过完整质量筛选后,最终选取1,757个资产、覆盖103个细粒度类别,作为Benchmark的基础对象库。这些资产不仅支持类别、属性和空间关系等不同指令的生成,也能通过快照、数据划分和可复现采样机制,灵活扩展新的物体类别、任务模板与评测场景。


任务场景生成:

让语言成为不可缺少的决策变量


InstructMove基于不同任务模板自动采样物体实例、初始姿态与空间布局,并通过约束检查保证:场景中存在多个视觉上合理、物理上可操作的候选目标,但只有一个目标与指令完全匹配。例如,在属性任务中,多个候选物属于同一类别,只有颜色、大小或材质不同;在空间任务中,目标与干扰物类别相同,只有一个满足“位于盒子左侧”等空间关系。系统还会随机化物体组合、位置、姿态、灯光和材质,在增加场景多样性的同时,确保指令指向唯一、空间关系成立且任务可执行。这种设计并非消除视觉差异,而是避免视觉显著性直接暴露答案,使视觉捷径无法稳定奏效。模型必须联合视觉观测与语言中的类别、属性或空间约束,才能从多个可操作候选项中确定正确目标。


专家轨迹合成:

从指令目标到可执行动作


在场景构建完成后,系统将任务拆解为Pick、Move、Place等可复用的原子动作,并自动生成对应的机器人执行轨迹。针对每个抓取目标,系统首先生成多个候选抓取姿态,再根据逆运动学可达性、关节运动代价和碰撞约束进行筛选。确定可执行的末端姿态后,运动规划器进一步生成平滑的关节轨迹,完成接近、抓取、移动与放置过程。所有生成轨迹还需经过自动验证,检查机器人是否抓取了指令指定的物体、完成抬升并正确放置。只有满足全部成功条件的轨迹才会进入数据集,从而保证训练数据在语义目标、物理执行和评测标准上的一致性。


分阶段评测:

区分“没听懂”与“没做好”


传统的最终成功率往往将语言理解与操作控制混为一谈:抓错物体和抓对物体但未能稳定抬起,虽然都会导致任务失败,却对应完全不同的能力问题。InstructMove因此采用面向指令目标的分阶段评估指标,记录机器人从目标定位到任务完成的全过程:


7.jpg


各阶段采用等权重计算综合得分:


123.jpg


借助这些阶段指标,InstructMove可以更准确地定位失败来源:如果机器人接近了干扰物,通常说明它没有正确理解指令;如果找到了正确目标,却未能完成抓取或放置,则更可能是操作控制失败。



操作策略能否真正实现指令跟随?

InstructMove评测了π₀、π₀.₅、GR00T N1.7和Motus四种代表性操作策略。类别与属性任务在双臂PiperX上测试,空间与组合任务在单臂Franka上测试;每个任务使用100个训练episode,并在100个held-out episode上评估。Pick任务报告Reach/Lift与综合得分,Pick-and-Place任务报告ReachPick/LiftPick/ReachPlace/Place与综合得分


8.jpg


  • π₀.₅整体表现最好:在类别、属性和组合式抓取放置任务上均取得最高得分,类别任务Reach/Lift达到0.82/0.57,属性任务达到0.81/0.62。

  • 找到目标不等于完成操作:GR00T N1.7在类别任务中的Reach达到0.76,但Lift只有0.17,说明目标定位与稳定执行之间仍有明显差距。

  • 空间关系仍是共同难点:多个模型在Pick Spatial上得分接近且整体偏低,表明理解“左侧、后方、远近”等关系,并将其转化为可靠操作仍具有挑战。



语言真的在控制动作吗?

反事实指令诊断

为了判断模型是否真正依赖语言,InstructMove设计了一组反事实实验:保持场景完全不变,只修改指令。在π₀.₅上,当指令被替换为另一个有效目标时,模型能够相应改变抓取对象,说明语言确实可以引导目标选择。但当指令模糊、为空,或描述场景中不存在的物体时,模型接近任意物体的比例仍达到0.99–1.00,抓起任意物体的比例为0.64–0.66。


这表明,当前操作模型虽然在一定程度上能够利用指令决定“抓什么”,但语言还没有完全控制模型“是否应该抓”。仅仅观察是否成功操作物体,远不足以评估语言理解能力。合格的Benchmark还应考察模型能否精准命中目标,以及能否在无效指令下避免盲目行动。需要注意的是,无有效目标条件会运行完整评测时长,而目标特定任务可能在成功抓取后提前结束,因此两类 Lift 指标不宜直接比较高低。


9.jpg



从仿真到真机:规模化数据提升真实场景指令跟随能力

我们基于双臂PiperX与π₀.₅开展了仿真到现实迁移 (Sim-to-Real) 实验。在包含至少5个视觉或语义相似干扰物的场景中,共进行50次真实机器人测试。结果表明,仿真数据能够提升真实场景中的指令目标定位,并与少量真实数据呈现出明显的互补趋势。


  • 同规模数据对比:同为200条轨迹,仿真组的Reach从真实数据组的19/50提升至26/50,Lift均为11/50。仿真中更丰富的类内实例与外观变化,首先提升了模型从强干扰物中定位指令目标的能力。


  • 仿真数据规模扩展:当仿真轨迹从200条增加到2,000条时,Reach从26/50提升至28/50,Lift从11/50提升至15/50,呈现出正向的数据规模扩展趋势。相比目标定位,更大规模数据对稳定抓取的改善更加明显。


  • Sim-to-Real联合训练:2,000条仿真轨迹与200条真实轨迹联合训练取得最佳结果,Reach/Lift达到34/50和18/50。仿真数据提供实例、外观与环境多样性,真实数据则补充传感器噪声、真实外观和接触交互等仿真难以完整覆盖的分布。


10.jpg



总结与展望

InstructMove关注一个基础但容易被忽略的问题:机器人完成了任务,是否意味着它真正理解了语言?通过在场景中加入多个可操作的候选目标,InstructMove让指令成为动作选择不可缺少的信息,从而更直接地暴露操作模型依赖视觉捷径的问题。实验表明,当前操作模型已经能够利用语言改变目标选择,但仍存在较强的通用抓取先验;空间关系理解、组合式操作以及从正确定位到稳定执行,也仍是明显瓶颈。同时,规模化仿真数据能够提升真实环境中的目标grounding,与少量真实数据结合后取得更好的迁移效果。


目前,InstructMove主要聚焦于受控场景中的抓取与放置。未来将进一步扩展至长时序任务、关节物体和更复杂的开放环境,并系统研究仿真评测结果与真实机器人能力之间的相关性。

分享文章

欢迎订阅地平线相关资讯,您可以随时取消订阅。

立即订阅

同意隐私政策,允许向我推送地平线的新闻、资讯及更多内容。

提交成功!

感谢您的订阅, 我们会第一时间推送地平线最新活动与资讯到您邮箱

6-1.jpg 618db6f9-665a-4ec5-a04a-bb65a3df9030.jpg