开发者说|地平线发布EmbodiedGen V2:面向具身策略学习的生成式仿真基础设施

2026/08/03

面向具身策略学习的生成式仿真基础设施.jpg


更多机器人演示、技术细节和代码更新可见项目主页与技术报告。


• 项目主页

horizonrobotics.github.io/EmbodiedGen

• 技术报告

arxiv.org/abs/2607.07459

• 开源代码

github.com/HorizonRobotics/EmbodiedGen


生成式3D大模型正在快速提升物体与场景的视觉质量,但具身策略模型学习对生成场景提出了更严格的要求。机器人所需的是可执行的任务环境:场景具有真实物理属性,满足任务与导航约束,交互区域能够被定位和验证,可以在多仿真器之间稳定部署。当前技术链条的主要断点,已经从“能否生成3D内容”转向“能否将生成内容组织为可直接进入策略训练的sim-ready任务环境”。EmbodiedGen V2延续V1对生成式3D世界引擎的探索,并将系统能力进一步推进到面向具身策略的完整policy-ready环境生成。


EmbodiedGen-V2以统一sim-ready表示贯穿任务驱动世界生成、大尺度场景生成、3D空间编辑、跨仿真器部署与闭环策略学习。.jpg

EmbodiedGen V2以统一sim-ready表示贯穿任务驱动世界生成、大尺度场景生成、3D空间编辑、跨仿真器部署与闭环策略学习。



Sim-ready资产生成管线

开放世界中的任务环境不能仅依赖有限的手工资产库。EmbodiedGen V2可接入TRELLIS、SAM3D、Hunyuan3D等生成后端,并统一处理文本、图像和局部遮挡图像三类输入。资产生成会依次经过输入处理、质量检查、网格修复与简化、纹理烘焙、物理属性恢复和跨格式导出,以“生成—校验—重试”抑制语义偏移和残缺几何。几何处理进一步将视觉模型转化为物理实体,凸分解为复杂视觉网格生成紧凑的碰撞代理,并导出为URDF、MJCF或USD等仿真器格式。


Sim-ready资产生成自动化管线.jpg

Sim-ready资产生成自动化管线


在200个独立测试资产上,生成管线达到96.5%的人工可接受率和98.6%的碰撞测试成功率。生成范围不局限于刚体资产,也支持柔性物体,支持向更复杂的物理对象扩展。


资产生成与柔性物体仿真



资产Affordance自动标注

Affordance描述机器人可以在何处、以何种方式与资产对象交互。EmbodiedGen V2先对网格进行功能部件分割,再用几何后处理修正边界噪声,并由视觉语言模型合并语义上属于同一功能部件的碎片区域。最终标注连接部件语义、三维接触区域和可执行动作,使生成资产能够直接进入操作与评测任务。


资产Affordance自动生成管线



任务驱动的交互世界生成

面向策略模型的环境生成不能止于房间类别或物体清单,还应包含对象角色、空间关系、机器人可达性和执行约束。以操作任务描述“把西兰花放到白色碟子里”为例,系统需要生成的不仅是泛化的厨房外观,而是包含背景、操作台、目标对象、干扰物与机器人初始位姿的完整任务环境。


自然语言任务驱动可执行交互世界生成



导航与移动操作场景生成

桌面布局能够支持局部操作,却无法覆盖长程导航和移动操作所需的空间范围,其要求环境具有真实房间拓扑、可穿行开口、连续自由空间和可独立寻址的语义实例,而非由单一网格构成的视觉背景。EmbodiedGen V2的大尺度场景生成模块可根据任务选择单房间或整屋生成,并以四档复杂度控制家具与杂物密度。生成的场景既可独立服务于导航与多房间探索,也可以作为Scene Graph的背景节点,与任务相关前景资产组合为完整的移动操作环境。


导航与移动操作大场景生成



仿真场景3D Vibe Coding

任务环境的构建通常包含多轮生成、组合、局部修改与物理验证。传统prompt-to-scene方法往往在每次指令后重新生成完整场景,难以保留对象身份、历史操作和已经验证的物理状态。EmbodiedGen V2将这类持续式自然语言编辑定义为面向sim-ready 3D世界的Vibe Coding。


自然语言vibe编辑3D世界



跨仿真器复用

生成环境要成为通用仿真基础设施,还需要跨越不同物理引擎的格式与接口差异。逐资产、逐场景进行人工转换会使规模化生成退化为定制工程,也难以保证视觉几何、碰撞代理与物理属性在不同后端中的一致性。EmbodiedGen V2以URDF作为统一中间表示,并自动转换为MJCF与USD,使同一资产和标准化布局能够部署到主流仿真器,使场景生成与仿真器适配解耦。


同一场景在主流物理仿真器中加载



下游闭环验证

EmbodiedGen V2将生成世界的评估从视觉合理性扩展到下游可执行性。生成式3D仿真环境因此进入机器人策略的数据闭环:环境不仅被加载和展示,还被用于在线学习、状态展开和真机部署。在下游的sim-to-real 强化学习研究中,从真机数据预训练得到VLA (π0) 模型,在仅使用EmbodiedGen生成的环境中在线强化学习。仿真任务成功率从9.7%提升至79.8%;在12个不同的真实场景与任务下,真机任务成功率从21.7%提升至75.0%。


生成仿真环境中在线强化学习与Sim2real部署



面向具身智能的

生成式仿真基础设施

EmbodiedGen V2的重点并不是生成更多可观看的三维内容,而是使生成世界成为可被机器人持续使用的训练、评测与部署载体。生成世界可以在自然语言对话中持续演化,基于模型试错失败表现进行动态刷新。也可以跨仿真器复用,并最终进入策略训练、评测和Sim2real部署。3D生成由此不再位于具身智能流程的外围,而成为连接任务描述、机器人学习与真实部署的仿真基础设施。

分享文章

欢迎订阅地平线相关资讯,您可以随时取消订阅。

立即订阅

同意隐私政策,允许向我推送地平线的新闻、资讯及更多内容。

提交成功!

感谢您的订阅, 我们会第一时间推送地平线最新活动与资讯到您邮箱

6-1.jpg 618db6f9-665a-4ec5-a04a-bb65a3df9030.jpg