2026年5月12日,地瓜机器人D-Robotics与其合作伙伴虚时科技Intime AI联合研发的可泛化、可规模化的仿真场景生成平台——AnySceneGen正式发布。该平台充分发挥了Intime AI在生成可闭环交互3D场景的模型能力优势,并结合地瓜机器人在算力、具身模型和仿真算法与开放生态的深厚积累,为下游开发者提供高质量仿真场景生成,进而有力支持数据采集、模型训练、闭环评测等解决方案,共同推动具身智能产业突破数据瓶颈、迈向规模化发展新阶段。
当前,具身智能正处于规模化落地的关键阶段,然而数据瓶颈已成为制约行业发展的核心挑战。真机实采数据人力密集度高、硬件成本高昂,且无法适配强化学习、评测等环节,无法独立支撑具身模型规模化训练并推动智能涌现。此外,近期学术界和产业界的多项工作表明,基于纯仿真数据的训练即可实现极高的Zero-shot成功率,仿真数据的重要性正在得到更多地关注和认可,并有望成为打破数据墙、实现具身智能大规模落地的关键一环。然而,仿真数据面临的一个关键困境是:在仿真器中进行实验和数据采集的可闭环交互的仿真空间高度依赖人工建模,无法实现规模化生产。对于当前具身智能尚未实现Scaling的阶段而言,数据的规模以及多样性至关重要——这恰恰是Intime AI技术能力的核心优势所在。Intime AI首创Code-to-Space技术方案,通过深度发掘空间感知层背后的空间结构、尺度关系、功能逻辑、交互方式和物理约束等空间信息并将其压缩至可推理、可编辑、可执行的结构化表示,成功实现了高质量、高可控性仿真空间的批量生成,且视觉物理属性与力学物理属性均满足下游使用需求。AnySceneGen平台系Intime AI与地瓜机器人的联合研发项目,定位为具身智能生产批量化可闭环交互的仿真空间。用户可基于多模态输入快速构造多类型的场景及资产,结合自身需求生成对应的仿真数据并进行模型训练。在技术架构层面,AnySceneGen并非传统意义上的视觉3D内容生成平台,而是面向机器人训练的仿真场景与资产生成平台。平台采用基于Mesh的结构化输出方案,相较于NeRF、3DGS等技术路径,更适用于机器人仿真训练、物理交互与可执行任务建模。同时,AnySceneGen生成的场景具备高度可控和可编辑能力。开发者可根据训练需求,对空间布局、物体属性、交互逻辑、材质风格以及任务约束进行灵活调整,从而快速构造具备多样性与泛化性的仿真训练环境。相较于传统人工建模和手动搭建仿真场景的流程,AnySceneGen能够显著提升仿真空间生成效率,并有效降低具身数据生产成本。此外,平台生成的空间不仅具备高质量视觉属性,也在生成过程中自动生成并写入碰撞体、物理材质、尺度关系、运动约束等物理属性信息,可进一步提升机器人在仿真环境中的交互真实性与训练稳定性,为后续 Sim2Real泛化提供更坚实的数据基础。此次合作中,地瓜机器人具身算法团队提供了桌面级仿真场景生成方案TableTopGen,为AnySceneGen平台提供带有物理属性的数据资产和场景布局。TableTopGen是业界目前SOTA的桌面级场景生成方案,它是全自动的统一生成框架,可从文本或单张图像直接生成多样化、实例级、可交互的 3D 桌面仿真场景,填补了具身仿真中对高质量、可交互桌面环境的需求空白。目前,AnySceneGen平台已经深度集成了地瓜机器人的TabletopGen的最新版本,并结合 Intime AI 的 InteriorGen 能力,将场景生成范围从桌面级操作场景进一步扩展到室内空间级仿真场景。在此基础上,地瓜机器人的具身团队已经开始使用该平台生成两类关键仿真数据:一类是Loco-Manipulation数据,主要面向硬件本体在仿真场景中的导航与操作训练,截止目前已生成超过 100 万 episodes;另一类是空间感知数据,主要涉及多目异构相机在空间中的深度或点云真值,截止目前已生产超过1000万帧。初步实验验证,对于复杂操作任务,仅采用仿真数据训练的模型在真实场景中实测的成功率可达到90%,可大量节省真实场景数据采集成本。
- 平台将分阶段推进场景覆盖能力:从小规模桌面场景起步,逐步扩展至家庭房间、办公场所、工厂、超市、商业区等室内场景。现阶段重点聚焦机器人操作任务,尤其是桌面场景下的操作训练;后续将进一步支持导航与操作结合的复合任务和空间感知数据,为下游开发者提供更丰富的训练场景支撑。
- 双方联合研发,形成优势互补:AnySceneGen平台由Intime AI和地瓜机器人各自提供了相应的核心算法能力,并充分依托地瓜机器人全栈工具链能力与开放生态优势,为地瓜机器人进一步完善“芯片+算法+开发者生态”全链路布局迈出了关键一步。