
让机器人学会叠衣服、开门、端杯子,最大的瓶颈不是算法,而是数据。真实遥操作每收集一个任务变体要耗费操作员10到100小时,成本高得吓人。2026年,行业的解法是「在仿真里造数据」——一整套仿真环境与数据集平台集中爆发,把机器人学习的飞轮真正转了起来。
NVIDIA 全栈:从仿真到数据集
NVIDIA 在2026年把机器人栈补齐:Isaac Sim 6.0 引入 agent-friendly 的技能与连接器,能自动完成场景准备、仿真、策略训练与评估;Isaac Lab 负责强化学习_setup_;Cosmos 3 世界基础模型生成符合物理规律的合成视频与场景变化,用来做后训练。数据集侧,GR00T X-Embodiment(训练GR00T人形基础模型的同源数据)在Hugging Face下载超1000万次,NVIDIA Physical AI Dataset 下载超1500万次;新增的GRAIL包含约50小时人形-物体交互数据,另有六类合成视频数据集覆盖机器人、物理、数字人、自动驾驶、仓储安全与空间推理。
RoboCasa365 与 benchmark 军备赛
RoboCasa由NVIDIA与得州大学奥斯汀分校主导,2026年推出扩展版RoboCasa365——365个日常任务、2500个多样化厨房环境,成为具身操作训练的主流基准。一大批模型在此「赶考」:小米Xiaomi-Robotics-1在RoboCasa365达57.4%、RoboCasa达74.5%;昆仑万维黎曼机器人Riemann-1.0在RoboCasa-365取得62.6%、领先此前SOTA 8.4%;高德ABot-M0.5在复杂任务测试领先前代SOTA 20.4%;智谱与人大联合的ZR-0人形桌面基准平均完成率69.3%。这些数字背后,是仿真平台把「评测」也标准化了。
开源力量:Genesis、DreamGen 与可微物理
学术与开源侧同样活跃。清华大学开源的Genesis用可微物理+生成式场景组合,以高吞吐生成多样化训练场景;DreamGen用视频扩散模型按语言描述直接生成操作演示,无需额外物理训练时间即可做数据增强。缩小sim-to-real鸿沟靠三条路径并行:域随机化(随机改纹理、光照、质量、摩擦)仍最常用;Cosmos的逼真渲染压低视觉域偏移;混合数据管道把合成轨迹与少量真实遥操作混合,在多个基准上优于纯仿真或纯真实。底层还有SOMA-X统一骨骼/动作/身份表示、GEAR-SONIC基于人形动作数据训自然全身技能、BONES-SEED的14万人类动作动画库,以及OceanSim水下仿真、RoboLab基准、NemoClaw把自然语言指令接入Isaac Sim。
一句话总结2026:机器人不再「靠真机一寸寸试错」,而是先在数字孪生里把千万次失败便宜地走完,再把练好的策略搬到真实世界。仿真与数据集,正成为具身智能真正的「发电厂」。