
让机器人动起来并不难,难的是让它「看懂世界、想清楚再动手」。2026年,具身智能的突破集中发生在「大脑」层——视觉-语言-动作(VLA)模型与世界模型正快速成熟,业内开始用「机器人领域的GPT-3时刻」来形容这轮组合泛化的跃迁。

VLA:从「单任务」到「组合泛化」
Physical Intelligence发布的π0.7被多方称为里程碑,核心卖点是组合泛化——把学会的原子技能重新组合去解决没见过的任务,而不是每个动作都重新训练。国内方面,腾讯HyVLA-0.5以4B参数的MoT结构叠加370M动作头,在约1万小时数据上训练,关键动作成功率提升到94%–99%;中科第五纪的FAM-1.3在MetaWorld基准上仅用5个样本就达到89.1%的成功率,显示出小样本适应能力。
慢思考 + 快执行:双系统架构兴起
长程任务是机器人落地的真正门槛。罗剑岚与智元联合推出的τ0-VLA采用「慢思考、快执行」双系统,以约40115小时预训练为支撑,把长程任务成功率从27.5%提升到45%,让机器人能规划多步再连贯执行。陈建宇团队的Ctrl-World在世界模型基准WorldArena登顶,主打可模拟环境反馈的「世界模型」,让策略在想象中试错。
世界模型与协同进化:让机器人「在脑内预演」
世界模型的价值在于给策略提供可微的「沙盒」。上交大OrbiSim给出可微物理引擎,清华星海图的Fast-WAM把单步推理压到190毫秒,让实时闭环成为可能。VLAW框架则探索「VLA与世界模型协同进化」——一个负责执行、一个负责想象与评估,互相喂数据。
海外侧,Gemini Robotics 1.5与ER 1.6在仪表读取等任务达到93%准确率,GenieReasoner(智元FACT)强化推理,NVIDIA Cosmos 3继续提供大规模世界生成底座。当「大脑」开始具备组合、推理与预演能力,机器人离真正通用的那一天,又近了一截。