AI 日报hiw3c.com

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

量子位 www.qbitai.com 网页快照

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

田晏林 发自 凹非寺 量子位 | 公众号 QbitAI

而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。

近日,星动纪元 自研的世界动作模型VPP2 ,一举登顶 RoboDojo仿真榜单 。

RoboDojo号称 具身智能界的「珠穆朗玛峰」 ,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

星动纪元VPP2不仅拿下综合第一,在 泛化能力、精细操作、记忆能力 三个维度上,也拔得头筹。

据说,这次VPP2 没有额外加数据 ,也 没用Agent RSI等增强手段 , 仅靠「标准数据集」 ,就把一众高手给卷了下去。

这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。

世界动作模型WAM,卷出一个新冠军

机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试 包含42项双臂操作任务 ,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

作为对比,在RoboDojo仿真基准的后训练评测中, GPT-6-Astra 的平均成功率为22.48%,平均得分28.97分。

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

换句话说, VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

这次,团队直接把VPP2 部署到真实ALOHA双臂机器人 上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

从预测泛化到行动泛化,VPP2怎么做到的?

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者 「解耦」 ,重新 「排序」 。

第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。

第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。

第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

第一个突破:让视频预测具备泛化能力

星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。

在机器人操作视频的指令遵循测试中, 14B参数 的VPP2达到 90% 的成功率,而64B参数的Cosmos3模型为78%。

这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。

第二个突破:让预测泛化变成行动泛化

这里有两道坎,一是 速度 ,二是 如何在学会动作的同时,保住视频模型原有的泛化能力。

第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。

团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。

前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。

VPP2引入一个 0.9B参数 的扩散Transformer(Action DiT), 采用MoT架构 ,学习如何根据预测的未来状态生成机器人动作。

在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。

相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。

最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒, 整体动作片段生成延迟约为0.22秒。

前面提到的 ALOHA真实机器人零样本测试 ,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。

LIBERO-Pro 考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。

LIBERO-OOD 则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。

再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。

VPP2再次说明, 优化数据管线、调整训练范式 ,这些看似朴素的工程方法, 仍然有机会带来可观的模型性能提升。

从GPT到WAM,物理AI正在形成新范式

预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。

前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。

团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。

结果相当直观。在RoboDojo选定的长程任务测试中, 引入VLM子任务规划后 ,平均成功率从27.6%提升至 57.6% 。

这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。

顺着这条思路往后看, GPT+VPP2 有望形成一种 新的物理AI技术范式 :通用认知+通用物理执行。

GPT等通用模型负责理解意图、推理和规划,VPP2这样的WAM负责预测物理变化、生成动作,再通过执行反馈持续调整。

模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。

星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释: 公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。

星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在 全国5个省市、10余个物流中心常态化运营 。

物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。

当然,已有物流业务的商业化进展,并不意味着VPP2已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。

从仿真到真机,从预测泛化到行动泛化,VPP2的一系列实验结果表明: 视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。

而随着GPT等通用认知模型与WAM进一步结合,物理AI也有望形成更完整的能力体系。

1.开源代码 :https://github.com/roboterax/video-prediction-policy-2 2.项目主页: https://robert-gyj.github.io/video-prediction-policy-2

AI算力硬合作,马斯克还是更相信中国制造 2026-10-04

最火AI岗位FDE:月薪5万,都干这些… 2026-10-04

工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路 2026-09-28

相关阅读

从看懂世界到做对动作,卧安机器人OneModel 1.7用一条「隐式通路」打通了具身智能的关键断层

机器人原生世界动作模型问世!首创时空一体架构,复旦系团队出品

热门文章

openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

丘成桐新论文致谢了GPT和Claude

arXiv最严新规!每人每月最多提交2篇,拒稿不退额度

OpenAI安全团队持续地震!负责人离职,三名员工因泄密被开

DeepSeek扩招!弹性计算团队大量HC,尤其需要资深工程师

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1