资讯动态

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

datetime

2026-10-10

阅读数量

792

田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?! 而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。 出手的是一家中国机器人公司—— 清华唯一持股的嫡系具身公司,星动纪元 。 近日,星动纪元 自研的世界动作模型VPP2 ,一举登顶 RoboDojo仿真榜单 。 综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。 关键是,这场比赛还真不好打。 RoboDojo号称 具身智能界的「珠穆朗玛峰」 ,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。 它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么? 总之,想靠刷熟练度蒙混过关,没那么容易。 结果呢? 星动纪元VPP2不仅拿下综合第一,在 泛化能力、精细操作、记忆能力 三个维度上,也拔得头筹。 据说,这次VPP2 没有额外加数据 ,也 没用Agent RSI等增强手段 , 仅靠「标准数据集」 ,就把一众高手给卷了下去。 这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。 不是,哥们儿,这么夯的模型到底是怎么练出来的啊??? 我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。 它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。 VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。 从预测到行动,两种泛化能力一起提升。 从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。 世界动作模型WAM,卷出一个新冠军 具身智能行业有个挺尴尬的现象。 机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活? 还真不好回答。 比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。 更别提那些需要连续执行多个步骤的任务了。 这也是为什么,RoboDojo这套评测值得关注。 它的目标是为具身智能建立统一、可复现的评测标准,仿真测试 包含42项双臂操作任务 ,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。 说白了,就是把机器人拉出舒适区。 传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。 RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。 而VPP2这次交出的成绩单,相当亮眼。 平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。 作为对比,在RoboDojo仿真基准的后训练评测中, GPT-6-Astra 的平均成功率为22.48%,平均得分28.97分。 而 VPP2 分别领先9.78个百分点和10.29分。 论文截图,基线模型数据取自官方排行榜 这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。 两项指标均综合了五大能力维度的测试结果。 换句话说, VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。 而且,这种领先并不局限于综合成绩。 拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。 这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。 综合成绩领先,关键能力也能打。 不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。 VPP2在仿真里展现出的泛化能力, 到了真机上还能成立吗? 星动纪元也做了实验。 这次,团队直接把VPP2 部署到真实ALOHA双臂机器人 上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。 也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。 结果,VPP2再次交出领先成绩: 平均成功率58.5%,高于π0.5的40%。 在10类任务里,VPP2拿下了9类最佳成绩。 这下有意思了。 榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。 两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。 要知道,VPP2走的是 世界动作模型(WAM)路线 。 这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预

about image