清华北大牵手MIT,机器人“练武场”横空出世:这个测试系统让30款机器人露出了真本领

这项研究由香港大学、清华大学、北京大学、麻省理工学院、斯坦福大学、加州大学伯克利分校等全球十余所顶尖高校与研究机构联合发布,论文编号为arXiv:2607.04434,于2026年7月发表。有兴趣深入阅读原始研究的读者可通过该编号在arXiv平台检索全文。

**机器人能干活了,但我们怎么知道它"干得好不好"?**

现在的机器人越来越厉害了。它们能叠衣服、倒水、摆积木,甚至能理解"把红色的杯子放到蓝色的碗旁边"这样的语言指令。从实验室演示视频来看,这些机器人简直让人惊叹不已。然而,这里藏着一个很少有人关注却极为关键的问题:我们怎么判断一台机器人到底有多强?靠什么来比较不同机器人之间的差距?

这就好比参加厨艺大赛,如果只让选手们炒同一道鸡蛋炒饭,你根本无法判断谁更全面、谁在压力下容易翻车、谁只会按菜谱来而不懂随机应变。要真正考察一个厨师的水平,你需要设计复杂多样的考题——有刀工精细的、有需要长时间炖煮的、有必须凭记忆还原菜谱的,还有要在嘈杂环境里保持稳定发挥的。

机器人领域正面临同样的困境。现有的测试方案,要么任务太简单,要么只在电脑模拟环境里做,要么只在真实物理环境里做,两者很难统一比较。更棘手的是,不同团队用各自的设备和场地测试机器人,就像每个厨艺评委的打分标准都不一样,最终结果根本没法横向对比。

正是为了解决这个困境,这支由全球十余所顶级院校组成的庞大研究团队打造了一套名为**RoboDojo**的机器人综合评测系统。这套系统的野心很大:它既要在电脑模拟环境里快速、大批量地测试机器人,又要在真实物理世界里用标准化硬件做可复现的测试;它既关心机器人能不能泛化到没见过的场景,又关心它能不能完成需要记忆的任务、精细动作的任务、长流程的任务,以及理解全新语言指令的任务。这套系统还附带了一个公开排行榜,并整合了超过30款机器人策略模型,可以直接拿来训练和测试。

---

**一、为什么以前的测试"不够用"**

在RoboDojo出现之前,机器人研究领域其实已经有不少测试基准了。比如CALVIN主要考察机器人能不能根据语言指令完成一系列连续动作;LIBERO专注于机器人如何在不同任务之间迁移已有经验;RoboTwin着重测试双臂协作和泛化能力;还有一些基准专门测试折叠衣服、插管子这类精细动作。

但这些测试方案各有局限,就像几位各有专长的裁判,每人只负责评判其中一项,却没有人统筹全局。模拟环境测试能快速给出反馈,但它没法完整还原真实物理世界里的摩擦力、接触误差、噪声干扰——一个在模拟里表现出色的机器人,放到真实桌面上可能立刻不知所措。真实物理测试则准确,但每次重置场景要花大量人力,不同实验室的灯光、桌子、摄像头摆放位置都不一样,测出来的结果根本无从比较。

更关键的问题是,大多数测试方案的任务设计比较单一。任务变化主要体现在换个颜色、换个位置、换个说法,本质上还是同一类动作的重复,并没有真正考察机器人在面对"截然不同的挑战"时的表现。

RoboDojo团队意识到,要真正衡量一台机器人的综合实力,需要从根本上重新设计评测体系。

---

**二、RoboDojo的"考场"长什么样**

RoboDojo的评测体系分成两大部分,就像一场包含笔试和实操的综合考试。

笔试部分是在电脑模拟环境里进行的,共设计了42个任务,全部基于一种叫ARX X5的双臂机器人平台,两条机械臂基座之间相距0.6米。这42个任务并非随意堆砌,而是按照五个能力维度精心分类,每个维度考察的是截然不同的核心能力。

第一个维度叫"泛化能力",共12个任务,核心问题是:机器人能不能在从没见过的场景下完成任务?这里的"场景变化"非常全面——背景换了、灯光变了、桌面多了一堆乱放的无关物品、目标对象的外观也不同了。相比之前的同类测试,RoboDojo把桌面上的干扰杂物数量从最多10个提升到了最多25个,让视觉环境更加混乱。与此同时,训练数据里还额外提供了100段在复杂随机背景下录制的辅助演示数据,帮助机器人提前见识各种视觉变化,但这些数据和真正的考试任务完全独立,不存在"提前泄题"的问题。

第二个维度叫"记忆能力",共6个任务,专门考察机器人在"关键信息消失之后还能不能记住并正确行动"。这类任务特别难,因为机器人只能看到"当前这一帧画面",但正确答案却藏在几秒甚至几十秒前的某个瞬间里。举个具体例子:在"传送带匹配抓取"任务里,传送带先把一个物体运到面前展示了一下,然后把它带走了;接下来,机器人需要从后续陆续出现的物体中,认出并抓取和刚才那个相同类别的物体。另一个任务叫"模仿排序",旁边的另一条机械臂会按某个特定顺序把物体放进篮子里,机器人必须记住这个顺序,然后用自己这边的物体重现同样的排列。这些任务在考察的根本不是视觉识别,而是跨时间的信息保持与利用能力。

第三个维度叫"精细操作能力",共8个任务,要求机器人在极小的容错空间内完成动作。代表性任务包括把细管子插进窄孔里、把硬币精确插入存钱罐的细缝里、把充电器接口对准插孔插入、用小锤依次敲打木琴的每个琴键。在这些任务里,哪怕定位差了几毫米,动作就会失败。

第四个维度叫"长流程执行能力",共8个任务,考察的是机器人能不能完成由多个步骤环环相扣组成的复杂任务。比如"整理桌面"需要机器人把鼠标放到鼠标垫上、把键盘推进支架、把小摆件放到展示台、把闹钟放到抽屉顶部,然后打开抽屉,再把剩余杂物一一放进去。每一步都是前一步的前提,任何一步出错,整个流程就崩了。

第五个维度叫"开放指令执行能力",共8个任务,而且这些任务没有提供专属训练数据。机器人必须凭借在其他任务里学到的技能,理解全新的语言指令并重新组合执行。比如"通用抓取"任务会让机器人抓起某个特定物体,但这个物体和这个抓取目标的组合在训练时从未出现过;"按语言指令叠积木"会让机器人按照指定颜色顺序叠放积木,颜色组合在训练时也是全新的。这个维度考察的本质是:机器人有没有真正"理解"任务,还是只会死记硬背?

实操部分则是在真实物理世界里进行,共设计了18个任务,分布在三种不同的双臂机器人平台上,分别是ARX X5、Piper和Piper X。每个平台负责6个任务。这种多平台设计是刻意为之的——研究团队想知道,一台机器人能不能在不同的机械臂结构、不同的工作空间、不同的摄像头位置下都保持稳定发挥,而不是只擅长某一款设备。

---

**三、标准化"考场"是如何搭建的**

在模拟环境里做测试相对容易,因为一切都是数字化的,可以精确复现。但真实物理测试历来是"重灾区"——各家实验室的桌子高低不同,灯光强弱各异,摄像头角度五花八门,操作员重置场景的方式也有差别,导致同一台机器人在不同地方测出来的成绩根本没法比较。

为了彻底解决这个问题,研究团队专门设计了一套叫做**RoboDojo-RealEval**的标准化物理评测平台。这套平台的每一个细节都被固定下来:桌面尺寸固定为1.2米乘1.2米的白色工作台,台面铺可更换的白色桌布;外框架尺寸固定为1.5米乘1.5米乘2.1米;左右两侧和顶部挂上黑色遮光帘,隔绝外部光线干扰;三条固定安装的LED线性灯提供稳定均匀的照明;机械臂底座之间的相对位置和距离通过定制结构件固定;摄像头安装在钢管和专门3D打印的支架上,位置锁定不会偏移;每台机器人配备一个头顶摄像头和两个腕部摄像头,头顶摄像头使用Gemini 335L,腕部摄像头使用Gemini 305。

场景重置环节同样被标准化了。每次测试开始前,操作员会在触摸屏界面上看到一张目标场景的参考图片,这张图片会半透明地叠加在实时摄像头画面上。操作员只需要调整桌面上各个物体的位置,直到实时画面和参考图片对齐,就完成了场景重置。测试期间,如果机器人出现了可能损坏设备的危险动作,操作员可以立即按下紧急停止按钮。所有测试过程都会被录像,然后由三名互相不知道对方评分的独立评审观看录像打分,最终取平均值作为该次测试的得分。

这套系统还支持远程云端评测——参赛团队不需要把自己的机器人模型公开,只需要运行一个远程策略服务器,通过标准化通信协议和RoboDojo的物理平台通信,就可以完成全套真实环境测试。

---

**四、训练数据:给机器人准备的"教科书"**

要评测机器人,首先得给它机会学习。RoboDojo提供了大量标准化的演示数据供机器人训练。

模拟环境的训练数据共包含3500段演示录像,覆盖35个任务目录,总帧数超过186万帧,相当于约20.66小时的双臂操作视频,全部以每秒25帧的速度录制。其中34个目录对应泛化、记忆、长流程、精细操作四个维度的训练任务,每个任务提供100段演示。另有1个辅助目录提供100段在复杂随机背景下录制的额外数据,专门用于帮助机器人提高视觉鲁棒性。开放指令维度的任务刻意不提供专属训练数据,就是为了考察机器人有没有真正的技能迁移能力。

演示数据的收集方式分两种。对于可以自动化的任务,团队开发了自动化轨迹合成系统,把复杂任务拆解成"抓取、放置、交接、插入、打开、关闭、叠放、推压"等基础技能模块,每个模块自动与任务中具体物体的操作区域对接,然后通过运动规划算法自动生成整段演示轨迹。对于自动化难以胜任的任务,团队使用了VR遥操作系统,操作员戴上Meta Quest或Pico头显,通过手柄控制虚拟机械臂完成任务,实时生成高质量演示。

真实环境的训练数据则包含1800段演示录像,覆盖三种机器人平台上的18个任务,总帧数超过161万帧,约合17.91小时的操作视频。每个任务由四名不同的操作员各贡献部分录像,这样做是为了让训练数据包含不同人的操作习惯,避免机器人只会模仿某一个人的固定模式。所有演示录像都经过人工审核,确保任务成功完成、操作流畅、符合标准化重置要求,不合格的录像会被筛除。

---

**五、帮所有机器人"穿同一件衣服"的工具箱**

即便有了标准化的任务和数据,还面临另一个现实问题:不同机器人策略模型的内部架构千差万别,使用的数据格式、训练脚本、部署方式也各不相同。要把30多款模型都接入同一个评测流程,工程量堪称巨大。

为此,研究团队专门开发了**XPolicyLab**,这是一套统一的机器人策略开发和部署基础设施。可以把它理解为一种"万能转接头"——不管机器人模型内部构造有多不同,只要接上这个转接头,就能用同一套接口和RoboDojo的模拟环境与真实测试平台通信。

XPolicyLab的设计分三个层次。在数据格式层面,它负责把RoboDojo的原始轨迹数据转换成各个模型所需的格式,比如HDF5文件、LeRobot风格数据集、预计算的语言嵌入向量等。在模型接口层面,每个接入的模型只需要实现三个基本方法:更新观测数据、预测下一步动作、重置内部状态。对于并行模拟评测,还支持批量版本的接口,可以同时给多个并行模拟环境提供动作预测。在通信协议层面,XPolicyLab使用WebSocket保持模型服务器和评测环境之间的持久连接,用MessagePack把图像、机器人状态、动作指令等数据压缩成紧凑的二进制格式传输,延迟低、效率高。

通过XPolicyLab,研究团队成功接入了30款代表性机器人策略模型,覆盖了扩散策略、视觉-语言-动作大模型、世界模型驱动的控制策略等多种技术路线。这些模型都在同一套数据和同一套评测协议下训练和测试,结果具有真正的可比性。

---

**六、并行加速:让评测跑得更快**

42个任务、每个任务50次试验、多个模型、多个随机种子——这意味着单次完整评测需要运行超过两千个独立试验。如果每次只跑一个场景,等到天荒地老也测不完。

RoboDojo的解决方案是**异构并行模拟**。传统的并行模拟通常要求所有并行实例共用同一个场景模板,只允许改变物体位置和随机种子,本质上还是在重复同一个场景。这种做法对评估泛化能力非常不利,因为场景多样性不够。

RoboDojo的异构并行模拟允许同时运行的不同模拟环境拥有完全不同的场景配置——不同的物体类别、不同数量的干扰杂物、不同的关节结构、不同的背景纹理。每个环境独立管理自己的任务状态、随机种子、摄像头数据流和成功判定条件,同时共享同一套批量推进和动作分发接口,在多块GPU之间并行运行。

实测结果表明,开启异构并行模拟后,模拟评测的吞吐量可以达到每秒77.4次交互(在零动作基准下),比不开启异构模式时的每秒40次快了将近一倍。加上模型推理之后,整体吞吐量仍能维持在每秒64次,约为非异构模式的1.63倍。完整跑完一轮包含164万帧的模拟评测,异构并行只需约5小时53分钟,而非异构模式则需要超过11小时。

真实物理评测的效率同样有数据支撑。以π0.5这个模型为例,完成所有18个任务、每个任务10次试验、共180次真实测试的全部流程,总耗时约为202分钟,即不到3.5小时。平均每个任务10次试验耗时约11.2分钟。这对于物理机器人测试来说已经相当高效。

---

**七、30款机器人上擂台:成绩单揭晓**

在模拟评测的成绩单上,整体结论可以用一个词来形容:差距悬殊。

人类专家操作员(每人都有超过1000小时的模拟遥操作经验)在同样的任务和时间限制下,平均成功率达到76.03%,平均得分达到80.42。而表现最好的机器人模型**Hy-Embodied-0.5-VLA**,平均成功率只有8.80%,平均得分13.07。换句话说,即便是当前最顶尖的机器人策略,完成这套任务的成功率也只有人类的约九分之一。

这个差距并非因为任务对机器人来说根本不可能完成,而是因为任务设计的确非常全面且具有挑战性。人类能完成,说明任务是可行的;机器人大幅落后,说明当前技术确实还有很大提升空间。

从不同维度的成绩来看,各个模型展现出了各不相同的"偏科"现象。Spatial Forcing在泛化维度表现最强;X-VLA在精细操作上领先群雄;π0.5在开放指令维度相对突出;而Hy-Embodied-0.5-VLA则在长流程和记忆维度上拿下第一,并凭借均衡发挥赢得总分第一。但即便如此,这些"领先"都是相对意义上的,因为哪怕在表现最好的维度,最高成功率也不超过15%。

泛化维度的结果尤其值得关注。在"标准"设置(场景固定不变)下,各模型的表现尚可;但切换到"随机化"设置(背景、灯光、杂物、目标物体全部随机变化)之后,几乎所有模型都出现了大幅崩塌。以成绩最好的模型Hy-Embodied-0.5-VLA为例,标准设置下得分21.98,随机设置下暴跌至1.57,相对下跌幅度高达92.9%。Spatial Forcing的表现相对韧性更强,标准设置21.25分,随机设置6.98分,跌幅约为67.2%,优于其基础模型π0.5的72.2%跌幅,说明其3D空间表征对抗场景变化有一定效果,但绝对分数依然很低。总体来看,当前机器人对视觉和场景分布变化极度敏感,稍有变化就容易"认不出"该怎么做。

长流程维度的发现也颇为微妙。最高成功率虽然只有约15%,但如果看"得分"而非"成功率",差距会稍微小一些。这说明很多机器人能完成任务的前半段,却总在某个中间环节掉链子,导致整个任务以失败告终。就像接力赛跑,前三棒都跑得不错,偏偏最后一棒的接棒出了差错。各个步骤的技能并不能自然地串联成流畅的整体。

精细操作维度揭示了一个有趣的现象:整体排名第一的Hy-Embodied-0.5-VLA,在精细操作上反而被X-VLA和Spatial Forcing超越。这说明强大的整体任务执行能力,并不等于精准的局部控制能力。通过观察机器人的实际操作视频,研究团队发现很多精细操作失败的根源不是"不知道要做什么",而是"知道但做不精准",或者在某个前置动作失败之后仍然继续执行后续步骤,完全无视"前置条件没有满足"这一事实,呈现出明显的开环执行特征。

记忆维度的表现同样耐人寻味。Hy-Embodied-0.5-VLA凭借大规模预训练取得最高分;采用专门记忆模块设计的EventVLA也有一定优势;而以"世界模型"方式隐式建模时间信息的X-WAM,在部分完成度上不错,但在需要精确回忆关键历史时刻的任务上,最终成功率依然不高。这说明"记住有用信息"和"在正确时机正确使用这些记忆"是两个不同的能力,目前两者兼备的模型还很少见。

开放指令维度则是最惨烈的战场。所有模型的表现都接近于零,连最好的π0.5也只有1.67%的成功率和1.98的得分。这意味着:当被要求用以前没有专门训练过的语言指令来完成任务时,几乎所有当前的机器人模型都束手无策。即便这些模型的背后是强大的视觉语言理解基础,从"理解语言"到"执行物理动作"之间的鸿沟依然难以跨越。

真实物理评测的成绩同样不容乐观。表现最好的π0.5在18个真实任务上的整体成功率只有12.8%,得分22.9。人类专家遥操作的成功率则是100%、满分100分。与模拟评测的排名对比来看,两个榜单并不完全一致——InternVLA-A1和GalaxeaVLA在真实测试中的相对排名比模拟里更高,而另一些在模拟里表现不错的模型在真实环境里明显退步。这说明模拟成绩和真实表现之间存在有意义但不完全的关联:模拟测得的能力可以捕捉到一部分真实能力,但真实物理世界的接触噪声、执行器误差、相机标定偏差、积累漂移等因素会暴露出模拟里看不到的弱点。

真实测试还揭示了一些单纯看成功率无法发现的问题。其中一款模型DM0在真实机器人上频繁产生不稳定的控制信号,导致机械臂出现剧烈抖动,研究人员不得不密切监控,随时准备按下紧急停止键。这种问题在模拟里顶多降低一点分数,而在真实机器人上则可能损坏设备、伤害旁边的人,性质完全不同。

---

**八、评测结果有多稳定?**

任何评测系统都面临一个基本质疑:这个分数是否稳定可信?同一个模型在不同时间、不同GPU上测出来的分数会不会有很大波动?

研究团队专门做了稳定性验证实验。模拟评测方面,在三块不同的RTX 4090 GPU上分别运行相同的模型,每块GPU用三个不同的随机种子各跑一遍。结果显示,跨GPU的成功率标准差最大只有1.1个百分点,得分标准差最大只有1.07分。综合平均指标上,成功率标准差不超过0.5个百分点,得分标准差不超过0.49分。这说明模拟评测的结果非常稳定,不同GPU和不同随机种子带来的随机性影响极小。

真实物理评测方面,研究团队让三个模型(π0.5、GalaxeaVLA、InternVLA-A1)各完成三轮完整的真实测试,每轮覆盖所有18个任务、180次试验。三轮之间,综合成功率的标准差最大只有1.3个百分点,综合得分标准差最大1.2分。单个任务层面偶尔有较大波动,尤其是涉及精细接触或多步骤操作的任务,但这在真实机器人测试中属于正常范围,聚合到全套任务的整体指标之后,波动就被充分平均掉了。

这些数据说明,RoboDojo的评测结果是可信赖的,不是碰运气碰出来的。

---

**九、这一切意味着什么,接下来会怎样**

RoboDojo不是一个静态的成绩单,而是一个持续更新的开放平台。排行榜会定期更新,欢迎全球研究团队提交新的机器人策略模型参与评测。为了确保公平性,排行榜由非营利基金会AI MMLab Club负责维护,全球多所学术机构联合监督,任何商业公司都不参与官方评测流程。

想要在官方排行榜上发布成绩,需要满足几个条件:必须通过RoboDojo的官方在线评测系统进行测试;模拟测试需要用三个随机种子各跑一遍,报告均值和标准差;真实测试需要覆盖ARX X5、Piper、Piper X三种机器人平台;模型还需要通过隐藏布局验证,防止针对公开测试场景进行过度调优;最后,在公开成绩的同时,必须通过XPolicyLab开源训练代码、部署代码、配置文件和可复现说明,让任何人都能独立验证结果。

这套规则的设计理念是:分数不仅要高,还要真实可信、可被他人重现,而不是在特定设置下反复调参"刷"出来的。

未来,RoboDojo还计划扩展到更多方向,包括灵巧手操作、人形机器人全身操控、触觉感知操作,以及移动机器人操作——把机器人从桌面延伸到更广阔的空间。每个新方向都计划支持多种机器人平台,让不同硬件之间的比较成为可能。

归根结底,RoboDojo做的事情,是给机器人领域建了一个相对公平的"武道场"。它告诉我们,当前最好的机器人在最难的任务上,离人类水平还差得很远;但它同时也给出了一张清晰的地图,让研究者知道自己在哪里最强、在哪里最弱,下一步该往哪个方向努力。这比单纯说"我的机器人很厉害"要有意义得多。

有兴趣深入了解完整技术细节的读者,可以通过arXiv编号2607.04434查阅原始论文,或访问RoboDojo-Benchmark.com获取基准测试数据、代码和实时更新的排行榜。

---

Q&A

Q1:RoboDojo评测系统和之前的机器人基准测试有什么本质区别?

A:RoboDojo最核心的区别在于同时覆盖了模拟和真实两个评测环境,而且任务按五个能力维度设计,不只是重复同类动作。之前的基准通常只在一种环境里测,而且任务多样性有限。RoboDojo还提供了标准化硬件平台RoboDojo-RealEval,让不同团队在相同条件下测试,结果可以真正横向比较。

Q2:RoboDojo测出来成功率这么低,是不是说明机器人技术还很落后?

A:这个结论需要谨慎理解。RoboDojo的任务设计本身就很难,人类操作员在同样条件下成功率也只有76%左右,而非100%。机器人约9%的成功率确实远低于人类,但这说明的是当前技术距离"全能型"机器人还有很大差距,并不代表机器人在所有简单任务上都不行。RoboDojo的目的正是找出差距在哪里,帮助研究者有的放矢地改进。

Q3:普通人或者企业怎么用RoboDojo来测试自己的机器人?

A:RoboDojo支持远程云端评测,参赛方不需要公开自己的模型权重或代码,只需要运行一个远程策略服务器,通过标准化协议和RoboDojo的评测系统通信即可完成测试。模拟环境代码和测试规范都是开源的,企业和研究团队可以在本地自行搭建用于内部迭代,然后再通过官方渠道提交正式成绩。XPolicyLab提供了详细的接入文档和代码,技术门槛不算太高。