AI日报 · 深潜
过去一年,VLA、机器人基础模型、世界模型轮番登场,Demo 一个比一个丝滑。
叠碗、插管、收纳,机器人似乎终于听懂人话,能动手干活了。
但是,一旦脱离精心设计的演示环境,把这群“优等生”拉上真正的考场,分数直接崩盘。
刚刚发布的具身智能新基准 RoboDojo,给行业泼了一盆透心凉的冷水。
在这个被称作“具身珠峰”的测试里,人类专家的真实世界得分是100%,而当前最强的通用机器人策略,平均成功率只有12.8%。
甚至在仿真环境里,最强模型的平均分也仅为8.80%,连人类的零头都不到(人类仿真得分76.03%)。
这波数据对比太残酷:原来我们以为机器人已经在大举登山,结果榜单显示,它们大多还在山脚适应高反。
🧗️ 为什么这座“山”这么难爬?
RoboDojo 之所以能把模型打回原形,核心在于它没玩虚的。
这是由推出过 RoboTwin 系列基准的原班团队打造,直接搞了一套42个仿真任务 + 18个真实机器人任务的混合双打。
它不再考察简单的 Pick-and-Place,而是把能力拆解成了五个让模型头疼的“鬼门关”:
- 泛化能力(Generalization):桌面杂物随机增加到25个,背景、光照、物体外观全变,看你能不能认出来。
- 记忆能力(Memory):传送带上的物体一闪而过,你得记住它,后面再从一堆候选物里把它挑出来。
- 精细操作(Precision):插管、对齐、插入,稍微偏一点就是失败,容错率极低。
- 长程执行(Long-Horizon):不是做一个动作就完事,要连续完成拿起、移动、交接、放置,误差会一路累积到最后一步。
- 开放语义(Open):听不懂训练过的指令,面对没见过的自然语言描述,能不能自己琢磨出动作?
在仿真里都考成这样,到了真实世界更是“地狱模式”。
RoboDojo 专门设计了18个真机任务,覆盖了 ARX X5、Piper、Piper X 三种主流双臂平台,每个平台各测6个任务。
盖积木、做面包、拆乐高、挂杯子……这些听起来像家务活的场景,对机器人来说全是物理不确定性。
物体滑动、夹爪打滑、机械臂延迟、相机噪声,任何一个微小扰动都能让之前的努力归零。
更绝的是,这次评测不再是厂商自己拍视频交作业。
RoboDojo 搞了套标准化考试:统一硬件、统一布局、统一光照,甚至复位流程都定死了。
每个 Trial 还要由三名评审双盲打分,既看结果也看过程。这就意味着,想靠“特调”或者“剪辑”蒙混过关,压根没戏。
📉 30个模型同台,谁在裸泳?
这次共有30个主流机器人策略同台竞技,结果榜单一出,差距摆在了桌面上。
目前没有任何一个模型能在真实世界任务中接近人类水平,12.8%的成功率意味着什么?
简单算笔账:让机器人执行100次任务,它平均只能成功12.8次,剩下的大概率都要重来或者彻底搞砸。

而在仿真环境中,8.80%的平均分更是说明,很多模型在虚拟世界里都没学会走路,就更别提去真实世界跑步了。
这背后暴露出一个行业共识:Sim-to-Real(仿真到现实)的鸿沟,比我们想象的要深得多。
以前大家总觉得,只要在仿真里练够了,迁移到真机只是时间问题。
但 RoboDojo 的数据狠狠打了脸:仿真里的“高分低能”现象依然严重,模型根本没学会如何处理真实物理世界的摩擦力和不确定性。
而且,这个基准的含金量还在于它的“中立性”。
它由全学术机构联盟发起,榜单治理交给公益性组织 AI MMLab Club 基金会,背后没有商业模型方的利益绑定。
换句话说,这不是某家公司为了卖货搞的“自证清白”,而是一次真正的“全民统考”。
对于正在疯狂融资、宣传“通用机器人即将落地”的创业公司来说,这份成绩单有点扎心。
如果连12.8%的真实成功率都难以突破,那所谓的“明年进家庭”、“后年进工厂”,大概率还得再画几年饼。
💡 别被 Demo 骗了,这才是真实水位
咱就是说,以后再看机器人视频,得留个心眼。
那些光线完美、物体固定、动作一气呵成的 Demo,看看就好,别当真。
RoboDojo 的出现,相当于给具身智能行业装了一块“照妖镜”。
它告诉我们,现在的技术栈离真正的“通用操作”还有十万八千里。
这不是否定进步,而是把预期拉回地面。
我的判断很明确:在真实世界成功率突破 50% 之前,任何关于“具身智能爆发”的论调,都是过早的狂欢。
现在的阶段,与其吹嘘“全能”,不如老老实实攻克那几个12.8%背后的物理难题。
毕竟,山就在那儿,不会因为你 PPT 做得好看就变矮。
想看更多深度分析?关注我们,留言聊聊你觉得机器人哪个任务最难搞定。
来源:量子位 | 链接:https://www.qbitai.com/2026/07/446363.html
— AI日报观察员,每天带你用内行视角看 AI