当前位置:首页>排行榜>100 个灵巧操作任务大考:最强 VLA 只拿了 34 分?

100 个灵巧操作任务大考:最强 VLA 只拿了 34 分?

  • 更新时间 2026-07-12 03:06:03
100 个灵巧操作任务大考:最强 VLA 只拿了 34 分?

DexVerse:3 种机械臂 × 6 种灵巧手,史上最全的灵巧操作评测基准

arXiv:2607.08751                                                       UNC-Chapel Hill / 港大 / UC Berkeley 联合 |2026年7月10日

论文信息

📄 标题:DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

🏛️ 机构:UNC-Chapel Hill、香港大学、UC Berkeley、上海科技大学等联合团队

📅 发布:arXiv:2607.08751                                      ,2026年7月10日

🔗 论文:https://arxiv.org/abs/2607.08751

🌐 项目:https://ycyao216.github.io/DexVerse.site

💻 代码:https://github.com/ycyao216/DexVerse(完整 Isaac Lab 环境开源)

📊 数据:3,180 条 VR 遥操作演示,覆盖 100 个任务

一句话总结

大家有没有这种感觉:VLA 论文里的排行榜数字越来越好看,LIBERO 上动不动 98%、99%,但你有没有想过——这些数字是在什么条件下测出来的?全是平行夹爪、简单桌面任务、固定光照。如果把场景换成灵巧手、多关节物体、多阶段长序列操作,那些「SOTA」还能撑住吗?

今天这篇 DexVerse 给出了一个相当诚实的答案:**不能。** 它联合了 UNC、港大、UC Berkeley 等团队,搭建了当前最全面的灵巧操作评测沙盒——100 个任务、3 种机械臂、6 种灵巧手——然后把 Diffusion Policy、DP3、OpenVLA、π₀.₅ 四位选手一起拉进去「裸考」。

结果:最高平均成功率只有 **34%**,有多个任务全军覆没——所有策略都是 **0%**。而最讽刺的是:号称用了互联网规模预训练的 VLA(OpenVLA),成绩反而是最差的 **19%**。预训练带来的「常识」,在灵巧手的高维控制流形上几乎帮不上忙。

一、到底有多要命——灵巧操作为什么是 VLA 的「照妖镜」

先说说背景。过去两年 VLA 模型的发展有多快不用我重复了——OpenVLA、π₀.₅、RT-2、GR00T——一个个大模型在 LIBERO、CALVIN、RoboTwin 等基准上刷出了漂亮的数字。但这些基准有一个共同点:几乎全部是**平行夹爪(parallel-jaw gripper)**操作,任务以「抓住→移动→放下」为主,自由度低、接触简单。

而真实的灵巧操作(dexterous manipulation)完全是另一回事:多指手的高维控制空间、持续接触下的力调节、关节物体的约束运动、工具使用的精确对准……这些都不是「抓起来放下去」能覆盖的。更关键的是,现有的灵巧操作基准(如 DexMimicGen 9 个任务、Bi-DexHands 20 个 RL 任务)要么任务太少、要么缺少多本体支持、要么没有视觉变化——没法系统性地衡量模型的泛化能力。

DexVerse 想做的就是填补这个空白:一个真正**模块化、多任务、多本体、可视觉变化**的灵巧操作评测沙盒。用论文作者的话说:「我们不承诺任何单一感知范式能赢下所有场景」——这本身就说明了问题的复杂性。

▲ 图1:DexVerse 基准概览——3 种机械臂 × 6 种灵巧手 × 100 个任务(来源:原论文 Figure 1)

二、100 个任务、8 大赛道——这个沙盒到底怎么搭的

DexVerse 的设计思路非常工程化:所有环境基于 NVIDIA Isaac Lab 搭建,采用配置驱动的模块化设计——任务和机器人本体完全解耦,理论上换一个手只需要改一份配置文件。我们拆开来看:

2.1 八大赛道,覆盖灵巧操作的全光谱

技能类别

任务数

代表任务

核心挑战

基础操作(Primitive)

9

PickCube、StackCube、PushButton

直接交互,动作复杂度低

功能性操作(Functional)

11

HammerStrike、PourCan、GraspKettle

感知物体功能区域进行交互

关节物体(Articulation)

18

OpenStapler、OpenLaptop、SqueezeScissors

控制物体部件和关节,受约束运动

非抓取(Non-prehensile)

5

PushT、TakeBook、PivotCuboid

推、滑、旋转或环境接触

富接触(Contact-rich)

8

InsertPeg、PlugCharger、NutThread

持续接触下精确对齐,紧约束

双臂协调(Bimanual)

5

BiLiftTray、BiHandover、BiLiftBox

双手协作稳定、传递或合作

多目标(Multi-goal)

39

GraspMug+PushButton、PourMug+PickBox

同时满足多个组合性目标条件

长时程(Long-horizon)

5

MakeCoffee、MicrowaveFood、CleanTable

多阶段过程,时间延展的任务链

八个赛道不是随便分的——它们对应灵巧操作中完全不同的能力维度。比如「基础操作」考验的是抓取稳定性,「富接触」考验的是力调节精度,「多目标」考验的是任务规划能力,「长时程」考验的是记忆和阶段推理。同一套策略很难在所有赛道都赢——这一点后面的实验数据会打脸打得很疼。

2.2 3 种臂 × 6 种手 = 跨本体泛化的终极考验

DexVerse 支持的硬件组合:Franka Research 3、UR10e、xArm 7 三种机械臂,搭配 Shadow Hand、Allegro Hand、LEAP Hand、Inspire Hand、Sharpa Wave、WUJI Hand 六种灵巧手。不同手的自由度、关节限制、接触几何完全不同——一套策略在一个手上学到的东西,能不能迁移到另一个手上?这就是 DexVerse 要问的核心问题之一。

2.3 3,180 条演示 + 9 种观测模态

数据层面,DexVerse 通过 Apple Vision Pro + CloudXR 遥操作接口收集了 3,180 条专家演示:56 个单目标任务各 55 条(Shadow Hand 50 条 + 其余 5 种手各 1 条),5 个长时程任务各 20 条。每条演示同步记录 9 组观测:policy(上一动作)、proprio(关节位置)、contact(指尖 3D 接触力)、state(任务状态)、RGB、深度、点云,外加 privileged 和 goal。这种多模态覆盖度远超现有基准。

还有个聪明的设计:数据以「动作-状态对」序列存储,重放时恢复仿真器状态并重新生成观测。这避免了跨机器物理仿真的累积漂移问题,也让数据集在不同硬件上可移植。

▲ 图2:DexVerse 100 个任务的视觉概览(来源:原论文 Figure 4)

▲ 图3:遥操作数据收集系统——基于 Apple Vision Pro + Isaac Lab CloudXR(来源:原论文 Figure 2)

三、是骡子是马拉出来遛——四位选手的「大考成绩单」

论文选了四位代表当前主流技术路线的选手:Diffusion Policy(2D 图像扩散)、DP3(3D 点云扩散策略)、OpenVLA(7B 参数 VLA,互联网规模预训练)、π₀.₅(flow-matching VLA,流匹配动作专家)。统一用 950 条 Shadow Hand 演示训练(19 个任务 × 50 条),每个任务滚 50 个 episode。来看成绩:

3.1 总榜:最高 34%,VLA 预训练优势荡然无存

策略

平均成功率

架构特点

备注

π₀.₅

34%

Flow-matching VLA, 语言条件

与 DP3 并列第一

DP3

34%

3D 点云扩散策略

与 π₀.₅ 并列第一

Diffusion Policy

32%

2D 图像扩散策略

基础抓取表现最强

OpenVLA

19%

7B VLA, 互联网预训练

排名垫底

看到这个榜,最让人意外的不是 34% 这个数字本身——毕竟灵巧操作确实难——而是 **OpenVLA 垫底**。你可能会问:7B 参数、互联网规模预训练、在 LIBERO 上跑到 90%+ 的模型,怎么到了灵巧手上就只剩 19% 了?

论文给出的解释很直接:预训练的 VLM 骨干携带的先验来自网络图像和低维动作空间——它能识别「这是一个杯子」,但完全不知道该用几根手指、从哪个角度、用多大力去抓。灵巧手的高维控制流形和 VLM 预训练的分布之间存在巨大的语义鸿沟,预训练不仅帮不上忙,反而可能引入了不相关的先验。

3.2 分赛道榜单:没有全能冠军

技能类别

最强策略

最高成功率

第二名

差距

Pick-and-Lift(抓取提升)

DP

51%

DP3 42%

+9pp

Functional Tool Use(工具使用)

DP3

35%

DP 21%

+14pp

Articulation(关节物体)

π₀.₅

35%

DP3 33%

+2pp

Precision Contact(精确接触)

π₀.₅

29%

DP3 12%

+17pp

四个赛道,四个不同的冠军——这就是 DexVerse 最核心的发现之一:**没有一种感知范式能赢下所有场景。**

1. 基础抓取(Pick-and-Lift):DP 以 51% 夺冠。这个赛道的核心挑战是找到合适的抓取位姿,而抓取位姿很大程度上是物体外观的函数——2D 图像 + 低维状态就够了,不需要复杂的 3D 几何或语言推理。

2. 工具使用(Functional Tool Use):DP3 以 35% 夺冠。锤子敲钉子、水壶倒水……这些任务需要精确感知工具的尖端位置和方向,显式 3D 点云几何信息起到了关键作用。

3. 关节物体(Articulation)和精确接触(Precision Contact):π₀.₅ 在两个赛道都夺冠。打开笔记本电脑、插入钢笔——这些任务涉及多阶段子目标的消歧和接触时机的判断,语言条件("先找到转轴→缓慢旋转→检测阻力")和 flow-matching 动作专家帮了大忙。

▲ 图4:19 个任务的详细策略对比(来源:原论文 Figure 5)

3.3 零分俱乐部:这些任务谁也搞不定

零分任务

任务类型

失败原因

π₀.₅

OpenVLA

DP3

DP

PushT

非抓取

需要毫米级力调节 + 亚厘米对齐

0%

0%

0%

0%

SlideUtilityKnife

关节物体

需要持续接触 + 精细力控制

0%

0%

0%

0%

InsertPen

精确接触

紧公差插入,无显式力反馈

6%

0%

8%

0%

OpenFlatFolder

关节物体

扁平物体识别 + 约束运动

0%

0%

18%

16%

OpenLaptop

关节物体

多阶段铰链操作

4%

2%

2%

10%

PushT 这个任务最有代表性——推动一个 T 形物体到目标位置。对人来说简单到不能再简单,但对模型来说需要持续力调节、接触状态感知和亚厘米精度的实时修正。这是纯行为克隆的死穴:没有显式力反馈和闭环接触纠正,光靠模仿演示轨迹根本学不会。

▲ 图5:DexVerse 的模块化设计架构——任务-本体解耦的配置驱动系统(来源:原论文 Figure 3)

3.4 视觉变化:论文做了但没给出具体数字?

DexVerse 设计了完善的视觉变化系统:物体材质、桌面材质、照明、背景天空盒、曝光、色温、相机视角——全部可配置。论文中展示了随机化效果图,但在基准评估中,19 个任务的主结果使用的是固定默认外观,视觉变化的定量影响未单独报告。这是论文的一个小遗憾,也意味着未来有大量研究空间——毕竟如果 34% 还是不带视觉干扰的成绩,加上干扰后只会更惨烈。

四、总结与评价

4.1 亮点

·**史上最全的灵巧操作沙盒:** 100 个任务、8 大技能类别、3 种臂 × 6 种手、9 组观测模态、3,180 条演示——这个体量远超 DexMimicGen(9 个任务)和 Bi-DexHands(20 个任务),是目前灵巧操作领域规模最大的评测基准。

·**发现 VLA 预训练在灵巧手上的局限性:** OpenVLA 的 19% 成绩是一个重要的「冷水流」——互联网规模预训练不能直接转化为灵巧操作能力,预训练分布和灵巧手控制流形之间存在巨大语义鸿沟。这个发现会推动研究者重新思考预训练策略。

·**证明「没有全能冠军」的关键结论:** 四个赛道四个不同的冠军——DP 赢抓取、DP3 赢工具、π₀.₅ 赢关节和接触。这说明灵巧操作不是单一能力问题,而是多种异质能力的组合,未来可能需要混合感知范式。

·**工程层面设计出色:** 配置驱动的任务-本体解耦设计、基于状态重放的演示数据格式、VR 遥操作的本体自适应管道——这些工程选择让 DexVerse 易于扩展和维护,降低了新硬件接入的门槛。

4.2 局限性

·**视觉变化的定量分析缺失:** 论文设计了完善的可配置视觉变化系统,但在基准评估中没有给出带有视觉干扰的策略性能数字。对 VLA 的鲁棒性研究者来说,这组数据非常重要——Domains 下的泛化能力恰恰是当前 VLA 最大的痛处。

·**任务精细度有上限:** 100 个任务虽然多样,但「多目标」赛道 39 个任务有 36 个是 9×4 的组合变体——任务数看着多,真实的操作多样性可能需要更多独立设计。

·**灵巧手的类别覆盖仍有限:** 6 种手都是类人手(anthropomorphic),缺少工业夹爪和特殊末端执行器,对非类人操作的泛化研究支撑不够。

·**仿真到真机的差距未评估:** 所有结果均在 Isaac Lab 仿真中,真实世界的动力学噪声、传感器误差和接触不确定性问题完全未涉及。

4.3 个人评价

DexVerse 给我的感觉是「来得刚好」。在 VLA 社区把 LIBERO 刷到 98%、99% 快要无榜可刷的时候,这篇论文等于对全社区喊了一嗓子:「你们测的都是简单题,换个卷子试试?」结果一换卷子,最高分直接砍到 34%,互联网预训练的 VLA 垫底——这个反差太有教育意义了。

从研究生态的角度,DexVerse 最大的价值不在于「数字好看」,而在于「暴露问题」。它把灵巧操作拆成了抓取、工具、关节、接触四个正交的能力维度,用数据告诉你:想用一个模型包打天下,现在这条路远远没走通。这对那些想发「灵巧操作 VLA」论文的同学来说,既是泼冷水,也是指方向——冷的是「别再用 LIBERO 分数吹牛了」,暖的是「四个赛道你可以专攻一个,发顶会妥妥的」。

▲ 图6:DexVerse 所有任务环境的全景展示(来源:原论文 Figure 6)

五、延伸创新方向(给想发论文的朋友)

·如果你想做灵巧操作 + VLA,DexVerse 的 34% 天花板刚好是金矿——空间够大,找准角度就是一篇顶会。

·**方向 1:跨本体灵巧操作迁移。** 把 Shadow Hand 上学到的策略迁移到 Allegro Hand 上,不重新训练——本体标准化表示 + 域自适应。DexVerse 已经准备好了 3×6=18 种硬件组合,数据也有了,就差一个能跨本体泛化的策略架构。适合做迁移学习 / 域泛化的同学,RSS/CoRL 都可以冲。

·**方向 2:灵巧操作的力反馈闭环。** DexVerse 暴露的核心问题是:PushT 和 InsertPeg 这些需要精确力控的任务,所有行为克隆策略都是 0%。如果你能把接触力观测(DexVerse 已经提供了 contact 观测组!)引入策略学习的闭环中——比如在 flow-matching 动作专家里加入一个力预测模块——那你可能直接解决一个当前所有基线都搞不定的问题。适合做触觉/力控方向的同学。

·**方向 3:多感知范式的自适应融合。** DexVerse 证明 2D 赢抓取、3D 赢工具、语言赢关节——那能不能做一个自适应融合机制,根据当前任务阶段动态切换主导的感知范式?类似 MoE(混合专家)在感知层面的应用。适合做多模态融合/VLM 架构的同学。

·**方向 4:视觉鲁棒性下的灵巧操作。** DexVerse 已经搭好了全套视觉变化管道(材质、光照、背景、视角),但缺的就是在随机化条件下的系统评测。如果你把 π₀.₅ 或 OpenVLA 搬到 DexVerse 的视觉随机化场景下训练和评测,并对比域随机化、数据增强、测试时自适应等方法的效果——这本身就是一篇很扎实的 study。适合做视觉泛化的同学。

·**方向 5:灵巧操作的仿真到真机迁移。** DexVerse 目前全是仿真,如果你把这些策略搬到真实灵巧手上——比如 Shadow Hand + UR10e——并研究仿真到真机的 gap 到底有多大、如何弥合,那直接填补了 DexVerse 作者留的「future work」空白。适合有真机资源、做 sim-to-real 的同学。

📖 论文引用:Yunchao Yao et al. "DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation." arXiv:2607.08751     , 2026.

💻 代码仓库:https://github.com/ycyao216/DexVerse

关注我,持续分享 VLA 领域最新论文深度解读 🤖

最新文章

随机文章