DexVerse:3 种机械臂 × 6 种灵巧手,史上最全的灵巧操作评测基准
arXiv:2607.08751 UNC-Chapel Hill / 港大 / UC Berkeley 联合 |2026年7月10日
论文信息
📄 标题:DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation
🏛️ 机构:UNC-Chapel Hill、香港大学、UC Berkeley、上海科技大学等联合团队
📅 发布:arXiv:2607.08751 ,2026年7月10日
🔗 论文:https://arxiv.org/abs/2607.08751
🌐 项目:https://ycyao216.github.io/DexVerse.site
💻 代码:https://github.com/ycyao216/DexVerse(完整 Isaac Lab 环境开源)
📊 数据:3,180 条 VR 遥操作演示,覆盖 100 个任务
一句话总结
大家有没有这种感觉:VLA 论文里的排行榜数字越来越好看,LIBERO 上动不动 98%、99%,但你有没有想过——这些数字是在什么条件下测出来的?全是平行夹爪、简单桌面任务、固定光照。如果把场景换成灵巧手、多关节物体、多阶段长序列操作,那些「SOTA」还能撑住吗?
今天这篇 DexVerse 给出了一个相当诚实的答案:**不能。** 它联合了 UNC、港大、UC Berkeley 等团队,搭建了当前最全面的灵巧操作评测沙盒——100 个任务、3 种机械臂、6 种灵巧手——然后把 Diffusion Policy、DP3、OpenVLA、π₀.₅ 四位选手一起拉进去「裸考」。
结果:最高平均成功率只有 **34%**,有多个任务全军覆没——所有策略都是 **0%**。而最讽刺的是:号称用了互联网规模预训练的 VLA(OpenVLA),成绩反而是最差的 **19%**。预训练带来的「常识」,在灵巧手的高维控制流形上几乎帮不上忙。
一、到底有多要命——灵巧操作为什么是 VLA 的「照妖镜」
先说说背景。过去两年 VLA 模型的发展有多快不用我重复了——OpenVLA、π₀.₅、RT-2、GR00T——一个个大模型在 LIBERO、CALVIN、RoboTwin 等基准上刷出了漂亮的数字。但这些基准有一个共同点:几乎全部是**平行夹爪(parallel-jaw gripper)**操作,任务以「抓住→移动→放下」为主,自由度低、接触简单。
而真实的灵巧操作(dexterous manipulation)完全是另一回事:多指手的高维控制空间、持续接触下的力调节、关节物体的约束运动、工具使用的精确对准……这些都不是「抓起来放下去」能覆盖的。更关键的是,现有的灵巧操作基准(如 DexMimicGen 9 个任务、Bi-DexHands 20 个 RL 任务)要么任务太少、要么缺少多本体支持、要么没有视觉变化——没法系统性地衡量模型的泛化能力。
DexVerse 想做的就是填补这个空白:一个真正**模块化、多任务、多本体、可视觉变化**的灵巧操作评测沙盒。用论文作者的话说:「我们不承诺任何单一感知范式能赢下所有场景」——这本身就说明了问题的复杂性。

▲ 图1:DexVerse 基准概览——3 种机械臂 × 6 种灵巧手 × 100 个任务(来源:原论文 Figure 1)
二、100 个任务、8 大赛道——这个沙盒到底怎么搭的
DexVerse 的设计思路非常工程化:所有环境基于 NVIDIA Isaac Lab 搭建,采用配置驱动的模块化设计——任务和机器人本体完全解耦,理论上换一个手只需要改一份配置文件。我们拆开来看:
2.1 八大赛道,覆盖灵巧操作的全光谱
技能类别 | 任务数 | 代表任务 | 核心挑战 |
基础操作(Primitive) | 9 | PickCube、StackCube、PushButton | 直接交互,动作复杂度低 |
功能性操作(Functional) | 11 | HammerStrike、PourCan、GraspKettle | 感知物体功能区域进行交互 |
关节物体(Articulation) | 18 | OpenStapler、OpenLaptop、SqueezeScissors | 控制物体部件和关节,受约束运动 |
非抓取(Non-prehensile) | 5 | PushT、TakeBook、PivotCuboid | 推、滑、旋转或环境接触 |
富接触(Contact-rich) | 8 | InsertPeg、PlugCharger、NutThread | 持续接触下精确对齐,紧约束 |
双臂协调(Bimanual) | 5 | BiLiftTray、BiHandover、BiLiftBox | 双手协作稳定、传递或合作 |
多目标(Multi-goal) | 39 | GraspMug+PushButton、PourMug+PickBox | 同时满足多个组合性目标条件 |
长时程(Long-horizon) | 5 | MakeCoffee、MicrowaveFood、CleanTable | 多阶段过程,时间延展的任务链 |
八个赛道不是随便分的——它们对应灵巧操作中完全不同的能力维度。比如「基础操作」考验的是抓取稳定性,「富接触」考验的是力调节精度,「多目标」考验的是任务规划能力,「长时程」考验的是记忆和阶段推理。同一套策略很难在所有赛道都赢——这一点后面的实验数据会打脸打得很疼。
2.2 3 种臂 × 6 种手 = 跨本体泛化的终极考验
DexVerse 支持的硬件组合:Franka Research 3、UR10e、xArm 7 三种机械臂,搭配 Shadow Hand、Allegro Hand、LEAP Hand、Inspire Hand、Sharpa Wave、WUJI Hand 六种灵巧手。不同手的自由度、关节限制、接触几何完全不同——一套策略在一个手上学到的东西,能不能迁移到另一个手上?这就是 DexVerse 要问的核心问题之一。
2.3 3,180 条演示 + 9 种观测模态
数据层面,DexVerse 通过 Apple Vision Pro + CloudXR 遥操作接口收集了 3,180 条专家演示:56 个单目标任务各 55 条(Shadow Hand 50 条 + 其余 5 种手各 1 条),5 个长时程任务各 20 条。每条演示同步记录 9 组观测:policy(上一动作)、proprio(关节位置)、contact(指尖 3D 接触力)、state(任务状态)、RGB、深度、点云,外加 privileged 和 goal。这种多模态覆盖度远超现有基准。
还有个聪明的设计:数据以「动作-状态对」序列存储,重放时恢复仿真器状态并重新生成观测。这避免了跨机器物理仿真的累积漂移问题,也让数据集在不同硬件上可移植。

▲ 图2:DexVerse 100 个任务的视觉概览(来源:原论文 Figure 4)

▲ 图3:遥操作数据收集系统——基于 Apple Vision Pro + Isaac Lab CloudXR(来源:原论文 Figure 2)
三、是骡子是马拉出来遛——四位选手的「大考成绩单」
论文选了四位代表当前主流技术路线的选手:Diffusion Policy(2D 图像扩散)、DP3(3D 点云扩散策略)、OpenVLA(7B 参数 VLA,互联网规模预训练)、π₀.₅(flow-matching VLA,流匹配动作专家)。统一用 950 条 Shadow Hand 演示训练(19 个任务 × 50 条),每个任务滚 50 个 episode。来看成绩:
3.1 总榜:最高 34%,VLA 预训练优势荡然无存
策略 | 平均成功率 | 架构特点 | 备注 |
π₀.₅ | 34% | Flow-matching VLA, 语言条件 | 与 DP3 并列第一 |
DP3 | 34% | 3D 点云扩散策略 | 与 π₀.₅ 并列第一 |
Diffusion Policy | 32% | 2D 图像扩散策略 | 基础抓取表现最强 |
OpenVLA | 19% | 7B VLA, 互联网预训练 | 排名垫底 |
看到这个榜,最让人意外的不是 34% 这个数字本身——毕竟灵巧操作确实难——而是 **OpenVLA 垫底**。你可能会问:7B 参数、互联网规模预训练、在 LIBERO 上跑到 90%+ 的模型,怎么到了灵巧手上就只剩 19% 了?
论文给出的解释很直接:预训练的 VLM 骨干携带的先验来自网络图像和低维动作空间——它能识别「这是一个杯子」,但完全不知道该用几根手指、从哪个角度、用多大力去抓。灵巧手的高维控制流形和 VLM 预训练的分布之间存在巨大的语义鸿沟,预训练不仅帮不上忙,反而可能引入了不相关的先验。
3.2 分赛道榜单:没有全能冠军
技能类别 | 最强策略 | 最高成功率 | 第二名 | 差距 |
Pick-and-Lift(抓取提升) | DP | 51% | DP3 42% | +9pp |
Functional Tool Use(工具使用) | DP3 | 35% | DP 21% | +14pp |
Articulation(关节物体) | π₀.₅ | 35% | DP3 33% | +2pp |
Precision Contact(精确接触) | π₀.₅ | 29% | DP3 12% | +17pp |
四个赛道,四个不同的冠军——这就是 DexVerse 最核心的发现之一:**没有一种感知范式能赢下所有场景。**
1. 基础抓取(Pick-and-Lift):DP 以 51% 夺冠。这个赛道的核心挑战是找到合适的抓取位姿,而抓取位姿很大程度上是物体外观的函数——2D 图像 + 低维状态就够了,不需要复杂的 3D 几何或语言推理。
2. 工具使用(Functional Tool Use):DP3 以 35% 夺冠。锤子敲钉子、水壶倒水……这些任务需要精确感知工具的尖端位置和方向,显式 3D 点云几何信息起到了关键作用。
3. 关节物体(Articulation)和精确接触(Precision Contact):π₀.₅ 在两个赛道都夺冠。打开笔记本电脑、插入钢笔——这些任务涉及多阶段子目标的消歧和接触时机的判断,语言条件("先找到转轴→缓慢旋转→检测阻力")和 flow-matching 动作专家帮了大忙。

▲ 图4:19 个任务的详细策略对比(来源:原论文 Figure 5)
3.3 零分俱乐部:这些任务谁也搞不定
零分任务 | 任务类型 | 失败原因 | π₀.₅ | OpenVLA | DP3 | DP |
PushT | 非抓取 | 需要毫米级力调节 + 亚厘米对齐 | 0% | 0% | 0% | 0% |
SlideUtilityKnife | 关节物体 | 需要持续接触 + 精细力控制 | 0% | 0% | 0% | 0% |
InsertPen | 精确接触 | 紧公差插入,无显式力反馈 | 6% | 0% | 8% | 0% |
OpenFlatFolder | 关节物体 | 扁平物体识别 + 约束运动 | 0% | 0% | 18% | 16% |
OpenLaptop | 关节物体 | 多阶段铰链操作 | 4% | 2% | 2% | 10% |
PushT 这个任务最有代表性——推动一个 T 形物体到目标位置。对人来说简单到不能再简单,但对模型来说需要持续力调节、接触状态感知和亚厘米精度的实时修正。这是纯行为克隆的死穴:没有显式力反馈和闭环接触纠正,光靠模仿演示轨迹根本学不会。

▲ 图5:DexVerse 的模块化设计架构——任务-本体解耦的配置驱动系统(来源:原论文 Figure 3)
3.4 视觉变化:论文做了但没给出具体数字?
DexVerse 设计了完善的视觉变化系统:物体材质、桌面材质、照明、背景天空盒、曝光、色温、相机视角——全部可配置。论文中展示了随机化效果图,但在基准评估中,19 个任务的主结果使用的是固定默认外观,视觉变化的定量影响未单独报告。这是论文的一个小遗憾,也意味着未来有大量研究空间——毕竟如果 34% 还是不带视觉干扰的成绩,加上干扰后只会更惨烈。
四、总结与评价
4.1 亮点
·**史上最全的灵巧操作沙盒:** 100 个任务、8 大技能类别、3 种臂 × 6 种手、9 组观测模态、3,180 条演示——这个体量远超 DexMimicGen(9 个任务)和 Bi-DexHands(20 个任务),是目前灵巧操作领域规模最大的评测基准。
·**发现 VLA 预训练在灵巧手上的局限性:** OpenVLA 的 19% 成绩是一个重要的「冷水流」——互联网规模预训练不能直接转化为灵巧操作能力,预训练分布和灵巧手控制流形之间存在巨大语义鸿沟。这个发现会推动研究者重新思考预训练策略。
·**证明「没有全能冠军」的关键结论:** 四个赛道四个不同的冠军——DP 赢抓取、DP3 赢工具、π₀.₅ 赢关节和接触。这说明灵巧操作不是单一能力问题,而是多种异质能力的组合,未来可能需要混合感知范式。
·**工程层面设计出色:** 配置驱动的任务-本体解耦设计、基于状态重放的演示数据格式、VR 遥操作的本体自适应管道——这些工程选择让 DexVerse 易于扩展和维护,降低了新硬件接入的门槛。
4.2 局限性
·**视觉变化的定量分析缺失:** 论文设计了完善的可配置视觉变化系统,但在基准评估中没有给出带有视觉干扰的策略性能数字。对 VLA 的鲁棒性研究者来说,这组数据非常重要——Domains 下的泛化能力恰恰是当前 VLA 最大的痛处。
·**任务精细度有上限:** 100 个任务虽然多样,但「多目标」赛道 39 个任务有 36 个是 9×4 的组合变体——任务数看着多,真实的操作多样性可能需要更多独立设计。
·**灵巧手的类别覆盖仍有限:** 6 种手都是类人手(anthropomorphic),缺少工业夹爪和特殊末端执行器,对非类人操作的泛化研究支撑不够。
·**仿真到真机的差距未评估:** 所有结果均在 Isaac Lab 仿真中,真实世界的动力学噪声、传感器误差和接触不确定性问题完全未涉及。
4.3 个人评价
DexVerse 给我的感觉是「来得刚好」。在 VLA 社区把 LIBERO 刷到 98%、99% 快要无榜可刷的时候,这篇论文等于对全社区喊了一嗓子:「你们测的都是简单题,换个卷子试试?」结果一换卷子,最高分直接砍到 34%,互联网预训练的 VLA 垫底——这个反差太有教育意义了。
从研究生态的角度,DexVerse 最大的价值不在于「数字好看」,而在于「暴露问题」。它把灵巧操作拆成了抓取、工具、关节、接触四个正交的能力维度,用数据告诉你:想用一个模型包打天下,现在这条路远远没走通。这对那些想发「灵巧操作 VLA」论文的同学来说,既是泼冷水,也是指方向——冷的是「别再用 LIBERO 分数吹牛了」,暖的是「四个赛道你可以专攻一个,发顶会妥妥的」。

▲ 图6:DexVerse 所有任务环境的全景展示(来源:原论文 Figure 6)
五、延伸创新方向(给想发论文的朋友)
·如果你想做灵巧操作 + VLA,DexVerse 的 34% 天花板刚好是金矿——空间够大,找准角度就是一篇顶会。
·**方向 1:跨本体灵巧操作迁移。** 把 Shadow Hand 上学到的策略迁移到 Allegro Hand 上,不重新训练——本体标准化表示 + 域自适应。DexVerse 已经准备好了 3×6=18 种硬件组合,数据也有了,就差一个能跨本体泛化的策略架构。适合做迁移学习 / 域泛化的同学,RSS/CoRL 都可以冲。
·**方向 2:灵巧操作的力反馈闭环。** DexVerse 暴露的核心问题是:PushT 和 InsertPeg 这些需要精确力控的任务,所有行为克隆策略都是 0%。如果你能把接触力观测(DexVerse 已经提供了 contact 观测组!)引入策略学习的闭环中——比如在 flow-matching 动作专家里加入一个力预测模块——那你可能直接解决一个当前所有基线都搞不定的问题。适合做触觉/力控方向的同学。
·**方向 3:多感知范式的自适应融合。** DexVerse 证明 2D 赢抓取、3D 赢工具、语言赢关节——那能不能做一个自适应融合机制,根据当前任务阶段动态切换主导的感知范式?类似 MoE(混合专家)在感知层面的应用。适合做多模态融合/VLM 架构的同学。
·**方向 4:视觉鲁棒性下的灵巧操作。** DexVerse 已经搭好了全套视觉变化管道(材质、光照、背景、视角),但缺的就是在随机化条件下的系统评测。如果你把 π₀.₅ 或 OpenVLA 搬到 DexVerse 的视觉随机化场景下训练和评测,并对比域随机化、数据增强、测试时自适应等方法的效果——这本身就是一篇很扎实的 study。适合做视觉泛化的同学。
·**方向 5:灵巧操作的仿真到真机迁移。** DexVerse 目前全是仿真,如果你把这些策略搬到真实灵巧手上——比如 Shadow Hand + UR10e——并研究仿真到真机的 gap 到底有多大、如何弥合,那直接填补了 DexVerse 作者留的「future work」空白。适合有真机资源、做 sim-to-real 的同学。
📖 论文引用:Yunchao Yao et al. "DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation." arXiv:2607.08751 , 2026.
💻 代码仓库:https://github.com/ycyao216/DexVerse
关注我,持续分享 VLA 领域最新论文深度解读 🤖