当前位置:首页>排行榜>具身智能数采设备怎么选?硬指标、口径陷阱与主流设备对比

具身智能数采设备怎么选?硬指标、口径陷阱与主流设备对比

  • 更新时间 2026-09-23 08:37:50
具身智能数采设备怎么选?硬指标、口径陷阱与主流设备对比

具身智能数采设备怎么选?硬指标、口径陷阱与主流设备对比

买方视角的硬门槛、口径陷阱与验收规则

具身智能这一轮,讨论模型和本体的内容很多,第一视角数据怎么采、指标怎么定、设备怎么比,公开能查到的整理很少。我们过去一段时间在做这件事,定了数采需求,评审了几轮设备和供应商方案,踩过一些口径的坑。这篇文章把能公开的部分写出来,指标尽量给到能直接写进需求文档的程度,设备对比用已有公开规格。

业内对第一视角路线的判断基本一致,机器人部署时看到的是自身相机的画面,手和物体的相对位置、抓握闭合、接触时刻这些对操作最关键的信号,只有站进任务里才拍得到。落到硬件上是一条选型原则,采集装置的相机位置和视场,必须匹配目标机器人末端执行器的传感器几何。差得太多,真人数据往 policy 上迁移时,收益会大量漏掉。

展开指标之前,先给一个总纲。Ego 数采设备的核心是一套空间测量系统,多视角相机、高质量 IMU、精确时间同步、精密标定、手部和腕部观测、稳定记录,缺一块,数据就废一块。高分辨率头显只是其中一块,权重还没有排序靠前的几项大。这套系统的质量是各组分的连乘,可观测性、同步、标定稳定性、追踪、数据完整性,任何一项归零,整体归零。各项的优先级大致是,几何可观测性高于时间同步,时间同步高于标定稳定性,再往下是遮挡冗余、图像分辨率,头显本身的 XR 功能排在最后。后面每一节都在展开这个排序。

第一部分

相机和 IMU 的硬门槛

最硬的一条是快门。人干活时头和手同时在动,卷帘快门逐行曝光带来的畸变跟着运动变,标定做不掉。这里要把门槛限定准确,需要承担三角测距、运动重建、手部几何估计的几何主相机,必须全局快门,没有商量余地;纯语义画面的 RGB 相机可以放宽,Aria Gen 2 就是这个架构,4 颗 CV 相机全局快门管几何和 SLAM,12MP RGB 卷帘快门管纹理和语义,官方确认这是一种合理分工。评审时要对方说明每颗相机的快门类型,最好给实测图,有方案用软件模拟或者 global reset 冒充全局快门。

其余相机指标有公认的下限。分辨率单路不低于 1080p,注意要两路同开实测,有的设备单路能跑,双路一起开就掉,优选 1920×1200,竖直方向对工作区覆盖更充分。帧率上,60fps 比 4K 更值得优先,手部动作快,几何相机建议 1920×1200@60 全局快门,RGB 语义相机 1080p 到 2560×1920 之间按 30 到 60 帧配。视场角要看有效视场,也就是校正之后的视场,水平不低于 110 度、垂直不低于 80 度,推荐 120 到 160 度、垂直 90 度以上。宣传页上的 180 度常常是鱼眼圆的直径,校正后没这么大。鱼眼镜头可以用,必须有精确的去畸变模型。镜头必须定焦,自动对焦一动,内参跟着变,标定作废,深度也没法用。前置双目的基线不低于 80mm,推荐 100 到 120mm,公开方案多在 86.8 到 120mm 之间,这个区间直接决定 0.3 到 1.2 米工作区的深度精度。

曝光也有讲究,它的优先级远高于分辨率数字。手以每秒 1 到 2 米的速度动,每毫秒位移 1 到 2 毫米,8 毫秒曝光就是 8 到 16 毫米的运动模糊,4K 的像素再多也救不回来。所以正常动作曝光钳制在 4 毫秒以内,高速手部动作目标 1 到 2 毫秒,亮度靠增益补。室内还有 50 赫兹的灯光频闪,相机要有防闪烁功能,多帧合成的 HDR 要能关掉,它会把帧与帧的时间戳定义搅乱。相机每帧的曝光、增益、时间戳要可读回,这是后面 QA 的基础。

双目相机还有一条容易漏的,左右目的曝光和白平衡必须主从同步,一路决策、两路同参数,并且支持完全手动锁定。左右各自自动曝光的设备,一到明暗交界的场景,两路画面的亮度对不上,立体匹配大面积失败,深度就废了。选型时还要问清自动曝光收敛需要几帧。

物距覆盖对照手部工作区检查。典型要求是 25 到 70 厘米或者 30 到 120 厘米的工作区落在景深内,前置相机组最好从 20 厘米覆盖到 5 米,把桌面以下、腹部高度的画面都装进来。

IMU 的门槛写在纸面上只有一句,采样率严格大于 200Hz,这是最低门槛,不是设计目标。实际评审里这条最容易被擦边。有设备的规格恰好卡在 200Hz,按字面就不达标,要追问能不能上调。还要确认标称的是芯片输出频率还是实测输出频率,这两者经常对不上。公开设备已经把标杆拉得很高,Aria Gen 1 双 IMU 是 800 和 1000Hz,Gen 2 典型 800Hz、最高 1600Hz,FastUMI Ego 用 500Hz 的 ICM-42688,所以自研的主力规格建议 500Hz,高端 800 到 1000Hz 双 IMU。

IMU 的细节还有几条。轴数要 9 轴,磁力计在 UMI 路线是必选。量程建议双 IMU 搭配,一路 ±4g、±500°/s 做精密通道,另一路 ±16g、±2000°/s 留出甩头的饱和裕量,两颗用不同型号的芯片,高阶误差互不相关,融合后噪声更干净。陀螺仪零偏要求不大于每小时 5 度,零偏、比例因子、轴对齐、温补系数要能导出成标定文件。输出必须是原始的陀螺加加速度计数据,芯片端融合过的数据不要。时间戳由硬件中断打,不能取主控读取的时刻,FIFO 回溯补偿机制要让供应商说明。

口径陷阱。 指标本身好查,难的是口径。宣传视场角和有效视场角对不上,芯片标称频率和实测频率对不上。所有拿不准的指标,都要求实测报告。误差用 ATE 还是 RPE 算,报的是均值还是 p95,要写清;在线跑的还是离线优化后的,真值从哪来,同样要问。

硬门槛收成一张表。

指标
最低门槛
推荐规格
快门
几何主相机全局快门
,确认非软件模拟
全相机 GS(语义 RGB 可卷帘)
分辨率、帧率
单路不低于 1080p、30fps,双路同开实测
几何相机 1920×1200@60 GS
有效视场
校正后水平 110°、垂直 80° 以上
水平 120 到 160°,垂直 90° 以上
镜头
定焦,鱼眼需精确畸变模型
定焦鱼眼加 KB 模型
双目基线
前方不低于 80mm
100 到 120mm
曝光
钳制 8ms 以内
正常动作 4ms 以内,高速 1 到 2ms
AE/AWB
可锁定
左右目主从同步,可完全手动锁定
IMU
严格大于 200Hz,原始数据输出
500 到 1000Hz 双 IMU
,9 轴
陀螺零偏
可导出标定参数
不大于 5°/h
相机间同步
硬件触发,偏差 0.1ms 以内
同左,时间戳分辨率微秒级
头腕同步
5ms 以内
1ms 以内
帧间隔
P99 偏离标称值 10ms 以内
同左
头部位姿
100Hz 以上
300Hz 以上
,追踪状态字段输出
手部
21 点、60Hz、度量 3D
接触帧 P90 MPJPE 10mm 以内
连续稳定性
连续录 1 小时,帧率衰减小于 2%
单班次 6 到 8 小时,换电不断电
编码与交付
H.265 一代压缩,附逐帧独立时间戳
H.265/AV1 加 MCAP,标定随数据交付

第二部分

先盯同步,再谈帧率

同步的道理可以算成一笔账。手部动作速度能到每秒 1 到 2 米,1 毫秒里手就走 1 到 2 毫米。两路数据的时间戳差 5 毫秒,毫米级的几何信息已经错位,再高的帧率也救不回来。

设备内部的同步靠硬件。所有相机接同一个触发信号,相机间偏差压到 0.1 毫秒以内,实测系统做到 200 微秒量级。相机和 IMU 共用一个晶振,固定偏移靠标定消掉,实测里见过 5 到 8 毫秒的偏移,不标定就一直留在数据里。

跨设备更难。头和腕两台设备,有线连接用触发线加对时握手,能压到 10 微秒级;无线走蓝牙信标,验收线定在 1 毫秒。软件对时只能做兜底,用离线 IMU 互相关能到 5 到 10 毫秒,元数据里要标注同步等级。只靠软件对时的方案,头显和计算单元之间的偏移典型值就有 2 到 3 毫秒,p95 能到 11 毫秒,毫米级精度谈不上了。

长录制还有漂移问题。各自带独立晶振的设备,一小时能累计上百毫秒的偏差,中途不报错、不丢帧。姿态漂移的麻烦在于它静默发生,0.05 度的相对偏航漂移,纯几何位移在 120 厘米处约 1 毫米,但经过双目外参传播和三角测量放大后,深度误差会比这个数字大得多,而且双目数据自己看不出来,只有对着外部真值才能发现。所以验收标准定为 1 小时录制端到端累计偏差小于 10 毫秒,逐帧帧间隔也要抽查,P99 偏离标称值不超过 10 毫秒。交付门槛可以放宽到 20 毫秒,再宽,手部轨迹就没法用了。

工程上有几个成熟做法值得写进需求。一是双时间戳体系,硬件时间戳 64 位微秒、单调递增、单次会话内对齐,UTC 时间戳跨会话关联、由 NTP 校准。二是采样率整除对齐,以 IMU 300Hz 为基准,视觉和手部追踪跑 60Hz、空间定位跑 30Hz,关键对齐点的时间戳严格一致,误差小于 1 毫秒。三是帧时刻口径要声明,每帧时间戳对应曝光开始、中点还是读出结束,融合时以曝光中点为基准,逐帧输出实际曝光时长。四是共享时钟整个会话期间不可重置,头显热插拔换电的场景,要求桥接电芯维持 90 秒供电,保住时钟和标定状态。

两个 KPI 别混。 时间戳对齐和物理触发同步是两件事。Aria Gen 2 的官方文档把这层讲得最清楚,它的 SubGHz 跨设备对时实测时间戳对齐误差 2.18µs、精度正负 5µs,但官方明确说明这是时间域映射,不等于两台设备的相机触发已经硬件同步,真要对齐触发时刻,要在 SDK 里另开跨设备相机同步选项。供应商说「同步精度 2 微秒」的时候,先问清说的是哪一层。

时间戳还有一层容易被忽略。MP4 容器里的时间戳是按恒定帧率生成的,不反映真实采集时刻,掉帧的位置会被均匀填平。所以交付里必须有逐帧独立时间戳文件,掉帧如实留空洞并打上丢帧标记,用重复帧补齐的要整条拒掉。

第三部分

位姿精度,先把口径问清

头部 6DoF 位姿的验收口径是 10mm ATE,绝对轨迹误差。这一条要先立住,因为规格表上漂亮得多的数字几乎都不是这个口径。宣称 2 到 3mm 的,多半是相对位姿误差,衡量相邻时刻的平滑程度,积累漂移完全不反映。我们用光学动捕实测过一类头戴设备,作为真值参照,其 RMS 平移误差到了 11mm

在线和离线也要分开。在线 VIO 没有回环,误差约为离线全局优化后的 2 倍,长时间运行必然漂移。对比公开基准有个大致的刻度,EuRoC 数据集上优秀算法的离线 ATE 在 2 到 3 厘米,TUM-VI 上约 0.9 厘米,HOT3D 上 0.3 到 0.4 厘米。RoboCap 的六目 VI-SLAM 报告对比了 ORB-SLAM3、Basalt、OKVIS2 和 cuVSLAM,量级都在这个范围。谁宣称显著低于这个刻度,先问真值怎么来的。

位姿输出还有三条工程要求。追踪状态必须作为字段输出,正常、丢失、重定位各自标记,重定位后世界坐标系可能跳变,要用事件字段标出来,下游才知道哪一段轨迹不能直接用。输出频率要求 300Hz 以上稳定连续无跳变,姿态和关节数据 50Hz。无遮挡条件下,光学动捕或激光追踪的定位精度能做到 1 到 5mm,这是腕部相对头戴定位 ≤5mm 验收线的真值基础。

第四部分

毫米精度是被遮挡吃掉的

深度误差随距离的平方增长。按 12 厘米基线、0.25 像素视差精度算,单帧误差是这样的。

距离
深度误差(1σ 单帧)
侧向误差
30cm
约 0.3mm
约 0.1mm
60cm
约 1.1mm
约 0.2mm
90cm
约 2.5mm
约 0.3mm
120cm
约 4.5mm
约 0.45mm

这张表怎么用。 它是理想视差传播的下界,只含深度解算这一层,不含匹配失败、遮挡、标定误差、姿态误差和物体表面纹理的影响。按同一组参数算,0.65 米处 1 个像素的视差误差换算成深度偏差约 5 毫米,叠加真实场景里匹配和标定的退化,实际会明显更高。所以这张表只能当 sensor 级的下界看,最终精度必须用真实手部表面和真实运动做端到端测试。

真正的麻烦在遮挡。

关键点被挡住时,误差会退化到 1 到 3 个像素,在 120 厘米处一帧就是 18 到 50 毫米。误差最集中的帧,恰好是训练价值最高的帧。手合拢、接触物体那一下,手掌自己把关键点挡了。三组数字能说明多目布局的价值。单颗相机大约有 15% 的帧看不见关键点,两目同时可见的覆盖是 72%,加到三目,可三角化的覆盖抬到 94% 左右。腕部相机的必要性也从这里来,抓握闭合的瞬间手掌挡住关键点,腕部视角是少数还能看清的机位。

落实到布局验收,要求 30 到 120 厘米范围内的任意工作点,至少被两颗相机在正负 50 度视角内覆盖,三角测距角落在 5 到 40 度之间。腹部高度那一圈最容易被漏掉,要专门扫一遍。误差报告也要分帧类,接触帧和过渡帧各算各的,中心视场和边缘视场分开,混在一起的指标没有意义。这一项的目标可以定为,接触帧 90 分位 MPJPE 不超过 10 毫米

手部追踪的精度数字同样要看口径,而且要把设备能力和算法精度分开。设备负责的是可观测性,多视角、全局快门、同步、标定、足够视场、度量深度,这些是硬件承诺的部分;21 个关键点、MANO 姿态、置信度、遮挡状态是算法在硬件产出上算出来的部分,同一台设备换个算法,精度数字就变了。验收时要分清买的是哪一层。RoboCap 的多视角方案给出过几组数,在公开数据集 HOT3D 上是 14.47mm,内部合成测试 9.2mm,第三视角的 DexYCB-Mv 上能到 5.7mm。同一套算法,场景换了,数字差出一倍多。评估还有两个坑,一是不能做 Procrustes 对齐,对齐后误差会虚假变小;二是要在真实的手物交互场景里测,拿干净的张开手掌数据测出来的精度,到了抓工具、端杯子的场景会掉一截。输出侧的数据结构可以参考 Aria MPS 的做法,每手 21 个关键点各自带度量 3D 坐标和逐关节置信度,另加追踪状态、腕部位姿、掌部位姿和遮挡状态,不是只存一串 xyz。

精度要立得住,还要标定兜底。逐台出厂标定,和设备序列号绑定,随每条数据交付,这件事应该视为数采设备的基本能力而不是附加功能,Aria Gen 2 每台设备都带独立出厂标定文件,内参、外参、IMU 标定、设备变换全部按标准 JSON 交付。鱼眼镜头用 Kannala-Brandt 模型,4 参数或 8 参数写明确切型号和完整系数,标定靶要覆盖大视场边缘,重投影误差压到 0.2 像素以内。验收线上,单相机重投影不超过 0.5px RMS,任意两相机外参重投影不超过 1.0px,工作温度内光心漂移不超过 1px、焦距漂移不超过 0.3%。实测的量级可以做个参照,灰度相机约 0.3px,RGB 相机约 0.8px,相机对 IMU 约 0.7px。还可以更进一步,记录逐时刻温度对应的内外参和 IMU 零偏,每条 episode 采前采后各查一次双目残差,头戴结构的佩戴形变就能及时暴露。

温度一变,光心和焦距会漂,长会话要有自标定。RoboCap 的做法是每段录制用自然场景自标定一次,极线残差中位数从 3.8 像素降到 0.56 像素,1 米内的深度相对误差从 2.3% 降到 1.1%。Meta 的 MPS 服务也在做类似的事,按帧率估计相机和 IMU 内外参的时变量,能修正佩戴应力导致的 25 角秒级微形变。这套流程不做,早上标定的参数到下午就不可信了。交付清单里还要有一份坐标系文档,手性、轴向、四元数用 wxyz 还是 xyzw、相机到机体的方向,全都写死,不然两批数据对不上。

第五部分

音频、腕部设备和整机形态

音频分三档。门槛 16kHz、16bit;主流 48kHz PCM 立体声,双 MEMS 麦克风、约 14 厘米立体声基线,配防风网罩和减振装配;做视触觉的方案再加一路 192kHz 双声道的接触声学,贴在夹爪附近拾接触音。

腕部设备是一套独立的小规格单。RGB 不低于 1280×1280@30,优选 1600×1200@60 全局快门,视场水平 165 度、对角 188 度,可视距离 0.1 到 1.5 米。深度用 ToF 的话 640×480@30、2 米内误差小于 1.5%,或者视觉派生近场 10 到 80 厘米误差 5mm 以内。腕部相对头戴的定位精度验收线 5mm,选配激光追踪能到 1mm,接口上预留 VIVE 定位。夹爪行程不低于 85mm,平动覆盖 0 到 100mm,夹持力切向 2kg、法向 2.5kg,角度检测 ±0.1°、距离 ±0.2mm、采样不低于 100Hz,和 RGB、位姿同步。视触觉方案要求触觉、视觉、位姿三者同步偏差小于 1ms。整机不超过 500g,IP54,工作温度零下 5 到 40 摄氏度,续航 3 小时以上,换电不断电。

对腕部相机的定位还要再抬一级。做普通 Ego 视频数据,头戴单机够用;做灵巧操作数据,头戴加腕部应该是标准组合,不是选配。头戴相机看到任务、手和环境,腕部相机看到手指、抓握和接触区域,立体或 ToF 给度量深度,IMU 加 SLAM 给头和腕的运动,几路信息合起来才能把人的动作还原成手、物体和任务状态。前面遮挡一节的三组覆盖率数字就是这条结论的依据。

头戴整机的形态指标影响的是产能。重量 250g 以内是优选,四目大视场方案放宽到 350g,计算舱后置不超过 180g 做前后配重,非背包式,外壳温度低于 40 摄氏度,兼容安全帽、护目镜和近视眼镜。这一条看着是舒适性,实际决定操作员一个班次愿意戴多久。

稳定性有明确的量化口径。双路 60fps 连续录满 1 小时,佩戴走动、光照切换,无中断无损坏,末 10 分钟帧率和前 10 分钟差异小于 2%,不允许热降频掉帧。系统级要求满规格连续采集 48 小时无死机、无数据丢失,25 摄氏度环境下 45 分钟全规格编码不降频。断电保护要单独验证,分块写入、停录时缓冲区完整落盘,意外断电后 session 能恢复。

存储和导出是产能核心变量。机内存储要装下 8 小时以上采集数据,256GB 存储卡或者 1TB NVMe 约够 14 小时,持续写入不掉速。导出按 USB 3.2 Gen2 实测,70GB 大约 2 分钟。Wi-Fi 6 后台断点续传实测能到 1Gbps 左右,70GB 十分钟传完,但采集时默认关掉无线模块,射频对 IMU 有干扰。

第六部分

数据格式与交付

编码只做一代压缩。MP4 容器加 H.265 或 AV1,设备端实时编码就是最终源编码,不二次转码。标准 8-bit,不接受 HDR 和 10bit。客户指定 H.264 的,要求可配 GOP 等于 30、禁用 B 帧。

数据包格式主流是 MCAP 加 protobuf,客户定制格式见过三类,1080p@30 原始帧加校正帧、JPEG 质量 85 以上加 HDF5、LeRobot v3.0 的 parquet。定 LeRobot 规格的要注意细节,单分片不超过 50 小时、fp32、21 关节四元数手部数据、显式声明单一主图像流,字段命名跟 Diffusion Policy 和 LeRobot 规范对齐。

比容器选择更重要的一个原则,是源数据和派生数据分层。原始传感器流是一层,RGB、灰度、IMU、音频、深度;标定和时间同步是一层,内参、外参、畸变系数、相机对 IMU 变换、时钟映射、温度;算法输出是一层,头部位姿、手部 21 点、MANO、身体姿态、分割、物体位姿。三层分开存,以后换算法不用重新采集,Aria 的 VRS 格式就是这个思路,每个传感器流保存时间戳、帧号、曝光、增益等采集参数,标定和配置独立存放。目录结构上,一条 episode 下面按 rgb、imu、pose、depth、audio、timestamps、calibration、task 分子目录,manifest 收口,别只交一个视频文件。

单段时长最短 30 秒,明确不要 15 秒上下的短片段,可变长度手动启停,单条录制支持到 1 小时。目录按批次、场景、任务、episode 四层组织,episode 内视频、深度、IMU、位姿、任务日志、错误记录各归各的子目录,每条数据随附 manifest,机器可读的 CSV 加一份带颜色标记的 Excel。

传输走 Rsync 或 Aspera 这类支持断点续传的加密协议。MD5 和 SHA256 双向校验,单批次超过 10TB 的免费配 LUKS 加密硬盘物理寄送,本地删除源副本之前必须完成校验。权属条款写死,全程本地存储与导出、不经过云端、可完全离线运行,买方拥有原始数据完整所有权和无限制商用使用权

第七部分

已有设备规格对比

公开资料比较全的几款,规格列成一张表。精度类数字保留了厂商口径,看完前面几节,哪些数字要追问,应该有数了。

设备
相机与 IMU
同步与形态
备注
RoboCap
6×1920×1080@30 全局快门,前双目 86.8mm 加眼位双目 106.2mm 加 2 侧向
双 IMU 200Hz
PWM 一分六硬件触发
约 250g,5 到 6 小时
每段录制自标定,手部合成测试 9.2mm MPJPE
Pico 4 Ultra
2×32MP,应用层 1280×960@89fps
头显 IMU
跨设备软件对时 2 到 3ms
Motion Tracker 90 到 110 分钟
每手 26 点 OpenXR 关节,24 身体点,4050 小时数据集实践
Aria Gen 1
RGB 2880×2880@30 卷帘,另加 2 颗 SLAM 全局快门和 2 颗眼动
双 IMU 800 和 1000Hz 异构
全传感器共时钟,纳秒级时间戳
75g,约 1.5 小时
研究用途申请制,感知靠云端 MPS 后处理
Aria Gen 2
4 颗 CV 全局快门(119°、120dB HDR),另加 12MP RGB(卷帘、全分辨率 24fps)和 2 颗眼动
双 6 轴 IMU,典型 800Hz、最高 1600Hz
SubGHz 时间域映射,实测对齐 2.18µs
约 75g,6 到 8 小时
端侧协处理器跑 VIO、手部和眼动,2026 年起开放申请
Apple Vision Pro
12 颗相机加 LiDAR,原始帧不开放
4 颗 IMU,原始流不开放
设备内 12ms
600 到 800g,约 2 小时
数据通路封闭,不适合数采
简智 DAS Ego
6×RGB-IR 1600×1300@30 全局快门,水平视场超 270 度
车规 6 轴 200Hz
头手小于 1ms
350g,磁吸换电
MCAP 格式,宣称毫米级轨迹,订单 3000+ 台
鹿明 FastUMI Ego
鱼眼 1280×1280@60,另加 4 颗 SLAM 相机和 ToF
ICM-42688 500Hz
多相机流时间戳对齐
235g,功耗小于 4W
免建图即插即用,宣称 3mm 级定位
创维 E2/E6/E8
E2 双路 1080p RGB;E6 4 灰度全局快门加 2 RGB,宣传 214°;E8 4 灰度加 4 RGB 加 ToF,9 路同步 270°
高通 XR2 平台,IMU 参数未公布
机内 SLAM 直出,腕部无线同步宣称 50µs
140g / 370g / 300g
一体机免外接主机,交付超 1 万台,原子运动评测加权 2.1mm

灰色小字为 IMU 与重量续航,表格较宽可横屏阅读

RoboCap 是研究取向最完整的一套。六颗全局快门相机分成三组,前方双目基线 86.8mm 贴合手部工作区,眼位双目 106.2mm 用 180 度鱼眼,两颗侧向 161 度补盲区,四目拼接后水平视场能过 270 度。配套的 Grounded API 直接产出轨迹、深度和手部 3D,等于把标签生产的上游也做了。每段录制用自然场景自标定,极线残差中位从 3.8px 修到 0.56px,这套前面提过。短板是 IMU 只有 200Hz,卡在门槛线上。

Pico 4 Ultra 走的是头显加多机位的路线。头显本体每手 26 个 OpenXR 关节点、约 90Hz,加 24 个身体骨骼点,步态识别有效占比 98% 以上。跨设备靠软件对时,偏移 2 到 3ms,全程漂移小于 5ms,做毫米级几何不够,做厘米级 demo 够用。有多机位方案在腕部加 2 颗 ZED,配合 4050 小时的数据集实践,是验证过能跑通量产流程的路线。

Project Aria 两代是学术界第一视角数采的事实标准,Ego-Exo4D 和 HOT3D 这些数据集都拿它采的。Gen 1 的亮点在同步和标定,全部传感器出厂标定后打在同一个时钟域上,时间戳纳秒级,双 IMU 刻意选不同型号让误差去相关。短板是 RGB 卷帘快门、续航只有 1.5 小时、感知全靠云端 MPS 后处理。Gen 2 把三块都补了,CV 相机加到 4 颗全局快门、120dB HDR、前方组成双目,跨设备改 SubGHz 无线对时,感知搬到端侧自研协处理器,续航 6 到 8 小时,另加了 PPG 心率和接触麦克风。有一个细节前面提过,它的 12MP RGB 全分辨率下是 24fps,30fps 要用较低分辨率的 profile,采购参数里不能写成 12MP@30。自研方案做传感器架构对标,Aria Gen 2 加 RoboCap 是目前最值得参照的两个基准。

反例。 Apple Vision Pro 的传感器账面非常豪华,12 颗相机、LiDAR、4 颗 IMU,光子到光子延迟 12 毫秒。问题出在数据通路。原始相机帧要靠 visionOS 的 Enterprise API,主摄立体帧能拿到,校正和非校正帧、采集时间戳、内外参、曝光中点时间戳都在,但需要企业权限逐 App 向 Apple 申请,绑定授权文件,不能上架 App Store,只能企业内部分发。原始 IMU 流仍然不开放,ARKit 只给高层锚点。眼动数据出于隐私永不出设备。想外接腕部相机,USB-C 口同时只支持一个 USB 相机,有团队实测双腕部相机的帧率不到 1fps。加上 600 到 800g 的佩戴负担和约 2 小时的续航,作为开放式的原始多传感器数采平台,它依然不合格,但要按现在的口径说,是数据访问受企业权限严格约束,不是完全拿不到相机数据。数据通路的开放性,要和传感器规格放在一起看,两者同级。

简智 DAS Ego 已经量产,厂商宣称订单三千多台,六目 RGB-IR 全局快门,水平视场超 270 度,头手同步小于 1 毫秒,数据用 MCAP,6 路图像加 IMU、VIO 位姿、夹爪距离和音频都按 topic 组织。三处要盯。IMU 恰好 200Hz,卡在门槛线上,要确认能否上调。宣称毫米级轨迹重建,口径是 VIO 加 BEV 网络,目前没有第三方验证数据,要按绝对误差的口径重新问。音频单段限 15 秒,对长 episode 是硬约束。另外 6 路都是 30fps,对手部快速动作余量有限。它家的产品矩阵还有双指的 Fingers、五指的 Dex 手套和遥操终端,头手全套都有。

鹿明 FastUMI Ego 的亮点是 235g 的整机、60fps 鱼眼主摄加 500Hz 的 ICM-42688,硬门槛都达标,免建图即插即用,从第一帧开始定位。1mm 和 3mm 的定位精度是纯视觉口径,同样要问真值来源和统计量。它的 SLAM 相机只有 640×480@30,深度主力靠 320×240 的 ToF,近场精细几何要实测再说。配套的 FastUMI Pro 夹爪 600 多克、负载 2kg、四目视觉 180 度模组,采集频率 60Hz,视触觉和压敏阵列选配,和头显组成头加手的完整方案。

创维 XR 是今年新入场的一家,背后是十二年的 VR/XR 整机代工积累,产品思路和前面几家都不一样,走模组堆叠的反面,一体机。E2/E6/E8 三档梯度,E2 双路 1080p RGB、低于 140g,面向对轨迹精度要求宽松的科研验证;E6 是量产主力,高通 XR2 平台,4 颗灰度全局快门加 2 颗 RGB,整机 370g;E8 用 XR2 Gen2,4 灰度加 4 RGB 加 ToF,9 路画面同步,视场拓到 270 度,整机压在 300g。灰度加 RGB 混合布局有个工程逻辑,灰度全局快门数据量只有 RGB 的三分之一,用低算力做 SLAM 特征定位,RGB 管语义画面,两组视场互相重叠提供稳定约束。

创维的差异化在机内 SLAM 直出轨迹,视觉和 IMU 在设备端融合解算,宣称定位毫米级,客户拿到数据不用再做离线解算。配套的精度证据是 26 条轨迹的原子运动评测,纯旋转组位置平均误差 1.3mm,纯平移组 1.5mm,耦合组 2.3mm,全部 26 条按轨迹长度加权是位置 2.1mm、角度 1.06°,没有一条发散。腕部相机整机 100g,内置 IMU 加红外灯环,头显灰度相机识别灯环直接解算腕部 6DoF,头腕无线同步宣称 50 微秒,这个数字如果实测站得住,比蓝牙信标的 1 毫秒验收线好一个量级。灯环模组还能搭载到第三方夹爪和触觉手套上,统一时间基准。

两处要按惯例追问。 宣称的毫米级轨迹是机内 VIO 口径,评测集是原子运动轨迹,和真实任务场景的长距离复合运动还有距离,要按绝对误差口径重新问。IMU 的具体型号、采样率和标定参数导出能力没有公开,需要补。出货是实打实的,4 月开始交付,8 月超 1 万台,客户端带动的采集时长号称几十万小时量级,价格宣传为行业头部几家的一半。大规模交付本身说明量产和品控过了关,这正是 XR 制造底子的价值。

第八部分

需求按用途分四级

前面所有指标不是要一次买齐,按用途分四档,每一档对应明确的数据消费场景。

第一档,可用 Ego 数据。1080p、30fps、宽视场、IMU 大于 200Hz、原始时间戳、可导出标定、本地存储。够做 VLM 和 VLA 的视频预训练、任务理解。

第二档,机器人 Ego。1080p@60、全局快门、双目、100mm 上下基线、500Hz IMU、1ms 内同步、完整标定。够做 VIO、深度、手部追踪和机器人模仿学习。

第三档,灵巧操作 Ego。4 到 6 颗全局快门相机、60fps、100 到 120mm 基线、1 到 4ms 曝光、500 到 1000Hz 双 IMU、设备内同步 100 微秒以内、头腕同步 1ms 以内、腕部相机、21 点手部、接触帧 P90 不超过 10mm。做 manipulation 数据,目标应该定在这一档。

第四档,真值级 Ego。在第三档之上加光学动捕或激光追踪参照、外部时码、逐会话标定、温度模型、离线 BA、MANO 优化、物体位姿、触觉和接触声学。HOT3D 这类基准数据集走的就是这条路,手和物体用动捕系统取真值。这一档是做 benchmark 和高精度手物重建用的,量产采集不需要。

多数团队容易犯的错是按第一档的价钱期待第三档的数据。反过来,预算只够第一档时,也别把灵巧操作的指标硬塞进需求,买回来的设备撑不住验收,双方都难做。

第九部分

验收和产能

数据采回来只是半程,验收规则要写进合同。单条数据先过自动化质检,帧间隔的分布、多路流的重叠度、跨设备漂移、追踪有效时间的占比,都有明确阈值。流重叠度低于 80% 警告,低于 60% 判废;追踪有效占比低于 95% 警告,低于 80% 判废;全程漂移超过 5ms 判废。完整性也有硬规则,任一相机打开失败就拒绝开录,头显掉线等待 15 秒正常收尾,判定分四档,通过、带警告通过、失败、不完整。自动化查得出技术缺陷,查不出演示质量,操作员疲劳、动作犹豫这类问题要人来判断,所以批次验收保留不低于 5% 的人工抽检。

批次层面,平台先做全量自动验收,数据可解析零报错、必含数据流完整、标定文件无 NaN、MD5 一致、TF 树有效,过了再人工抽检。单房间要覆盖至少 10 到 15 条任务、5 种家装风格,任务域分布差异不超过 20%。防刷量也要写进规则,连续 3 条任务只换物体颜色就判违规。数据投毒的几种手法,标签翻转、后门触发、样本重复放大,在批次抽检里都要过一遍。

重采优于修补。 连续超过 5 秒的图像或位姿丢失、标注和视频对不上、数据造假,发现即整批拒收,48 小时内全量重采。修补出来的数据,时间戳和标注的可信度都降一级,比重采更贵。

最后一笔账和设备无关,却决定产能。单个操作员一个班次的有效采集时间是 5 到 5.5 小时,吃饭休息、倒数据、换电池都要扣时间。按 20 个环境各 500 小时算,大约要 95 个操作员日,这笔账应该在买设备之前算。环境多样性的预算、导出速度、换电会不会中断录制、备机数量,每一项都是日产能的变量。

最后

写在最后

评审里最有用的一条经验,放在结尾。厂商给的每个数字,都要追问统计口径。误差按绝对还是相对算,报的是均值还是分位数,真值从哪来。规格表回答不了这些问题,实测报告可以。追问口径不涉及信任,规格表没有撒谎,它只是用了另一种语言。

随机文章