具身智能数采设备怎么选?硬指标、口径陷阱与主流设备对比
买方视角的硬门槛、口径陷阱与验收规则
具身智能这一轮,讨论模型和本体的内容很多,第一视角数据怎么采、指标怎么定、设备怎么比,公开能查到的整理很少。我们过去一段时间在做这件事,定了数采需求,评审了几轮设备和供应商方案,踩过一些口径的坑。这篇文章把能公开的部分写出来,指标尽量给到能直接写进需求文档的程度,设备对比用已有公开规格。
业内对第一视角路线的判断基本一致,机器人部署时看到的是自身相机的画面,手和物体的相对位置、抓握闭合、接触时刻这些对操作最关键的信号,只有站进任务里才拍得到。落到硬件上是一条选型原则,采集装置的相机位置和视场,必须匹配目标机器人末端执行器的传感器几何。差得太多,真人数据往 policy 上迁移时,收益会大量漏掉。
展开指标之前,先给一个总纲。Ego 数采设备的核心是一套空间测量系统,多视角相机、高质量 IMU、精确时间同步、精密标定、手部和腕部观测、稳定记录,缺一块,数据就废一块。高分辨率头显只是其中一块,权重还没有排序靠前的几项大。这套系统的质量是各组分的连乘,可观测性、同步、标定稳定性、追踪、数据完整性,任何一项归零,整体归零。各项的优先级大致是,几何可观测性高于时间同步,时间同步高于标定稳定性,再往下是遮挡冗余、图像分辨率,头显本身的 XR 功能排在最后。后面每一节都在展开这个排序。

第一部分
相机和 IMU 的硬门槛
最硬的一条是快门。人干活时头和手同时在动,卷帘快门逐行曝光带来的畸变跟着运动变,标定做不掉。这里要把门槛限定准确,需要承担三角测距、运动重建、手部几何估计的几何主相机,必须全局快门,没有商量余地;纯语义画面的 RGB 相机可以放宽,Aria Gen 2 就是这个架构,4 颗 CV 相机全局快门管几何和 SLAM,12MP RGB 卷帘快门管纹理和语义,官方确认这是一种合理分工。评审时要对方说明每颗相机的快门类型,最好给实测图,有方案用软件模拟或者 global reset 冒充全局快门。
其余相机指标有公认的下限。分辨率单路不低于 1080p,注意要两路同开实测,有的设备单路能跑,双路一起开就掉,优选 1920×1200,竖直方向对工作区覆盖更充分。帧率上,60fps 比 4K 更值得优先,手部动作快,几何相机建议 1920×1200@60 全局快门,RGB 语义相机 1080p 到 2560×1920 之间按 30 到 60 帧配。视场角要看有效视场,也就是校正之后的视场,水平不低于 110 度、垂直不低于 80 度,推荐 120 到 160 度、垂直 90 度以上。宣传页上的 180 度常常是鱼眼圆的直径,校正后没这么大。鱼眼镜头可以用,必须有精确的去畸变模型。镜头必须定焦,自动对焦一动,内参跟着变,标定作废,深度也没法用。前置双目的基线不低于 80mm,推荐 100 到 120mm,公开方案多在 86.8 到 120mm 之间,这个区间直接决定 0.3 到 1.2 米工作区的深度精度。
曝光也有讲究,它的优先级远高于分辨率数字。手以每秒 1 到 2 米的速度动,每毫秒位移 1 到 2 毫米,8 毫秒曝光就是 8 到 16 毫米的运动模糊,4K 的像素再多也救不回来。所以正常动作曝光钳制在 4 毫秒以内,高速手部动作目标 1 到 2 毫秒,亮度靠增益补。室内还有 50 赫兹的灯光频闪,相机要有防闪烁功能,多帧合成的 HDR 要能关掉,它会把帧与帧的时间戳定义搅乱。相机每帧的曝光、增益、时间戳要可读回,这是后面 QA 的基础。
双目相机还有一条容易漏的,左右目的曝光和白平衡必须主从同步,一路决策、两路同参数,并且支持完全手动锁定。左右各自自动曝光的设备,一到明暗交界的场景,两路画面的亮度对不上,立体匹配大面积失败,深度就废了。选型时还要问清自动曝光收敛需要几帧。
物距覆盖对照手部工作区检查。典型要求是 25 到 70 厘米或者 30 到 120 厘米的工作区落在景深内,前置相机组最好从 20 厘米覆盖到 5 米,把桌面以下、腹部高度的画面都装进来。
IMU 的门槛写在纸面上只有一句,采样率严格大于 200Hz,这是最低门槛,不是设计目标。实际评审里这条最容易被擦边。有设备的规格恰好卡在 200Hz,按字面就不达标,要追问能不能上调。还要确认标称的是芯片输出频率还是实测输出频率,这两者经常对不上。公开设备已经把标杆拉得很高,Aria Gen 1 双 IMU 是 800 和 1000Hz,Gen 2 典型 800Hz、最高 1600Hz,FastUMI Ego 用 500Hz 的 ICM-42688,所以自研的主力规格建议 500Hz,高端 800 到 1000Hz 双 IMU。
IMU 的细节还有几条。轴数要 9 轴,磁力计在 UMI 路线是必选。量程建议双 IMU 搭配,一路 ±4g、±500°/s 做精密通道,另一路 ±16g、±2000°/s 留出甩头的饱和裕量,两颗用不同型号的芯片,高阶误差互不相关,融合后噪声更干净。陀螺仪零偏要求不大于每小时 5 度,零偏、比例因子、轴对齐、温补系数要能导出成标定文件。输出必须是原始的陀螺加加速度计数据,芯片端融合过的数据不要。时间戳由硬件中断打,不能取主控读取的时刻,FIFO 回溯补偿机制要让供应商说明。
口径陷阱。 指标本身好查,难的是口径。宣传视场角和有效视场角对不上,芯片标称频率和实测频率对不上。所有拿不准的指标,都要求实测报告。误差用 ATE 还是 RPE 算,报的是均值还是 p95,要写清;在线跑的还是离线优化后的,真值从哪来,同样要问。
硬门槛收成一张表。
| | |
|---|
| 几何主相机全局快门 | |
| | |
| | |
| | |
| | 100 到 120mm |
| | |
| | |
| | 500 到 1000Hz 双 IMU |
| | |
| | |
| | 1ms 以内 |
| | |
| | 300Hz 以上 |
| | |
| | |
| | |
第二部分
先盯同步,再谈帧率
同步的道理可以算成一笔账。手部动作速度能到每秒 1 到 2 米,1 毫秒里手就走 1 到 2 毫米。两路数据的时间戳差 5 毫秒,毫米级的几何信息已经错位,再高的帧率也救不回来。
设备内部的同步靠硬件。所有相机接同一个触发信号,相机间偏差压到 0.1 毫秒以内,实测系统做到 200 微秒量级。相机和 IMU 共用一个晶振,固定偏移靠标定消掉,实测里见过 5 到 8 毫秒的偏移,不标定就一直留在数据里。
跨设备更难。头和腕两台设备,有线连接用触发线加对时握手,能压到 10 微秒级;无线走蓝牙信标,验收线定在 1 毫秒。软件对时只能做兜底,用离线 IMU 互相关能到 5 到 10 毫秒,元数据里要标注同步等级。只靠软件对时的方案,头显和计算单元之间的偏移典型值就有 2 到 3 毫秒,p95 能到 11 毫秒,毫米级精度谈不上了。
长录制还有漂移问题。各自带独立晶振的设备,一小时能累计上百毫秒的偏差,中途不报错、不丢帧。姿态漂移的麻烦在于它静默发生,0.05 度的相对偏航漂移,纯几何位移在 120 厘米处约 1 毫米,但经过双目外参传播和三角测量放大后,深度误差会比这个数字大得多,而且双目数据自己看不出来,只有对着外部真值才能发现。所以验收标准定为 1 小时录制端到端累计偏差小于 10 毫秒,逐帧帧间隔也要抽查,P99 偏离标称值不超过 10 毫秒。交付门槛可以放宽到 20 毫秒,再宽,手部轨迹就没法用了。
工程上有几个成熟做法值得写进需求。一是双时间戳体系,硬件时间戳 64 位微秒、单调递增、单次会话内对齐,UTC 时间戳跨会话关联、由 NTP 校准。二是采样率整除对齐,以 IMU 300Hz 为基准,视觉和手部追踪跑 60Hz、空间定位跑 30Hz,关键对齐点的时间戳严格一致,误差小于 1 毫秒。三是帧时刻口径要声明,每帧时间戳对应曝光开始、中点还是读出结束,融合时以曝光中点为基准,逐帧输出实际曝光时长。四是共享时钟整个会话期间不可重置,头显热插拔换电的场景,要求桥接电芯维持 90 秒供电,保住时钟和标定状态。
两个 KPI 别混。 时间戳对齐和物理触发同步是两件事。Aria Gen 2 的官方文档把这层讲得最清楚,它的 SubGHz 跨设备对时实测时间戳对齐误差 2.18µs、精度正负 5µs,但官方明确说明这是时间域映射,不等于两台设备的相机触发已经硬件同步,真要对齐触发时刻,要在 SDK 里另开跨设备相机同步选项。供应商说「同步精度 2 微秒」的时候,先问清说的是哪一层。
时间戳还有一层容易被忽略。MP4 容器里的时间戳是按恒定帧率生成的,不反映真实采集时刻,掉帧的位置会被均匀填平。所以交付里必须有逐帧独立时间戳文件,掉帧如实留空洞并打上丢帧标记,用重复帧补齐的要整条拒掉。
第三部分
位姿精度,先把口径问清
头部 6DoF 位姿的验收口径是 10mm ATE,绝对轨迹误差。这一条要先立住,因为规格表上漂亮得多的数字几乎都不是这个口径。宣称 2 到 3mm 的,多半是相对位姿误差,衡量相邻时刻的平滑程度,积累漂移完全不反映。我们用光学动捕实测过一类头戴设备,作为真值参照,其 RMS 平移误差到了 11mm。
在线和离线也要分开。在线 VIO 没有回环,误差约为离线全局优化后的 2 倍,长时间运行必然漂移。对比公开基准有个大致的刻度,EuRoC 数据集上优秀算法的离线 ATE 在 2 到 3 厘米,TUM-VI 上约 0.9 厘米,HOT3D 上 0.3 到 0.4 厘米。RoboCap 的六目 VI-SLAM 报告对比了 ORB-SLAM3、Basalt、OKVIS2 和 cuVSLAM,量级都在这个范围。谁宣称显著低于这个刻度,先问真值怎么来的。
位姿输出还有三条工程要求。追踪状态必须作为字段输出,正常、丢失、重定位各自标记,重定位后世界坐标系可能跳变,要用事件字段标出来,下游才知道哪一段轨迹不能直接用。输出频率要求 300Hz 以上稳定连续无跳变,姿态和关节数据 50Hz。无遮挡条件下,光学动捕或激光追踪的定位精度能做到 1 到 5mm,这是腕部相对头戴定位 ≤5mm 验收线的真值基础。
第四部分
毫米精度是被遮挡吃掉的
深度误差随距离的平方增长。按 12 厘米基线、0.25 像素视差精度算,单帧误差是这样的。
这张表怎么用。 它是理想视差传播的下界,只含深度解算这一层,不含匹配失败、遮挡、标定误差、姿态误差和物体表面纹理的影响。按同一组参数算,0.65 米处 1 个像素的视差误差换算成深度偏差约 5 毫米,叠加真实场景里匹配和标定的退化,实际会明显更高。所以这张表只能当 sensor 级的下界看,最终精度必须用真实手部表面和真实运动做端到端测试。
真正的麻烦在遮挡。
关键点被挡住时,误差会退化到 1 到 3 个像素,在 120 厘米处一帧就是 18 到 50 毫米。误差最集中的帧,恰好是训练价值最高的帧。手合拢、接触物体那一下,手掌自己把关键点挡了。三组数字能说明多目布局的价值。单颗相机大约有 15% 的帧看不见关键点,两目同时可见的覆盖是 72%,加到三目,可三角化的覆盖抬到 94% 左右。腕部相机的必要性也从这里来,抓握闭合的瞬间手掌挡住关键点,腕部视角是少数还能看清的机位。
落实到布局验收,要求 30 到 120 厘米范围内的任意工作点,至少被两颗相机在正负 50 度视角内覆盖,三角测距角落在 5 到 40 度之间。腹部高度那一圈最容易被漏掉,要专门扫一遍。误差报告也要分帧类,接触帧和过渡帧各算各的,中心视场和边缘视场分开,混在一起的指标没有意义。这一项的目标可以定为,接触帧 90 分位 MPJPE 不超过 10 毫米。
手部追踪的精度数字同样要看口径,而且要把设备能力和算法精度分开。设备负责的是可观测性,多视角、全局快门、同步、标定、足够视场、度量深度,这些是硬件承诺的部分;21 个关键点、MANO 姿态、置信度、遮挡状态是算法在硬件产出上算出来的部分,同一台设备换个算法,精度数字就变了。验收时要分清买的是哪一层。RoboCap 的多视角方案给出过几组数,在公开数据集 HOT3D 上是 14.47mm,内部合成测试 9.2mm,第三视角的 DexYCB-Mv 上能到 5.7mm。同一套算法,场景换了,数字差出一倍多。评估还有两个坑,一是不能做 Procrustes 对齐,对齐后误差会虚假变小;二是要在真实的手物交互场景里测,拿干净的张开手掌数据测出来的精度,到了抓工具、端杯子的场景会掉一截。输出侧的数据结构可以参考 Aria MPS 的做法,每手 21 个关键点各自带度量 3D 坐标和逐关节置信度,另加追踪状态、腕部位姿、掌部位姿和遮挡状态,不是只存一串 xyz。
精度要立得住,还要标定兜底。逐台出厂标定,和设备序列号绑定,随每条数据交付,这件事应该视为数采设备的基本能力而不是附加功能,Aria Gen 2 每台设备都带独立出厂标定文件,内参、外参、IMU 标定、设备变换全部按标准 JSON 交付。鱼眼镜头用 Kannala-Brandt 模型,4 参数或 8 参数写明确切型号和完整系数,标定靶要覆盖大视场边缘,重投影误差压到 0.2 像素以内。验收线上,单相机重投影不超过 0.5px RMS,任意两相机外参重投影不超过 1.0px,工作温度内光心漂移不超过 1px、焦距漂移不超过 0.3%。实测的量级可以做个参照,灰度相机约 0.3px,RGB 相机约 0.8px,相机对 IMU 约 0.7px。还可以更进一步,记录逐时刻温度对应的内外参和 IMU 零偏,每条 episode 采前采后各查一次双目残差,头戴结构的佩戴形变就能及时暴露。
温度一变,光心和焦距会漂,长会话要有自标定。RoboCap 的做法是每段录制用自然场景自标定一次,极线残差中位数从 3.8 像素降到 0.56 像素,1 米内的深度相对误差从 2.3% 降到 1.1%。Meta 的 MPS 服务也在做类似的事,按帧率估计相机和 IMU 内外参的时变量,能修正佩戴应力导致的 25 角秒级微形变。这套流程不做,早上标定的参数到下午就不可信了。交付清单里还要有一份坐标系文档,手性、轴向、四元数用 wxyz 还是 xyzw、相机到机体的方向,全都写死,不然两批数据对不上。
第五部分
音频、腕部设备和整机形态
音频分三档。门槛 16kHz、16bit;主流 48kHz PCM 立体声,双 MEMS 麦克风、约 14 厘米立体声基线,配防风网罩和减振装配;做视触觉的方案再加一路 192kHz 双声道的接触声学,贴在夹爪附近拾接触音。
腕部设备是一套独立的小规格单。RGB 不低于 1280×1280@30,优选 1600×1200@60 全局快门,视场水平 165 度、对角 188 度,可视距离 0.1 到 1.5 米。深度用 ToF 的话 640×480@30、2 米内误差小于 1.5%,或者视觉派生近场 10 到 80 厘米误差 5mm 以内。腕部相对头戴的定位精度验收线 5mm,选配激光追踪能到 1mm,接口上预留 VIVE 定位。夹爪行程不低于 85mm,平动覆盖 0 到 100mm,夹持力切向 2kg、法向 2.5kg,角度检测 ±0.1°、距离 ±0.2mm、采样不低于 100Hz,和 RGB、位姿同步。视触觉方案要求触觉、视觉、位姿三者同步偏差小于 1ms。整机不超过 500g,IP54,工作温度零下 5 到 40 摄氏度,续航 3 小时以上,换电不断电。
对腕部相机的定位还要再抬一级。做普通 Ego 视频数据,头戴单机够用;做灵巧操作数据,头戴加腕部应该是标准组合,不是选配。头戴相机看到任务、手和环境,腕部相机看到手指、抓握和接触区域,立体或 ToF 给度量深度,IMU 加 SLAM 给头和腕的运动,几路信息合起来才能把人的动作还原成手、物体和任务状态。前面遮挡一节的三组覆盖率数字就是这条结论的依据。
头戴整机的形态指标影响的是产能。重量 250g 以内是优选,四目大视场方案放宽到 350g,计算舱后置不超过 180g 做前后配重,非背包式,外壳温度低于 40 摄氏度,兼容安全帽、护目镜和近视眼镜。这一条看着是舒适性,实际决定操作员一个班次愿意戴多久。
稳定性有明确的量化口径。双路 60fps 连续录满 1 小时,佩戴走动、光照切换,无中断无损坏,末 10 分钟帧率和前 10 分钟差异小于 2%,不允许热降频掉帧。系统级要求满规格连续采集 48 小时无死机、无数据丢失,25 摄氏度环境下 45 分钟全规格编码不降频。断电保护要单独验证,分块写入、停录时缓冲区完整落盘,意外断电后 session 能恢复。
存储和导出是产能核心变量。机内存储要装下 8 小时以上采集数据,256GB 存储卡或者 1TB NVMe 约够 14 小时,持续写入不掉速。导出按 USB 3.2 Gen2 实测,70GB 大约 2 分钟。Wi-Fi 6 后台断点续传实测能到 1Gbps 左右,70GB 十分钟传完,但采集时默认关掉无线模块,射频对 IMU 有干扰。
第六部分
数据格式与交付
编码只做一代压缩。MP4 容器加 H.265 或 AV1,设备端实时编码就是最终源编码,不二次转码。标准 8-bit,不接受 HDR 和 10bit。客户指定 H.264 的,要求可配 GOP 等于 30、禁用 B 帧。
数据包格式主流是 MCAP 加 protobuf,客户定制格式见过三类,1080p@30 原始帧加校正帧、JPEG 质量 85 以上加 HDF5、LeRobot v3.0 的 parquet。定 LeRobot 规格的要注意细节,单分片不超过 50 小时、fp32、21 关节四元数手部数据、显式声明单一主图像流,字段命名跟 Diffusion Policy 和 LeRobot 规范对齐。
比容器选择更重要的一个原则,是源数据和派生数据分层。原始传感器流是一层,RGB、灰度、IMU、音频、深度;标定和时间同步是一层,内参、外参、畸变系数、相机对 IMU 变换、时钟映射、温度;算法输出是一层,头部位姿、手部 21 点、MANO、身体姿态、分割、物体位姿。三层分开存,以后换算法不用重新采集,Aria 的 VRS 格式就是这个思路,每个传感器流保存时间戳、帧号、曝光、增益等采集参数,标定和配置独立存放。目录结构上,一条 episode 下面按 rgb、imu、pose、depth、audio、timestamps、calibration、task 分子目录,manifest 收口,别只交一个视频文件。
单段时长最短 30 秒,明确不要 15 秒上下的短片段,可变长度手动启停,单条录制支持到 1 小时。目录按批次、场景、任务、episode 四层组织,episode 内视频、深度、IMU、位姿、任务日志、错误记录各归各的子目录,每条数据随附 manifest,机器可读的 CSV 加一份带颜色标记的 Excel。
传输走 Rsync 或 Aspera 这类支持断点续传的加密协议。MD5 和 SHA256 双向校验,单批次超过 10TB 的免费配 LUKS 加密硬盘物理寄送,本地删除源副本之前必须完成校验。权属条款写死,全程本地存储与导出、不经过云端、可完全离线运行,买方拥有原始数据完整所有权和无限制商用使用权。
第七部分
已有设备规格对比
公开资料比较全的几款,规格列成一张表。精度类数字保留了厂商口径,看完前面几节,哪些数字要追问,应该有数了。
| | | |
|---|
| 6×1920×1080@30 全局快门,前双目 86.8mm 加眼位双目 106.2mm 加 2 侧向 双 IMU 200Hz | PWM 一分六硬件触发 约 250g,5 到 6 小时 | 每段录制自标定,手部合成测试 9.2mm MPJPE |
| 2×32MP,应用层 1280×960@89fps 头显 IMU | 跨设备软件对时 2 到 3ms Motion Tracker 90 到 110 分钟 | 每手 26 点 OpenXR 关节,24 身体点,4050 小时数据集实践 |
| RGB 2880×2880@30 卷帘,另加 2 颗 SLAM 全局快门和 2 颗眼动 双 IMU 800 和 1000Hz 异构 | 全传感器共时钟,纳秒级时间戳 75g,约 1.5 小时 | |
| 4 颗 CV 全局快门(119°、120dB HDR),另加 12MP RGB(卷帘、全分辨率 24fps)和 2 颗眼动 双 6 轴 IMU,典型 800Hz、最高 1600Hz | SubGHz 时间域映射,实测对齐 2.18µs 约 75g,6 到 8 小时 | 端侧协处理器跑 VIO、手部和眼动,2026 年起开放申请 |
| 12 颗相机加 LiDAR,原始帧不开放 4 颗 IMU,原始流不开放 | 设备内 12ms 600 到 800g,约 2 小时 | |
| 6×RGB-IR 1600×1300@30 全局快门,水平视场超 270 度 车规 6 轴 200Hz | | MCAP 格式,宣称毫米级轨迹,订单 3000+ 台 |
| 鱼眼 1280×1280@60,另加 4 颗 SLAM 相机和 ToF ICM-42688 500Hz | | |
| E2 双路 1080p RGB;E6 4 灰度全局快门加 2 RGB,宣传 214°;E8 4 灰度加 4 RGB 加 ToF,9 路同步 270° 高通 XR2 平台,IMU 参数未公布 | 机内 SLAM 直出,腕部无线同步宣称 50µs 140g / 370g / 300g | 一体机免外接主机,交付超 1 万台,原子运动评测加权 2.1mm |
灰色小字为 IMU 与重量续航,表格较宽可横屏阅读
RoboCap 是研究取向最完整的一套。六颗全局快门相机分成三组,前方双目基线 86.8mm 贴合手部工作区,眼位双目 106.2mm 用 180 度鱼眼,两颗侧向 161 度补盲区,四目拼接后水平视场能过 270 度。配套的 Grounded API 直接产出轨迹、深度和手部 3D,等于把标签生产的上游也做了。每段录制用自然场景自标定,极线残差中位从 3.8px 修到 0.56px,这套前面提过。短板是 IMU 只有 200Hz,卡在门槛线上。
Pico 4 Ultra 走的是头显加多机位的路线。头显本体每手 26 个 OpenXR 关节点、约 90Hz,加 24 个身体骨骼点,步态识别有效占比 98% 以上。跨设备靠软件对时,偏移 2 到 3ms,全程漂移小于 5ms,做毫米级几何不够,做厘米级 demo 够用。有多机位方案在腕部加 2 颗 ZED,配合 4050 小时的数据集实践,是验证过能跑通量产流程的路线。
Project Aria 两代是学术界第一视角数采的事实标准,Ego-Exo4D 和 HOT3D 这些数据集都拿它采的。Gen 1 的亮点在同步和标定,全部传感器出厂标定后打在同一个时钟域上,时间戳纳秒级,双 IMU 刻意选不同型号让误差去相关。短板是 RGB 卷帘快门、续航只有 1.5 小时、感知全靠云端 MPS 后处理。Gen 2 把三块都补了,CV 相机加到 4 颗全局快门、120dB HDR、前方组成双目,跨设备改 SubGHz 无线对时,感知搬到端侧自研协处理器,续航 6 到 8 小时,另加了 PPG 心率和接触麦克风。有一个细节前面提过,它的 12MP RGB 全分辨率下是 24fps,30fps 要用较低分辨率的 profile,采购参数里不能写成 12MP@30。自研方案做传感器架构对标,Aria Gen 2 加 RoboCap 是目前最值得参照的两个基准。
反例。 Apple Vision Pro 的传感器账面非常豪华,12 颗相机、LiDAR、4 颗 IMU,光子到光子延迟 12 毫秒。问题出在数据通路。原始相机帧要靠 visionOS 的 Enterprise API,主摄立体帧能拿到,校正和非校正帧、采集时间戳、内外参、曝光中点时间戳都在,但需要企业权限逐 App 向 Apple 申请,绑定授权文件,不能上架 App Store,只能企业内部分发。原始 IMU 流仍然不开放,ARKit 只给高层锚点。眼动数据出于隐私永不出设备。想外接腕部相机,USB-C 口同时只支持一个 USB 相机,有团队实测双腕部相机的帧率不到 1fps。加上 600 到 800g 的佩戴负担和约 2 小时的续航,作为开放式的原始多传感器数采平台,它依然不合格,但要按现在的口径说,是数据访问受企业权限严格约束,不是完全拿不到相机数据。数据通路的开放性,要和传感器规格放在一起看,两者同级。
简智 DAS Ego 已经量产,厂商宣称订单三千多台,六目 RGB-IR 全局快门,水平视场超 270 度,头手同步小于 1 毫秒,数据用 MCAP,6 路图像加 IMU、VIO 位姿、夹爪距离和音频都按 topic 组织。三处要盯。IMU 恰好 200Hz,卡在门槛线上,要确认能否上调。宣称毫米级轨迹重建,口径是 VIO 加 BEV 网络,目前没有第三方验证数据,要按绝对误差的口径重新问。音频单段限 15 秒,对长 episode 是硬约束。另外 6 路都是 30fps,对手部快速动作余量有限。它家的产品矩阵还有双指的 Fingers、五指的 Dex 手套和遥操终端,头手全套都有。
鹿明 FastUMI Ego 的亮点是 235g 的整机、60fps 鱼眼主摄加 500Hz 的 ICM-42688,硬门槛都达标,免建图即插即用,从第一帧开始定位。1mm 和 3mm 的定位精度是纯视觉口径,同样要问真值来源和统计量。它的 SLAM 相机只有 640×480@30,深度主力靠 320×240 的 ToF,近场精细几何要实测再说。配套的 FastUMI Pro 夹爪 600 多克、负载 2kg、四目视觉 180 度模组,采集频率 60Hz,视触觉和压敏阵列选配,和头显组成头加手的完整方案。
创维 XR 是今年新入场的一家,背后是十二年的 VR/XR 整机代工积累,产品思路和前面几家都不一样,走模组堆叠的反面,一体机。E2/E6/E8 三档梯度,E2 双路 1080p RGB、低于 140g,面向对轨迹精度要求宽松的科研验证;E6 是量产主力,高通 XR2 平台,4 颗灰度全局快门加 2 颗 RGB,整机 370g;E8 用 XR2 Gen2,4 灰度加 4 RGB 加 ToF,9 路画面同步,视场拓到 270 度,整机压在 300g。灰度加 RGB 混合布局有个工程逻辑,灰度全局快门数据量只有 RGB 的三分之一,用低算力做 SLAM 特征定位,RGB 管语义画面,两组视场互相重叠提供稳定约束。
创维的差异化在机内 SLAM 直出轨迹,视觉和 IMU 在设备端融合解算,宣称定位毫米级,客户拿到数据不用再做离线解算。配套的精度证据是 26 条轨迹的原子运动评测,纯旋转组位置平均误差 1.3mm,纯平移组 1.5mm,耦合组 2.3mm,全部 26 条按轨迹长度加权是位置 2.1mm、角度 1.06°,没有一条发散。腕部相机整机 100g,内置 IMU 加红外灯环,头显灰度相机识别灯环直接解算腕部 6DoF,头腕无线同步宣称 50 微秒,这个数字如果实测站得住,比蓝牙信标的 1 毫秒验收线好一个量级。灯环模组还能搭载到第三方夹爪和触觉手套上,统一时间基准。
两处要按惯例追问。 宣称的毫米级轨迹是机内 VIO 口径,评测集是原子运动轨迹,和真实任务场景的长距离复合运动还有距离,要按绝对误差口径重新问。IMU 的具体型号、采样率和标定参数导出能力没有公开,需要补。出货是实打实的,4 月开始交付,8 月超 1 万台,客户端带动的采集时长号称几十万小时量级,价格宣传为行业头部几家的一半。大规模交付本身说明量产和品控过了关,这正是 XR 制造底子的价值。
第八部分
需求按用途分四级
前面所有指标不是要一次买齐,按用途分四档,每一档对应明确的数据消费场景。
第一档,可用 Ego 数据。1080p、30fps、宽视场、IMU 大于 200Hz、原始时间戳、可导出标定、本地存储。够做 VLM 和 VLA 的视频预训练、任务理解。
第二档,机器人 Ego。1080p@60、全局快门、双目、100mm 上下基线、500Hz IMU、1ms 内同步、完整标定。够做 VIO、深度、手部追踪和机器人模仿学习。
第三档,灵巧操作 Ego。4 到 6 颗全局快门相机、60fps、100 到 120mm 基线、1 到 4ms 曝光、500 到 1000Hz 双 IMU、设备内同步 100 微秒以内、头腕同步 1ms 以内、腕部相机、21 点手部、接触帧 P90 不超过 10mm。做 manipulation 数据,目标应该定在这一档。
第四档,真值级 Ego。在第三档之上加光学动捕或激光追踪参照、外部时码、逐会话标定、温度模型、离线 BA、MANO 优化、物体位姿、触觉和接触声学。HOT3D 这类基准数据集走的就是这条路,手和物体用动捕系统取真值。这一档是做 benchmark 和高精度手物重建用的,量产采集不需要。
多数团队容易犯的错是按第一档的价钱期待第三档的数据。反过来,预算只够第一档时,也别把灵巧操作的指标硬塞进需求,买回来的设备撑不住验收,双方都难做。
第九部分
验收和产能
数据采回来只是半程,验收规则要写进合同。单条数据先过自动化质检,帧间隔的分布、多路流的重叠度、跨设备漂移、追踪有效时间的占比,都有明确阈值。流重叠度低于 80% 警告,低于 60% 判废;追踪有效占比低于 95% 警告,低于 80% 判废;全程漂移超过 5ms 判废。完整性也有硬规则,任一相机打开失败就拒绝开录,头显掉线等待 15 秒正常收尾,判定分四档,通过、带警告通过、失败、不完整。自动化查得出技术缺陷,查不出演示质量,操作员疲劳、动作犹豫这类问题要人来判断,所以批次验收保留不低于 5% 的人工抽检。
批次层面,平台先做全量自动验收,数据可解析零报错、必含数据流完整、标定文件无 NaN、MD5 一致、TF 树有效,过了再人工抽检。单房间要覆盖至少 10 到 15 条任务、5 种家装风格,任务域分布差异不超过 20%。防刷量也要写进规则,连续 3 条任务只换物体颜色就判违规。数据投毒的几种手法,标签翻转、后门触发、样本重复放大,在批次抽检里都要过一遍。
重采优于修补。 连续超过 5 秒的图像或位姿丢失、标注和视频对不上、数据造假,发现即整批拒收,48 小时内全量重采。修补出来的数据,时间戳和标注的可信度都降一级,比重采更贵。
最后一笔账和设备无关,却决定产能。单个操作员一个班次的有效采集时间是 5 到 5.5 小时,吃饭休息、倒数据、换电池都要扣时间。按 20 个环境各 500 小时算,大约要 95 个操作员日,这笔账应该在买设备之前算。环境多样性的预算、导出速度、换电会不会中断录制、备机数量,每一项都是日产能的变量。
最后
写在最后
评审里最有用的一条经验,放在结尾。厂商给的每个数字,都要追问统计口径。误差按绝对还是相对算,报的是均值还是分位数,真值从哪来。规格表回答不了这些问题,实测报告可以。追问口径不涉及信任,规格表没有撒谎,它只是用了另一种语言。