具身评测工程师,到底需要什么能力?
具身智能正从实验室走向真实工厂,机器人能不能真干活,全靠评测工程师把关。
拿汽车零件分拣来说,一开始模型在标准环境里抓取成功率超 90%。可一换到接近真实产线的场景,最差直接掉到 70% 多。我拆了几十个失败视频才发现,问题根本不在机械臂,而是小尺寸加高反光让视觉定位出了偏差。后来专门建了测试集补数据,这才把薄弱项提上来。
但评测绝不是看整体成功率涨没涨那么简单。要是普通零件变好,把高反光和安全场景的退化掩盖了,这新版本根本不能上线。面对每天几百个失败案例,也不能光看数量排优先级。一个一天出一百次但不碍事的毛病,绝对没有那种一天只出现五次、却可能撞人的风险来得要命。
更扎心的是,模型在一个测试集上刷到高分,换个工厂光照和相机角度立马掉点。这说明它只是学会了应试,根本没掌握泛化能力。
所以这活儿真正难的不是写脚本跑测试,而是得自己定义什么叫“好”。
原文具身评测工程师,到底需要什么能力?我用一场面试拆给你看