人类第一视角补全真机数据不足的测试方案

2026年07月22日 18:59
本文共计4151个字,预计阅读时长14分钟。
来源/具身研习社 责编/huazi56 爱力方

今年在WAIC的机器人展区走一圈之后,可以明显看到大家所谈论的问题终于从模型回到了机器人本身。

去年在讨论具身智能的时候,总是绕不开VLA、世界模型、端到端以及各种新架构。展台上的机器人哪怕只是拿起一个杯子,介绍也常常要从大模型驱动这一方式讲起。今年模型当然还在,只是没那么抢戏了。大家开始追问一些更具体、也更难绕开的问题:训练数据从哪来,机器人究竟该装什么样的手,演示做完以后,能不能真的进工厂、药房和商店。

如果要对今年的展区开展主线梳理的工作,可以把数据、灵巧手以及应用选用为三条主线。

语言模型得以快速发展的一个重要原因,是互联网上本来就拥有海量的文本。机器人并没有这样的现成家底。

网上当然有无数做饭、装配以及整理房间的视频,但机器人要学会干活,仅仅依赖画面信息是不够的。它还需要知道手如何运动、关节转动了多少、什么时候碰到物体、施加了多大的力,动作失败后如何进行调整。

过去几年,行业主要依赖于遥操作来采集这类数据。人控制机器人执行一遍任务,系统同步记录相机画面、机器人状态以及动作指令。它与真实机器人最为贴近,数据质量通常也更高,但问题在于速度较慢。

在采集一小时数据时,操作员以及机器人基本就需要结结实实地忙碌上一小时。设备故障、操作失误、场景重置以及无效片段还会继续消耗时间,最后真正能够拿来训练的部分,往往比录下来的少。

行业内部已经有人将预训练数据的目标设定到了千万小时级别。这个数量如果仅仅依赖一台台机器人借助遥操作的方式来进行采集,那么是很难积累出来的。因此,第一视角(Egocentric)数据成为了今年备受关注的一条路线。

思路其实很简单:先不急于让机器人进行操作,而是可以让人先来执行任务。

人们会在头部、胸前或手腕位置佩戴相机并照常完成装配、整理以及抓取的任务。系统会对第一视角画面与手部动作进行记录,再借助姿态估计和动作重定向的方法,将人类动作转换成机器人可以学习的信息。人们每天都会开展大量操作任务。相比专门搭建一条机器人采集产线,让人戴着设备开展工作,这种方式的成本可能会更低,而且能够覆盖的场景也会更多。

当目标一经明确之后,硬件设备很快就跟了上来。头戴相机、腕部相机、数据手套、便携式深度相机以及轻量动作捕捉设备,都在争相进入到数据采集流程之中。以前去机器人展会,大家盯着的是机器人本体;现在有些展台卖的,其实是怎么让人替机器人生产数据。

第一视角视频也没有将问题完全消除。视频虽然能够看见手拿起杯子的动作过程,却未必知道手指所施加的力究竟有多大。人手以及机械手的结构存在差异,因此人类的动作也不能原封不动地应用到机器人之上。

在实际操作中更为现实的做法大概在于选用混合运用的方式:其中人类视频承担预训练阶段的规模扩展工作,真机遥操作数据则承担后训练以及机器人对齐的工作。

模型应当如何开展训练工作仍然占据重要地位,但现在大家已经开始认真思考生产训练数据的那座工厂究竟应当如何建设。

灵巧手的竞争,正从自由度的提升转向可用性的实现。

今年,另一个很明显的热点集中于灵巧手这一方面。

在过去,机器人最常运用的末端执行器便是二指夹爪。它具有价格低廉、性能可靠以及控制简单的特点,因此适合抓取盒子、瓶子以及规则形状的零件。在传统工业自动化当中,如果夹爪的能力无法满足需求,人们还可以对环境开展调整工作:当零件不易抓取时便选用吸盘来处理,当姿态不够统一时则添加定位机构来实现对齐,当需要进行翻面时则专门设计一个翻转工位。只要产品以及流程能够长期保持不变,这套方法便会持续展现出实用价值。

工业现场也不会由于五指灵巧手看上去显得更新,就将已经稳定运行的夹爪予以拆除。

这种变化来源于任务需求。机器人若要进入药房、商超以及更柔性的产线时,就会面临尺寸不同、形状不同且摆放姿态也不统一的物体。夹爪虽然能够把物体夹持起来,却并不擅长在手中继续调整其方向。拧瓶盖、拔插头、运用工具、抽取薄片以及整理柔性包装,这些动作都需要借助更精细的手指来完成配合。

于是,灵巧手成了机器人开展泛化操作时所必须补齐的一项关键能力。

今年对灵巧手开展观察的过程中,一个非常显著的变化在于:虽然这类设备尚未实现大规模普及,但是厂商已经开始在性能以及成本方面进行竞争了。

过去展台只要能够让五根手指分别运动起来,就足以吸引不少人前来围观。现在这种情况已经不太够了。大家开始对重量、耐用性以及控制频率这些方面开展比较,同时还会考察触觉传感器究竟能够达到什么程度。自由度依然重要,但是它已经很难单独成为卖点了。

价格也被摆到了台面上。灵巧手原本更多用于科研和演示,采购方可以接受较高价格,也愿意投入时间进行调试。可一旦要进入工厂、药房或商超,成本账就得重新进行计算。一台机器人通常需要两只手,手的价格、维修频率以及更换成本都会直接影响整机能否部署。性能再强,如果一碰就坏、维修周期太长,或者价格接近机械臂本体,应用方就很难开展大批量采购。

这使得灵巧手行业形成了这样一种值得关注的状态:市场尚未真正得到铺开,但是竞争却已经提前进入了工程化阶段。厂商既要增加自由度、抓握力以及触觉,又要对重量、寿命以及价格进行控制。这些指标会彼此相互牵制,如果手指越复杂,那么零件就会越多,而成本和故障点通常也会随之增加。

因此在今年,灵巧手真正卷入竞争的方面,已经不再是能不能制造得出来,而是能否运用更低的价格来提供足够的性能以及寿命。

机器人落地,不再等“通用能力”成熟

第三个变化在于应用开始变得具体。工厂、药房、仓库以及商超,都在尝试让机器人接手其中一部分的任务。需要注意的是,这只是一部分。

这些地方比传统自动化更为复杂,但又没有家庭环境那么开放。药房的货架结构相对固定,可是药盒种类以及摆放位置却会出现变化;商超有明确的货架以及通道,商品会被顾客拿走,也可能会被随手放错;工厂里的工位比较规整,但是产品型号和来料姿态却越来越难以完全固定。

这类场景既需要机器人具备一定的泛化能力,同时也不会要求它从一开始就解决所有的问题。以目前的技术水平来看,这些场景反而构成了更为合适的起点。

现场方案并不都在运用VLA。有些系统继续选用传统视觉、运动规划、轨迹控制以及状态机。流程确定后,动作会一步步地执行,异常情况则交由提前写好的处理逻辑来进行处理。另一些方案会让VLA负责识别物体、理解任务或选择下一步动作。

一些厂商会将两套方法结合运用到一起。其中模型会对接下来应当抓取哪个药盒开展判断,运动规划会寻找一条不会碰撞货架的路径,而控制器则会把动作稳定地执行出来。它听上去没有纯端到端那么简洁利落,却更能够符合当前的工程条件。

机器人如果要进入现场,首先必须证明自己能够连续地开展工作。发布会上所选用的是否为最新架构,这一点反而没有那么要紧。

传统运动控制也没有因为VLA的出现就过时。模型越是靠近真实设备,就越需要运用底层控制来保证动作的稳定、响应的及时性,并在模型输出不靠谱时把设备兜住。

触觉感知能力,正在成为灵巧手实现实用化操作所面临的下一道关键门槛。

当灵巧手能够运动起来之后,很快便会面临下一个问题:机器人应当如何获知自己所触摸到的物体究竟是什么。

当前大多数机器人仍然在很大程度上依赖于视觉感知。摄像头虽然可以观察到物体的位置以及形状信息,却难以准确判断手指是否已经接触物体、物体是否开始发生滑动、所施加的抓握力是不是过大。在拿起一个硬纸盒的情况下,视觉信息也许足以满足需求;但是在抓取塑料杯、柔性包装或者插拔连接器时,接触状态将会直接决定任务是否能够完成。

触觉感知的重要性已经比较清楚,然而麻烦在于应当如何对所采集的数据开展运用工作。

把触觉传感器装进手指仅仅只是开始。接下来还需要对触觉与视觉的时间同步进行处理、对压力分布的表示、训练数据的采集,以及模型如何根据接触变化来调整动作。过去触觉更多是控制器里的反馈信号,以后它可能像图像一样,直接进入机器人模型的训练过程之中。

模型并不仅仅需要观察到自己已经抓取了杯子,而且还需要察觉到杯子正在发生滑动的情况,并及时对某根手指所施加的力量开展调整工作。这将会催生出新的采集设备,也会让灵巧手的竞争逐步从自由度方面转向感知以及控制。

在缺少触觉反馈的情况下,灵巧手额外增加的手指并不一定能够换取到同等程度的操作能力,而控制难度反而会率先上升。

端侧所具备的算力,正在逐步成为模型得以在实际场景中成功落地的主要屏障。

另一个绕不开的问题是端侧计算。

现在的机器人需要同时对多路相机、语音、状态估计、运动规划以及控制进行处理。换上灵巧手以后,动作维度和传感器数量还会继续增加。与此同时,VLA以及视觉模型本身的规模也不小。

在实验室里可以依赖服务器以及高端显卡来运行模型,真正装进机器人之后,就需要重新面对功耗、散热、重量以及电池续航这些问题。把全部计算放到云端同样难以实现。机器人在执行抓取操作时,网络若稍微出现抖动,动作就可能停住;工厂和药房的数据,也未必适合进行持续上传。

对于复杂的VLA而言,目前端侧所具备的算力仍然处于紧张的状态。

在未来的机器人系统中,并非一定会依赖于单一的大模型从始至终地进行全面控制。更有可能的方案是将任务进行分解:其中大模型负责以较低频率对任务开展理解,小模型则快速生成动作指令,而传统控制器承担更高频率的执行工作。至于哪些计算应当保留在端侧,哪些计算可以交付给服务器处理,这一点将会直接影响到机器人的整体成本以及运行可靠性。

这个问题并没有灵巧手那么显眼,却很可能是产品走向量产时所面临的最难的一步。

行业开始注重系统能力

对过去两年的变化进行回顾之后,可以发现具身智能正在从模型演示阶段转向构建一套更完整的机器人系统。

去年期间大家的注意力主要集中在了模型方面。哪家的架构实现了更新、数据量实现了增加、任务执行得更久,谁就更容易受到关注。今年问题被一层层地摊开:模型需要依赖于数据来开展训练,动作需要选用合适的手部结构,机器人则还需要找到愿意为之付费的具体场景。继续深入追问下去,又会碰到触觉感知、算力供应、控制方法以及可靠性保障这些问题。

算法所发挥的作用依然重要,只是机器人显然无法仅仅依赖于装入一个大模型就自动对所有短板进行补齐。

来源:WAIC 2026:机器人今年不只卷模型了 | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯