机器人为什么要拟人?人形不仅是外形,更是机器人的数据接口

2026年07月28日 18:00
本文共计1976个字,预计阅读时长7分钟。
来源/具身研习社 责编/LaosijiAming 老司机阿明

前几天读到Human-as-Humanoid这篇论文,我思考了很久。倒不是机器人倒水叠杯子有多稀奇。真正让我停下来的,是它重新回答了那个被说烂的问题:人形机器人为什么非得做人形。

行业里更常见、也更站得住脚的答案是:人类的楼梯、门把手、工具和工位,本来就是按照人的身体所设计的。机器人长得像人,那么进入这些环境的时候就会更加方便。

d7993da04d81d754bf0ff26055ddddb3.png

这套解释本身并无问题。只是它所回答的,仅是机器人在完成部署之后如何开展工作,却并未回答机器人在部署之前应当如何进行学习。

cfc86f7eea066343bc75a42dc3c5d71c.jpg

6月30日发布的Human-as-Humanoid论文尝试将同步拍摄的人类第一视角以及第三视角视频转换为PrimeU机器人可以执行的60自由度动作标签。其中自由度(Degrees of Freedom,DoF)指机器人能够独立控制的关节运动维度。换言之将人抬手、转腰、屈指这些动作翻译为60路关节命令。

Human-as-Humanoid 方法与任务总览

这件事情的难点从来不是看懂视频。让模型知道人在倒水,以及让机器人真的把杯子倾斜到合适角度,中间隔着一条挺阴险的沟:人的骨架不是机器人的骨架,人的手指也没有电机、限位和控制频率。

1da2f2a6304ddac9b90c4f80270fa25a.png

视觉理解不等于可执行动作。

所以问题变了。

“机器人怎样适应人的世界”这一问题仍然需要加以追问。Human-as-Humanoid进一步补充提出一个关键问题:“人的经验怎样以较少损耗的方式进入机器人的身体之中?”

真正要对齐的,是三层接口

Human-as-Humanoid并未借助某个神奇模型将问题予以简单掩盖。它实施了本体、感知以及动作标签这三层对齐。

先看本体。

86a8e343eba63609edf873563d3304ad.png

PrimeU 的拟人尺度与结构

不过这里也存在着一个小刺。ANSUR II所覆盖的6000多名美国军人,并不代表普通人群,更不代表全世界。它适合作为工程尺度基准,却并不是“标准人类”的答案。把一个统计中位数做成机器人,只说明转换更为顺利,并不说明包容性更好。

7babc9abd0e7ce8d2cca185c1e343270.png

感知层方面则更为有趣。操作者会佩戴第一视角相机,同时在外部放置第三视角RGB相机。其中第一视角会尽量与机器人在部署时所看到的画面进行匹配;而第三视角则负责在遮挡较少的位置对上肢以及手部关键点加以恢复。

这有点像医生看病:正面问诊可以获知你所看见的内容,影像检查则负责确认身体里面到底如何运动。只留一个视角,信息就会瘦得可怜。

动作层才是整个流程的压轴环节。系统借助分阶段逆运动学(Staged Inverse Kinematics,Staged IK)将人体骨架映射到机器人关节空间。所谓逆运动学,就是在已知手部目标位置的前提下,反推各个关节应当转动的角度。管线约以20 FPS进行处理,输出可直接用于训练的动作块,而不是停留在人体姿态标注之上。

18294c59c76256815b62b916ebcdf0d9.jpg

PhysDex 的动作转换与学习管线

论文报告,这套采集方式的原始演示吞吐量是动作捕捉遥操作的4.8到7.2倍。注意,是原始演示吞吐量,不是总成本降低7.2倍。视频清洗、动作恢复、训练和真机验证仍需花费资源。把前者偷换成后者,宣传稿味儿就上来了。

但它仍然具备相应价值。在此之前必须让一台昂贵机器人陪伴着人开展数据采集,而现在人类可以先行演示,机器人则在稍后阶段进行“补课”。设备不再被采集过程死死占用,数据生产才有可能从手工作坊式向流水线式挪移。

论文证明了什么,又没证明什么

最为关键的关注点并非演示视频本身,而是动作接口是否真正实现了有效咬合。

b9317edebb320438a66d1059e0767d74.png

差距并未彻底消失,却已不再分属两个彼此隔绝的世界。

PhysDex还加入了双空间分层运动学约束(DS-HKC)。模型仍输出能直接执行的关节动作,同时借助可微正向运动学对手腕姿态以及十个指尖的位置加以约束。通俗点说,不能只检查60个关节各自答没答对,还要检查它们合起来之后手到底伸到了哪里。

这个设计很工程。也很朴素。

462370ee0a167ad3b19083498d53b7d0.png

真机部分运用了1500小时的自采人类演示,并在七项双手任务上与GR00T N1.7开展了比较。PhysDex的“阶段—最终”复合分在七项任务中都更高,其中倒水、叠杯、套圈以及魔方包装等任务不使用目标任务的机器人示范。

看到此处很容易令人产生兴奋:人类视频是否终于能够将真机数据彻底予以淘汰?

别急。

说得更为直白一点:该论文证明了一条管线具备运行能力,并且运行过程具有希望;它尚未证明这条路线已经通吃所有机器人以及所有任务。借助七项初步实验来宣布路线终局,显得过于牵强。

人形的价值,是让数据飞轮少打滑

因此,“使用人类视频”这一做法已经不再属于独门秘籍。真正的分歧之处在于:人类经验是仅仅停留在视觉表征层面,还是会继续被转换成某一台机器人可直接执行的高自由度关节监督?

是它把身体放回了 AI 系统内部。

只是下一步还有个麻烦的问题:当大家都开始为数据设计身体,我们得到的会是更通用的机器人,还是一批被各自数据集塑形的专用人类?

 

来源:机器人为什么要拟人?人形不只是外形,更是机器人的数据接口 | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯