六位具身智能领域人士同台:机器人的ChatGPT时刻还有几年?

2026年07月22日 18:57
本文共计8449个字,预计阅读时长29分钟。
来源/OFweek机器人网 责编/ShuxiangMama 书香妈妈

在这次上海WAIC参会期间,参与了多项活动,其中印象最为深刻的便是“智启具身论坛2026——迎接物理AI智能涌现”。

这场论坛所具备的含金量,并不只限于智元、PI、Dyna、Sunday、腾讯以及高校研究者坐在同一张桌子上,更在于他们把数据从哪里来、模型往哪走、本体要不要自己做这些行业尚未回答的硬问题进行了讨论。

论坛最后,主持人提出了一个所有人都关心的问题:机器人的“ChatGPT时刻”,究竟会在什么时候到来。

智元合伙人以及觅蜂科技董事长兼CEO姚卯青表示,该时刻将在两年之后得以实现。

腾讯首席科学家兼腾讯Robotics X实验室主任张正友表示,该时刻将在三到五年之后得以实现。

Dyna Robotics联合创始人兼首席科学家马也骋表示,该时刻将在四年左右得以实现;

Physical Intelligence研究科学家任至意说,四到五年;

佐治亚理工学院徐丹飞教授所给出的答案是五年。

虽然几位嘉宾所在团队的技术路线以及产品落地方式并不相同,但他们所给出的时间判断却出奇地接近:两到五年。

其中,这一共识比想象中显得更为激进。不过,这些数字背后的口径却未必相同。

姚卯青所给出的定义相对明确:机器人能够实现开箱即用的功能,听懂开放式自然语言所发出的指令,并在常见任务的处理上达到70%—80%左右的基础成功率。

但其他嘉宾并没有逐一对自身所采用的标准进行明确定义。

因此,虽然大家在时间判断上看似形成了共识,但对于什么才算机器人的ChatGPT时刻这一定义,其实还没有形成共识。

在整场讨论当中,有三个问题最受关注:机器人的数据飞轮应当如何形成?“VLA已死”是不是一句伪命题?具身智能公司是不是正在走向软硬件全栈?

这三个问题,正好构成了理解当下机器人行业的三条主线:数据决定了机器人将如何实现进化,模型决定了智能将如何完成涌现,而软硬件路线则决定了谁能够把这些能力真正转变为产品和生意。

一、机器人的数据飞轮,其形成过程并非单纯依赖于采集来得以实现。

过去几年,大语言模型所取得的成功,为机器人行业提供了一个直接的想象空间:只要持续扩大数据、算力以及模型规模,机器人是否也会迎来一次能力涌现?

然而问题在于,大语言模型所需要的数据本来就存在于互联网上。机器人所需要的物理经验方面,却没有统一的数据来源可以依赖。

姚卯青在现场做了一个估算:头部语言模型的预训练已经达到100万亿Token量级。如果要让机器人真正实现开箱即用的功能,那么可能需要一亿小时级别的数据。

这一亿小时从哪里来?

真机数据虽然质量较高,但对其进行采集的成本却过于昂贵;仿真虽然容易实现规模的扩大,却始终存在虚实差距;互联网视频以及第一视角数据数量足够,却未必能够看清最关键的手部动作和力觉信息。

在讨论的过程当中,一个被反复提及的数据来源正是UMI。

你可以简单将其理解为一种低成本的人类操作数据采集方式:人们手持采集装置来完成任务,系统会对视觉信息以及动作轨迹进行记录,再把这些经验转化为机器人可以学习的数据。

赵子豪认为,短期来看,UMI可能是最高效的规模化数据采集来源。但他同时强调,长期真正重要的还是部署过程中所产生的数据。

把这两句话放在一起,便恰好勾勒出一条可能的数据路径:

UMI对机器人在还没有大规模上岗之前去哪里获得经验这一问题进行了解决;而部署数据则对机器人在上岗以后如何越干越好这一问题进行了解决。

任至意更为看重真机数据这一方面,同时主张借助多源数据以及跨本体训练的方式,来提高模型的泛化能力。

马也骋则对这些数据开展了总结工作,并将其归纳为一个数据金字塔。

底层是规模最大且成本最低的互联网视频以及人类第一视角数据,中间是真机多任务数据,塔尖则是数量最少但价值最高的部署数据,尤其是在机器人犯错、停顿、恢复并最终完成任务的过程数据方面。

它并非是在告知机器人理想情况下所应该采取的行动方式,而是在指导机器人学会真实世界未能按照预设剧本发展之时应当如何开展应对处理。

Dyna在酒店部署机器人完成折毛巾以及折餐巾等任务时,会把前几次部署的数据重新放回到预训练当中。随着数据积累,进入下一家酒店需要重新适配的时间就会缩短。

表面来看,嘉宾们均认同多种数据需要进行组合。

但当真正进入资源投入环节以后,各家公司所押注的重点并不相同:有人会优先扩大人类操作数据的规模,有人坚持采用真机数据,还有人则直接进入真实场景,借助部署来获取数据。

这里有一个典型的鸡生蛋问题。

由于没有足够好的模型,客户不敢让机器人上岗开展工作;而由于没有开展真实部署,机器人又拿不到最有价值的数据。

实质上,机器人的数据飞轮并非单纯依赖采集来得以形成,而是在真实场景之中借助实际作业的过程所积累而成的。

二、“VLA已死”,死的可能不是VLA

最近,具身智能行业当中所广泛流行的一句话正是“VLA已死,世界模型当立”。

但是在这场圆桌讨论的过程当中,这场争论被进一步集中到了VLA以及WAM(World Action Model,世界动作模型)这两条路线上。

VLA是一种借助视觉信息以及语言指令来生成动作的模型;而WAM则更加注重世界会如何发生变化,以及不同动作可能会带来什么结果。

Dyna确实从早期所采用的VLA路线,逐步把更多精力转向了WAM方面。马也骋提到,在一些强调鲁棒性、少量数据以及高成功率的任务里,WAM可能会比VLA实现更高的效率。

那么,VLA真的要被淘汰了吗?

任至意并不认同这一观点。他认为,截至目前为止,还没有看到哪家模型所做出的演示效果能够明显超过π0.7。π0.7是PI所推出的新一代通用机器人模型,同时也是PI对VLA路线所开展的一次重要升级。

更为关键的是,任至意认为VLA与WAM并不冲突。VLA本身也可以吸收世界建模以及未来预测方面的能力。

机器人最终既要对语言以及当前环境开展理解,同时也要对未来结果进行预测。PI所采用的做法,就是首先生成未来的子目标画面,之后再运用这个画面来引导底层模型执行动作。

智元也没有简单押注其中一条路线,而是在推动VLA与WAM融合的过程当中,探索世界建模、推理以及动作能力进一步结合的模型体系。

这场讨论的张力就在这里。

任至意运用π0.7所展现的性能来表明VLA仍然具备较强的竞争力,马也骋则借助真实任务中所实现的效率以及成功率来阐述WAM所具有的价值。

两个人并未直接对对方观点开展否定,但是他们所在公司的技术路线选择已经给出了不同答案。

张正友又把问题往前推了一步。

他认为,具身智能目前还远远没有形成类似于大语言模型所运用Transformer那样的统一架构。一个真正的机器人智能体,至少需要包含认知系统、感知行动系统以及底层反应系统这些关键组成部分。

上层所承担的是复杂推理以及任务规划方面的工作,中层则负责对感知信息与动作生成进行处理,底层则需要以极高频率对电机进行控制、对碰撞进行处理并且保持平衡。

你不可能让一个数千亿参数的云端大模型直接对每一个电机进行控制,因为这会带来计算开销以及实时性方面的挑战,也不能指望一个三四十亿参数的端侧模型对所有问题进行解决。

因此,“VLA已死”这一说法很可能从一开始便构成了一个伪命题。

在未来能够形成主流的系统,大概率并非纯粹的VLA,也并非单独的WAM,而是一套将语言理解、世界建模、未来预测、推理规划以及实时控制这些能力进行融合的系统。

VLA所代表的路线并没有死去。真正可能死掉的,是那种以为可以依赖于单一模型解决机器人所有问题的想象。

三、全栈能力将会发展成为趋势,但全栈生意却未必会实现。

第三个问题所关注的是,机器人公司究竟应当只对‘大脑’部分开展研发工作,还是应当把身体硬件也一同进行开发。

PI现阶段主要在通用基础模型方面开展研发工作,并未选择自行对本体进行研发以及销售。

任至意坦率地表示,如果没有开展自研硬件的工作,那么确实可能会导致部分任务无法得以完成。但PI目前更加注重模型的快速迭代方面,因此优先选用结构简单并且维护成本较低的机器人来搭建研发基础设施。

这是一条典型的大脑路线:首先把通用模型能力成功构建出来,把本体作为研发基础设施,而非将其作为现阶段的商业重点。

腾讯的选择也很明确。

张正友表示,腾讯只会开展大脑方面的研发工作,不会进行本体的销售。他甚至以开玩笑的方式指出,腾讯过去在硬件领域所进行的工作基本没有获得成功,因此需要保有自知之明。

但腾讯的Robotics X实验室从2018年成立以来,却一直保留着硬件研发工作。因为如果没有真正做过硬件,就很难理解触觉、力觉、关节控制以及端侧算力这些方面,究竟会给模型带来怎样的限制。

这是一条颇为微妙的边界:在商业模式方面可以不进行本体的销售,但在研发方面却不能不对本体开展理解工作。

智元走的是另一条路。

姚卯青认为,一旦机器人进入客户现场之后,其所面对的就不再是论文指标和Demo效果,而是可靠性、成本、成功率以及一致性这些方面。

这些问题没办法只靠模型解决。

端侧芯片所能够运行的模型规模有多大,电池能够工作多长时间,关节应当如何进行控制,整机是否可以稳定实现量产,这些因素都会反过来决定机器人的智能上限。

Sunday Robotics选择三指夹爪,也是同样的逻辑。

赵子豪认为,机器人的手需要在成本以及能力之间进行平衡。三指夹爪所追求的是运用20%的成本来获得80%的能力。

今天,通用机器人迟迟未能大规模进入家庭以及更多真实生产场景,未必是因为缺少了两根手指,更可能是因为其所具备的智能不够、成本太高以及稳定性不足这些方面所导致。

这正是全栈路线的价值所在:并非为了什么都做,而是在模型、算力、本体、控制、成本以及场景这些方面之间更好地开展取舍工作。

在此次上海WAIC参会过程当中,参与了多项活动,其中给人留下印象最为深刻的便是“智启具身论坛2026——迎接物理AI智能涌现”。

这场论坛所具备的含金量,并不只限于智元、PI、Dyna、Sunday、腾讯以及高校研究者坐在同一张桌子上,更在于他们对数据从哪里来、模型往哪走、本体要不要自己做这些行业尚未回答的硬问题开展了讨论。

论坛最后,主持人提出了一个所有人都关心的问题:机器人的“ChatGPT时刻”,究竟会在什么时候到来。

智元合伙人以及觅蜂科技董事长兼CEO姚卯青表示,该时刻将在两年之后得以实现。

腾讯首席科学家兼腾讯Robotics X实验室主任张正友表示,该时刻将在三到五年之后得以实现。

Dyna Robotics联合创始人兼首席科学家马也骋表示,该时刻将在四年左右得以实现。

佐治亚理工学院徐丹飞教授所给出的答案是五年。

虽然几位嘉宾所在团队的技术路线以及产品落地方式并不相同,但他们所给出的时间判断却出奇地接近:两到五年。

其中,这一共识比想象中显得更为激进。不过,这些数字背后的口径却未必相同。

姚卯青所给出的定义相对明确:机器人能够实现开箱即用的功能,听懂开放式自然语言所发出的指令,并在常见任务的处理上达到70%—80%左右的基础成功率。

但其他嘉宾并没有逐一对自身所采用的标准进行明确定义。

因此,虽然大家在时间判断上看似形成了共识,但对于什么才算机器人的ChatGPT时刻这一定义,其实还没有形成共识。

在整场讨论当中,有三个问题最受关注:机器人的数据飞轮应当如何形成?“VLA已死”是不是一句伪命题?具身智能公司是不是正在走向软硬件全栈?

这三个问题,正好构成了理解当下机器人行业的三条主线:数据决定了机器人将如何实现进化,模型决定了智能将如何完成涌现,而软硬件路线则决定了谁能够把这些能力真正转变为产品和生意。

一、机器人的数据飞轮,其形成过程并非单纯依赖于采集来得以实现。

过去几年,大语言模型所取得的成功,为机器人行业提供了一个直接的想象空间:只要持续扩大数据、算力以及模型规模,机器人是否也会迎来一次能力涌现?

然而问题在于,大语言模型所需要的数据本来就存在于互联网上。机器人所需要的物理经验方面,却没有统一的数据来源可以依赖。

姚卯青在现场做了一个估算:头部语言模型的预训练已经达到100万亿Token量级。如果要让机器人真正实现开箱即用的功能,那么可能需要一亿小时级别的数据。

真机数据虽然质量较高,但对其进行采集的成本却过于昂贵;仿真虽然容易实现规模的扩大,却始终存在虚实差距;互联网视频以及第一视角数据数量足够,却未必能够看清最关键的手部动作和力觉信息。

在讨论的过程当中,一个被反复提及的数据来源正是UMI。

你可以简单将其理解为一种低成本的人类操作数据采集方式:人们手持采集装置来完成任务,系统会对视觉信息以及动作轨迹进行记录,再把这些经验转化为机器人可以学习的数据。

赵子豪认为,短期来看,UMI可能是最高效的规模化数据采集来源。但他同时强调,长期真正重要的还是部署过程中所产生的数据。

把这两句话放在一起,便恰好勾勒出一条可能的数据路径:

UMI对机器人在还没有大规模上岗之前去哪里获得经验这一问题进行了解决;而部署数据则对机器人在上岗以后如何越干越好这一问题进行了解决。

任至意更为看重真机数据这一方面,同时主张借助多源数据以及跨本体训练的方式,来提高模型的泛化能力。

马也骋则对这些数据开展了总结工作,并将其归纳为一个数据金字塔。

底层是规模最大且成本最低的互联网视频以及人类第一视角数据,中间是真机多任务数据,塔尖则是数量最少但价值最高的部署数据,尤其是在机器人犯错、停顿、恢复并最终完成任务的过程数据方面。

它并非是在告知机器人理想情况下所应该采取的行动方式,而是在指导机器人学会真实世界未能按照预设剧本发展之时应当如何开展应对处理。

Dyna在酒店部署机器人完成折毛巾以及折餐巾等任务时,会把前几次部署的数据重新放回到预训练当中。随着数据积累,进入下一家酒店需要重新适配的时间就会缩短。

表面来看,嘉宾们均认同多种数据需要进行组合。

但当真正进入资源投入环节以后,各家公司所押注的重点并不相同:有人会优先扩大人类操作数据的规模,有人坚持采用真机数据,还有人则直接进入真实场景,借助部署来获取数据。

由于没有足够好的模型,客户不敢让机器人上岗开展工作;而由于没有开展真实部署,机器人又拿不到最有价值的数据。

实质上,机器人的数据飞轮并非单纯依赖于采集来得以形成,而是在真实场景之中借助实际作业的过程所积累而成的。

最近,具身智能行业当中所广泛流行的一句话正是“VLA已死,世界模型当立”。

但是在这场圆桌讨论的过程当中,这场争论被进一步集中到了VLA以及WAM(World Action Model,世界动作模型)这两条路线上。

VLA是一种借助视觉信息以及语言指令来生成动作的模型;而WAM则更加注重世界会如何发生变化,以及不同动作可能会带来什么结果。

Dyna确实从早期所采用的VLA路线,逐步把更多精力转向了WAM方面。马也骋提到,在一些强调鲁棒性、少量数据以及高成功率的任务里,WAM可能会比VLA实现更高的效率。

任至意并不认同这一观点。他认为,截至目前为止,还没有看到哪家模型所做出的演示效果能够明显超过π0.7。π0.7是PI所推出的新一代通用机器人模型,同时也是PI对VLA路线所开展的一次重要升级。

更为关键的是,任至意认为VLA与WAM并不冲突。VLA本身也可以吸收世界建模以及未来预测方面的能力。

机器人最终既要对语言以及当前环境开展理解,同时也要对未来结果进行预测。PI所采用的做法,就是首先生成未来的子目标画面,之后再运用这个画面来引导底层模型执行动作。

智元也没有简单押注其中一条路线,而是在推动VLA与WAM融合的过程当中,探索世界建模、推理以及动作能力进一步结合的模型体系。

任至意运用π0.7所展现的性能来表明VLA仍然具备较强的竞争力,马也骋则借助真实任务中所实现的效率以及成功率来阐述WAM所具有的价值。

两个人并未直接对对方观点开展否定,但是他们所在公司的技术路线选择已经给出了不同答案。

他认为,具身智能目前还远远没有形成类似于大语言模型所运用Transformer那样的统一架构。一个真正的机器人智能体,至少需要包含认知系统、感知行动系统以及底层反应系统这些关键组成部分。

上层所承担的是复杂推理以及任务规划方面的工作,中层则负责对感知信息与动作生成进行处理,底层则需要以极高频率对电机进行控制、对碰撞进行处理并且保持平衡。

你不可能让一个数千亿参数的云端大模型直接对每一个电机进行控制,因为这会带来计算开销以及实时性方面的挑战,也不能指望一个三四十亿参数的端侧模型对所有问题进行解决。

因此,“VLA已死”这一说法很可能从一开始便构成了一个伪命题。

在未来能够形成主流的系统,大概率并非纯粹的VLA,也并非单独的WAM,而是一套将语言理解、世界建模、未来预测、推理规划以及实时控制这些能力进行融合的系统。

VLA所代表的路线并没有死去。真正可能死掉的,是那种以为可以依赖于单一模型解决机器人所有问题的想象。

三、全栈能力将会发展成为趋势,但全栈生意却未必会实现。

第三个问题所关注的是,机器人公司究竟应当只对‘大脑’部分开展研发工作,还是应当把身体硬件也一同进行开发。

PI现阶段主要在通用基础模型方面开展研发工作,并未选择自行对本体进行研发以及销售。

任至意坦率地表示,如果没有开展自研硬件的工作,那么确实可能会导致部分任务无法得以完成。但PI目前更加注重模型的快速迭代方面,因此优先选用结构简单并且维护成本较低的机器人来搭建研发基础设施。

这是一条典型的大脑路线:首先把通用模型能力成功构建出来,把本体作为研发基础设施,而非将其作为现阶段的商业重点。

张正友表示,腾讯只会开展大脑方面的研发工作,不会进行本体的销售。他甚至以开玩笑的方式指出,腾讯过去在硬件领域所进行的工作基本没有获得成功,因此需要保有自知之明。

但腾讯的Robotics X实验室从2018年成立以来,却一直保留着硬件研发工作。因为如果没有真正做过硬件,就很难理解触觉、力觉、关节控制以及端侧算力这些方面,究竟会给模型带来怎样的限制。

这是一条颇为微妙的边界:在商业模式方面可以不进行本体的销售,但在研发方面却不能不对本体开展理解工作。

姚卯青认为,一旦机器人进入客户现场之后,其所面对的就不再是论文指标和Demo效果,而是可靠性、成本、成功率以及一致性这些方面。

端侧芯片所能够运行的模型规模有多大,电池能够工作多长时间,关节应当如何进行控制,整机是否可以稳定实现量产,这些因素都会反过来决定机器人的智能上限。

赵子豪认为,机器人的手需要在成本以及能力之间进行平衡。三指夹爪所追求的是运用20%的成本来获得80%的能力。

今天,通用机器人迟迟未能大规模进入家庭以及更多真实生产场景,未必是因为缺少了两根手指,更可能是因为其所具备的智能不够、成本太高以及稳定性不足这些方面所导致。

这正是全栈路线的价值所在:并非为了什么都做,而是在模型、算力、本体、控制、成本以及场景这些方面之间更好地开展取舍工作。

所形成的判断是:全栈能力将会发展成为趋势,但全栈商业模式却未必会发展成为唯一答案。

未来,机器人行业很可能会出现类似苹果的公司,它们会自主完成模型、本体、系统以及产品的全部工作;也会出现类似安卓和Windows的平台,只负责通用大脑的构建,并以此来适配不同的本体。

但在当前阶段,本体、传感器、灵巧手、芯片以及控制系统均尚未实现标准化。即使一家公司的最终目标只是出售“大脑”,它也很难完全绕开对身体的依赖。没有一家公司还能假装硬件并不存在。

四、两年还是五年,其实没那么重要

对这场论坛进行聆听之后,所形成的最大感受是机器人行业远远没有实现收敛。

哪种产品形态最适合家庭和工厂,并未形成答案;VLA、WAM、端到端模型以及分层系统,谁会成为主流架构,也并未形成答案。

数据配方仍在持续变化之中,商业模式同样呈现分散特点。有人负责销售整机,有人从事模型研发,有人构建数据平台;有人押注于工厂,也有人瞄准家庭领域。

表面上看,这被看作是一种混乱的状态。但是如果换一个角度来进行分析,那么这也可以被看作是一种机会。

在一个尚未实现收敛的行业里,大厂和创业公司、中国团队以及美国团队,都没有提前获取到标准答案。

因此,完成了对整场论坛的聆听之后,反而不会太在意答案究竟是两年还是五年。

机器人的“ChatGPT时刻”,不会仅仅依赖于某一次模型发布就得以宣布其到来。

它真正出现的标志,是数据、模型、本体与真实部署第一次形成了自我加速的机制:机器人部署的数量越多,所积累的数据规模就会越大,能力提升的速度越快,进入新场景的成本也就会越来越低。

在此之前,所有的项目时间表其实都只是人们所做出的预测,而各种技术路线也都仍然处在需要进行验证的状态之中。

六位具身智能领域专家借助同台形式开展讨论:机器人的ChatGPT时刻还需要几年才能得以实现?

来源:六位具身智能大佬同台:机器人的ChatGPT时刻,还有几年? | OFweek机器人网

声明:本文来自OFweek机器人网,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯