2026年具身智能的“黑话”WRAM、WBI、具身原生等术语是如何产生的

2026年07月27日 17:24
本文共计12566个字,预计阅读时长42分钟。
来源/具身研习社 责编/LehuoChufang 乐活厨房

作者:Jack 出品:机器人大讲堂

七个月前,在CES现场,专业编辑们追着问的还是:这台机器人用了什么模型?多少自由度?价格多少?

七个月后,当机器人大讲堂编辑部再次走进WAIC具身智能展馆,发现整个行业已经换了一套语言。

展台上,大家嘴里反复出现的,是另一批词:部署态、WRAM、VLA、WBI、全栈闭环....有些词我们甚至都觉得很陌生。

而且有意思的是,这些词半年前几乎没人提,到了今年,它们却迅速成为行业“黑话”。

如果说每一年机器人行业都会诞生一些新概念,那么2026年的特别之处在于,可能这些新词,不再只是学术以及营销概念,而是在描述机器人真正开始进入产业化的新阶段。它们共同记录着一个行业,从论文逐步走向技术栈,从Demo走向真实部署的全过程。

分四个板块梳理了2026年前8个月机器人行业最值得关注的22个关键词,希望通过这份"热词图鉴",帮助大家读懂这半年来的机器人与具身智能。

3c1c5067a825c308a0de959fa99a3b17.png

01.

机器人大脑篇:从VLA到WBI,到底升级了什么?

如果说今年行业哪一类热词更新最快,那么一定是“具身大脑”。仅仅半年时间,从VLA、WBI、WRAM,到世界模型,再到,几乎每隔几个月,行业都会诞生一个新的技术概念。对于很多不在一线接触具身智能的人来说,这些缩写越来越多,也越来越难懂。但实际上,机器人大讲堂认为,它们并不是彼此替代的关系,而是在不断回答同一个问题:机器人,究竟应该怎样思考?沿着这条问题,我们也可以读懂2026年机器人大脑的发展路线。

(1)为什么WAIC之后,大家都在讨论全身智能(WBI)?

今年WAIC结束后,一个此前并不算大众熟悉的概念迅速进入行业视野——WBI(Whole-Body Intelligence,全身智能)。相比VLA、世界模型这些已经讨论了一两年的技术路线,WBI更像是一次新的思考方式。它没有聚焦某一个模型,而是试图重新定义机器人的整个智能系统。

它到底是什么?按照【源策未来Archon Robotics】创始人李弘扬在RSS 2026 Early Career Talk提出的定义,WBI并非单独的推理决策或者执行大模型,而是一套系统级预训练范式。过去,人们往往把具身智能拆分级架构,但本质还是大脑负责理解任务,控制器负责运动,末端负责感知,最后再把这些能力拼接起来。而WBI希望做的,是从训练开始就把这些能力放到一起学习。

它将机器人智能划分为四层能力栈:S2任务语义理解;S1人形基础能力(身体先验);S0.5:意图到全身运动生成(UTC);S0:实时平衡、接触与控制。

换句话说,在这套框架下,机器人学习的不只是"怎么抓住杯子",而是同时理解为什么抓、怎样抓、抓住以后身体如何配合。过去几年,机器人行业最大的争议之一,就是"脑子越来越聪明,身体却跟不上"。大模型会思考,却不会控制身体;运动控制越来越成熟,却缺少高级认知。WBI希望解决的,正是这种"脑身分离"的问题,把认知、身体和环境真正统一起来。

但与其说是新技术路线,不如说WBI真正提出的,是一种新的目标,也就是未来机器人应该先拥有一个聪明的身体,才能更好落地。

(2)世界推理动作模型(WRAM):机器人不仅要理解世界,还要推演世界

如果说WBI讨论的是机器人最终应该长成什么样,那么智元机器人CTO姚卯青在WAIC 2026智启具身论坛所提出的WRAM回答的,则是机器人今天应该如何思考。今年WAIC期间,智元提出的WRAM(World Reasoning Action Model,世界推理动作模型)这一概念热度非常高,迅速成为论坛和媒体讨论的焦点。

它到底是什么?简单来说,WRAM是在VLA与世界模型基础上的融合架构。

其中,VLA负责理解语言、视觉和任务语义;世界模型(WAM)负责预测物理世界未来的状态;WRAM则试图把理解与推理统一起来,让机器人能够边理解任务、边预测结果,再完成动作执行。

如果打一个比方,VLA像一位会看地图行动的老司机;世界模型像一位能够提前预判路况的老司机;而WRAM,则希望让机器人成为既会看导航,又会根据实时路况灵活调整路线的驾驶者。

相比提出一个新的缩写,WRAM更大的意义在于,它回应了今年行业争论最激烈的话题——VLA会不会被世界模型取代?智元给出的答案是融合。其认为,机器人真正需要的,不只是那条技术路线,而是如何更好理解世界、预测世界,这就需要把两种能力统一起来。

WRAM最大的意义,不在于发明了一种新架构,而是在告诉行业:未来机器人的竞争,不再是谁理解得更多,而是谁能够预测得更远。

(3)世界模型(WAM):机器人开始拥有“预判能力”

如果说WBI代表着机器人大脑未来的发展方向,那么世界模型(World Model,或World Action Model)则是今年推动整个行业快速升级的核心技术之一。

事实上,今年上半年,世界模型几乎成为所有机器人大会绕不开的话题。从ICRA到WAIC,从智元的Genie Envisioner-Sim 2.0,到它石智航将整条线束装配场景搬进展台,再到苏度展示基于纯仿真的零样本抓取能力,越来越多企业开始把世界模型视为下一阶段具身智能的重要底座。

它到底是什么?简单来说,世界模型就是让机器人在真正行动之前,先在"脑海里"完成一次推演。过去,大多数机器人看到一个杯子,只知道"抓住它"。但世界模型会进一步思考,如果从这个角度抓,会不会碰倒旁边的瓶子?杯子会不会滑落?抓起来以后,该往哪里放?这个过程,本质上是在模拟现实世界未来可能发生的一系列物理变化,包括重力、摩擦、碰撞、形变以及物体之间的相互作用。

如果用一个生活化的比喻,VLA像是在回答一道选择题,而世界模型更像是在做一道推演题。它不只是告诉机器人“应该怎么做”,更重要的是提前预测“做完之后会发生什么”。

WAM概念爆火的原因很简单。过去几年,大模型已经让机器人拥有了一定的理解能力,但机器人真正走进工厂后,一个新的问题暴露出来,那就是理解,不等于会干活。因为现实世界远比互联网上的一张图片复杂。工件可能发生偏移,桌面可能突然多出一个障碍物,零件可能因为摩擦产生细微变化……

这些都需要机器人实时预测,而不是照着固定动作执行。因此,今年世界模型的快速升温,也意味着机器人行业开始从语言智能迈向物理智能,世界模型真正模拟的不是画面,而是现实,只是对于仿真器和芯片的要求会越来越高。

(4)VLA:机器人大脑的“主流方案”

如果沿着时间继续往前追溯,那么今天几乎所有机器人大脑,都绕不开一个名字——VLA(Vision-Language-Action,视觉—语言—动作模型)。过去一年,它几乎成为具身智能最主流的技术路,到现如今谈论落地,VLA依然是许多企业坚持的核心方向。

VLA可以理解为一种把视觉、语言和动作统一到一个模型里的多模态架构。机器人首先通过摄像头"看见"环境,再理解人类语言指令,最后生成对应的动作。

例如把桌上的红色杯子放进纸箱这类任务,其实机器人需要同时完成识别什么是杯子;理解“红色”对应哪个目标;判断纸箱的位置;规划抓取动作;最终完成放置,这一系列步骤。过去,这些能力往往由多个独立模块完成。而VLA第一次把它们统一到同一个模型里,也因此成为具身智能发展的重要里程碑。

今年以来,随着机器人进入越来越复杂的真实场景,VLA也逐渐暴露出自己的局限。因为它更擅长理解并实现具体任务,却缺少对真实物理世界的长期推演能力,在开放式环境中的表现略显局限。

于是,今年行业开始围绕世界模型展开新的探索。但值得注意的是,到了WAIC,这场关于谁取代谁的讨论已经发生了变化。

曾经Jim Fan 4月GTC抛出,业内迅速流传的那句:VLA已死,WAM当立,再WAIC 2026逐渐由共识反转成融合共生:VLA负责理解世界,世界模型负责预测世界,两者并不是竞争关系,而是互补关系。这也使得VLA没有过时,它只是开始承担自己更擅长的工作,理解、以及更好的执行,而不是预测未来。

(5)第四代、第五代多模态大模型:机器人大脑的下一站

极智嘉具身智能首席科学家赵昊WAIC 2026提到了第五代多模态大模型的新概念,其认为如果说WRAM回答的是“今天的机器人大脑应该怎样构建”,那么第四代、第五代多模态大模型讨论的,则是“未来机器人应该怎样学习”。

WAIC期间,赵昊提出了机器人多模态基础模型的代际演进观点。在他看来,VLA即第二代多模态大模型,通过对图像与语言联合训练的多模态模型进行动作微调。所谓World Action Model则属第三代多模态大模型,典型如视频生成模型;今年CVPR两篇Best Paper中,一篇指向第四代多模态大模型,是混合训练了视频Token、文本Token与图片Token;另一篇来自DeepMind的D4RT,实现了4D Token,预示第五代多模态大模型将会是4D Token、3D Token、视频、文本与图片Token的混合训练。届时在第五代多模态大模型的基础上,以动作数据进行微调,有望迎来具身智能的“GPT时刻”。但目前业界仍主要处于数据积累阶段。

这一判断反映出行业对于机器人大脑底层训练范式的新探索:动作数据微调只是最后一环,底座是多模态Token的混合训练,未来机器人的学习对象,不再只是图像和语言,而是真实世界本身。

(6)大小脑协同(快慢思考双系统):让机器人既能思考,也能快速行动

当机器人大脑越来越聪明,一个新的工程问题也随之出现:大模型思考得够快吗?现实中,机器人控制关节、电机和力反馈,往往需要毫秒级响应;而大模型完成一次复杂推理,却可能需要数百毫秒。

因此,越来越多企业开始采用大小脑协同架构,也被称为快慢思考双系统。其中,大脑(云端/边缘)负责世界模型/VLA、任务理解、长时序规划;小脑(机载本地)负责运动控制、柔顺力控、全身平衡、紧急安全制动。解决大模型百毫秒级推理与伺服实时控制的时序不匹配问题。两套系统分工协作,让机器人既能够完成复杂决策,又能够满足实时控制需求。这一架构与人类神经系统颇为相似,人脑负责思考目标,小脑负责协调动作,两者共同完成一次完整行为。这也意味着未来机器人比拼的不再是谁拥有更大的模型,而是谁能够让会思考的大脑与会行动的小脑真正协同工作。

b657d741f1ad11f5e4eb44510bbd737a.png

02.

系统架构篇:机器人正在建立自己的操作系统

如果说机器人大脑篇讨论的是机器人如何思考,那么系统架构篇关注的,则是另一个更现实的问题:机器人如何把智能真正变成生产力,真正走向落地?

过去几年,机器人行业更多关注单点能力,例如更灵活的机械臂、更精密的控制器、更大的模型、更高的算力。但随着具身智能进入深水区,一个新的共识正在形成,那就是未来机器人竞争,靠某一个模型完全靠不住,其属于完整的系统架构。从Physical AI到具身原生,从Agent+Skill到全栈闭环,2026年以来,一系列新概念正在重新定义机器人的技术底座。

(1)Physical AI(物理AI):AI开始走出屏幕

由英伟达CEO黄仁勋GTC提出后多次强调,并成为2026年具身智能领域的重要产业叙事。大意是指AI走出屏幕,住进物理身体里。这是所有新词的母容器。WAIC官方口径也把机器人改叫物理智能伙伴,意指可自主协作、可长期迭代、可替代重复劳动。

不少业内人士认为,如果说过去十年的AI,主要发生在数字世界,那么Physical AI代表的下一阶段是让AI进入物理世界。简单理解,就是让人工智能具备理解、交互和改变现实世界的能力。

因为传统AI主要处理文字、图片、代码、数据等,而Physical AI面对的是空间、物体、运动、力、环境变化。也就是说,它不再只是回答问题,而需要完成真实任务。比如:机器人如何拿起一个杯子?如何避开障碍物?如何理解一个工厂环境?如何长期完成重复工作?这些问题,都属于Physical AI需要解决的范畴。

Physical AI火爆不仅仅得益于大佬带货,另一部分原因在于大模型的发展,让AI拥有了强大的认知能力;机器人硬件的发展,让AI拥有了进入现实世界的具身智能载体。两者结合,形成了新的技术方向。

在不少人看来,如果说ChatGPT改变的是人与信息交互的方式,那么Physical AI改变的,将是人与物理世界交互的方式,也会带来一个更加宏大的未来。

(2)具身原生(Embodied-Native):机器人不能只是“大模型外挂身体”

具身原生(Embodied-Native)由蚂蚁灵波团队提出,并引发行业对于机器人基础模型路线的讨论;同时Generalist CEO Pete Florence在《Going Beyond World Models&VLAs》演讲也提出“超越世界模型和VLA”的观点。

过去,很多人设想先训练一个强大的语言模型,然后让机器人接入这个模型,机器人就会拥有智能。但具身原生提出了不同观点,其认为机器人智能不应该建立在数字世界模型之上,而应该从物理世界重新训练。反对在LLM上微调当机器人脑,主张为物理世界从零训练原生模型。

原因在于互联网AI学习的是文本、图片和视频,但机器人面对的是重量、摩擦、碰撞、空间关系、身体限制等。两者的数据分布天然不同。

蚂蚁灵波沈宇军举了一个"开门见猫"的例子——不透明玻璃门后有只猫,数字世界视觉模型能"看见"猫,但机器人物理上够不到,因为数字模型的设计目标(画质/创造性)和物理世界(快/合理)天然不一致。但机器人真正面对的问题是:门能不能打开?距离是多少?机械臂够不够得到?抓取角度是否合适?这就是数字智能和物理智能之间的鸿沟。

具身原生实际上提出了一个更底层的问题:机器人是不是应该拥有自己的“大模型”,而不是成为互联网大模型的一个应用场景。这也意味着ChatGPT学习的肯呢个是人类留下的文字世界,而机器人需要学习的是物理世界本身。

(3)Agent+Skill:未来几年机器人落地的现实路径

WAIC 2026期间,苏度、蚂蚁灵波、原力灵机等企业均展示原子能力的类似思路。如果端到端大模型代表机器人未来的终极形态,那么Agent+Skill更像是当前产业落地阶段的工程方案。

简单来说,当面对复杂任务时,上层Agent负责拆解任务,并调用不同Skill完成执行,Agent负责“大脑”,Skill负责“技能”。通过把抓/插/擦每个动作训成泛化policy,机器人不需要每一次任务都从零思考,而是将抓取、插拔、擦拭、搬运等动作训练成可复用的原子能力。Agent+Skill通过模块化方式,让机器人更容易适配场景。

因为机器人最大的挑战不是完成一次动作,而是在不同场景中稳定完成任务,例如用户要求整理桌面,机器人不会直接生成一个复杂动作。而是拆解识别物品、抓取、分类、移动、摆放。因此每一个步骤调用对应Skill就能更高效、精准完成。这种路线也被评价为端到端是诗和远方,Agent+Skill是未来2-3年落地最优解,未来上层Agent调度与WRAM/WBI有望形成"短期vs长期"双轨。

(4)UTC(Unified Trajectory Control):连接“大脑”和“身体”的关键层

UTC(统一轨迹控制)来源于近年来机器人运动生成相关研究,并成为WBI体系中的关键组成部分。SONIC、BFM等工作在2025年提出,主要负责把意图转化为可行的全身运动(运动生成+BFM身体先验)衔接"大脑WRAM"与"小脑WBC"的中间层,是WBI概念里最工程化的一环。

机器人一直存在一个脱节的问题,大模型知道“应该做什么”。控制系统知道“关节如何运动”。但两者之间缺少一个中间层。UTC解决的就是如何把高层意图转换为可执行的全身运动轨迹。例如:大脑输出指令:拿起桌上的水杯。UTC规划手臂、身体、关节如何协调运动。小脑控制电机完成动作。

未来机器人不会只是机械执行固定动作,而需要面对复杂环境。因此,需要一个能够连接任务理解、动作规划、身体运动、实时控制的中间层。UTC就是这一层。如果说大模型负责告诉机器人“去哪里”,那么UTC负责告诉机器人“怎么走过去”。

(5)全栈闭环:机器人竞争,从单点技术进入系统战争

随着具身智能进入产业化阶段,ICRA 2026、WAIC 2026期间,行业逐渐形成一个新的共识:未来没有任何一家企业能够只靠单一能力赢得竞争。所谓“全栈闭环”,简单来说,就是覆盖机器人从研发到落地的完整链路:数据采集→仿真训练→模型训练→真机部署→效果评测→数据回流→再训练优化。

过去机器人产业链更像是一条线,硬件厂商负责机器人本体;软件公司负责算法;应用企业负责场景。不同环节之间相对割裂。但具身智能时代,机器人需要持续学习。一次部署不是终点,而是下一轮训练的开始。因此,企业必须建立完整闭环。机器人在真实场景执行任务;产生新的动作数据;模型根据数据优化;机器人能力再次提升。这也是为什么今年行业越来越重视数据平台、仿真平台、真机训练、部署场景。

因为具身智能最大的挑战,不是让机器人完成一次动作。而是如何让机器人持续进化。大模型时代,互联网企业依靠海量文本和图片数据形成能力跃迁。而机器人时代,数据来源于真实世界。每一次抓取失败。每一次动作偏差。每一次环境变化。都是机器人学习的重要素材。因此,全栈闭环正在成为机器人企业的新竞争壁垒。这也使得现在竞争开始转向:谁拥有更多真实场景?谁能够获得更多高质量数据?谁能够建立更快的数据反馈循环?未来机器人公司的核心资产,可能不是某一台机器人,而是一套能够让机器人不断进化的闭环系统。

(6)涌现时刻/GPT时刻:机器人什么时候迎来自己的ChatGPT?

2026年,关于具身智能是否会迎来类似ChatGPT的“GPT时刻”,成为行业最具争议的话题之一。一方面,智元机器人等企业认为,随着数据规模提升和模型能力增强,具身智能可能在2027年底至2028年前后出现能力涌现;另一方面,也有业内人士认为,机器人并不存在类似ChatGPT那样明确的单一时间节点。

业内认为,所谓“GPT时刻”,来源于生成式AI的发展经验。2022年ChatGPT发布后,人们第一次直观看到大模型能力并不是线性增长。当参数、数据和训练方式达到一定规模后,模型突然展现出此前没有的新能力。这种现象,被称为“涌现”。于是,机器人行业也开始讨论,机器人是否会出现自己的GPT时刻?是否存在某一天,机器人突然拥有接近人类水平的通用能力?

但机器人和ChatGPT有一个根本区别:ChatGPT面对的是数字世界,机器人面对的是物理世界。语言模型可以通过互联网文本快速学习;机器人却需要面对是真实环境变化、复杂物理规律、身体限制、长程以及长期任务执行等。

因此,机器人领域对于“GPT时刻”的看法更加谨慎。有人认为随着百万小时级机器人数据积累,能力跃迁可能出现。也有人认为机器人智能不会像聊天机器人一样突然爆发,而会随着不同场景逐渐解锁。它实际上代表了行业对于终局的想象买那就是机器人最终会不会成为一种通用智能?还是会长期停留在特定任务自动化?这不仅是技术问题,也是产业可能性的大问题,决定了机器参与现实世界的方式。

597de5bd80f69fdf98c772b2822ad0c4.png

03.

产业落地篇:机器人开始从“会展示”走向“能工作”

随着具身智能进入2026年,行业在政策和资本的推动下,关注开始逐渐转向,机器人,什么时候才能真正进入生产环境,像一个员工一样持续工作?这也是为什么今年以来,“部署态”“作业模式”“实景实训”“落地深水区”等一批产业关键词开始密集出现。这些词背后,实际上对应着具身智能产业逻辑正在从技术展示阶段,进入产业验证阶段。如果说过去几年行业竞争的核心是“谁能造出机器人”,那么接下来竞争的核心将变成“谁能让机器人真正创造价值”,并且越来越有价值。

(1)部署态元年:机器人产业从研发阶段进入运营阶段

2026年4月,在智元合作伙伴大会上,智元机器人董事长邓泰华提出,将2026年定义为“部署态元年”。随后,在7月智元与爱仕达举行技术合作相关活动期间,“部署态”再次成为行业讨论的重要关键词。所谓“部署态”,并不是简单指机器人完成交付,而是代表机器人从研发验证阶段进入长期运行阶段。

过去,机器人产业更多关注的是“开发态”。企业需要证明机器人是否具备某项能力:能不能行走?能不能抓取?能不能完成动作?能不能在实验环境中运行?但进入部署态之后,评价标准发生了变化。因为企业真正关心的问题变成:机器人能否每天稳定运行?能否适应生产环境变化?能否持续完成任务?能否形成经济价值?

这意味着机器人产业的竞争逻辑开始发生转移。过去,机器人更像是一件产品;而未来,机器人更像是一套持续运营的生产系统。这一变化也解释了为什么越来越多企业开始从单纯制造机器人本体,转向构建包括模型、数据、场景和服务在内的完整解决方案。

因为真正进入产业之后,机器人面对的并不是一次展示,而是数千小时、数万次甚至更长周期的持续工作。“部署态”的出现,本质上意味着机器人第一次开始接受工业世界的考核。

(2)作业模式:机器人产业真正的“上岗标准”

如果说“部署态”更多来自企业视角,那么“作业模式”则代表了政策层面对机器人产业下一阶段发展的判断。2026年6月,工信部、国资委联合发布《2026年度人形机器人与具身智能实景实训专项行动》,其中提出推动人形机器人和具身智能进入“作业模式”。

因为在过去的机器人行业里,常见的表达通常是:演示、测试、验证、交付。但“作业模式”换了一种语言。它强调的不是机器人有没有完成一次动作,而是机器人能不能像真实生产人员一样,持续承担工作任务。

比如,在制造业场景中,机器人需要每天完成装配、检测、搬运等工作;在物流场景中,需要长期处理复杂订单和环境变化;在服务场景中,则需要面对不断变化的人机交互需求。

这背后反映的是行业认知的一次变化:机器人真正的价值,不在于完成一次惊艳的Demo,而在于完成10000次稳定运行。因此,“作业模式”的提出,也意味着机器人产业开始从“展示能力”进入“验证可靠性”的阶段。

(3)机器人学校:机器人真正的数据来源正在走向现实世界

机器人为什么难?过去很多人认为,机器人最大的挑战是硬件。但随着大模型进入机器人领域,行业逐渐发现,真正限制机器人发展的,可能不是单纯的硬件能力,而是缺少足够真实、高质量的数据。

这也是能提供“实景实训”的“机器人学校”成为今年重要关键词的原因。按照相关政策规划,实景实训空间将成为推动具身智能发展的重要基础设施,通过真实环境训练机器人,形成“实景训练—数据积累—模型优化—能力提升”的闭环。

与传统实验室研发不同,实景实训强调机器人进入真实生产环境。因为现实世界存在大量实验室无法模拟的不确定因素。例如零件位置变化;材料差异;环境干扰;动作失败。这些数据,对于机器人提升泛化能力至关重要。

某种意义上,未来机器人企业之间的竞争,可能不只是模型参数竞争,而是现实世界数据竞争。谁拥有更多真实场景,谁能够获得更多失败经验,谁就更有可能训练出更强大的机器人。

这也是为什么今年越来越多企业开始布局:机器人训练场、数据平台、真实产线、仿真系统。因为对于具身智能而言,工厂不只是应用场景,更是机器人持续学习的“学校”。

(4)落地深水区:机器人真正的挑战才刚刚开始

不过,当机器人真正进入产业之后,一个更深层的问题也逐渐暴露出来。机器人并不是不会动,而是距离真正完成复杂任务还有很长距离。行业将这一阶段称为“落地深水区”。

过去,人们经常用“手脑鸿沟”描述机器人当前面临的问题。机器人的“身体”已经越来越强:能够行走。能够移动。能够完成简单抓取。但它的“大脑”和“手”之间仍然存在距离。例如,一个机器人可以拿起一个固定位置的盒子,但如果任务变成从杂乱环境中找到目标物品、判断不同材质,被干扰、打断,或者连续完成多个步骤,难度会快速增加。

这也是为什么今年行业同时关注世界模型、触觉、灵巧手和数据闭环。因为机器人真正进入现实世界后,面对的不是一个标准化程序,而是一个不断变化的环境,这也是深水区的持续性难题。

 

04.

数据与触觉篇:机器人最后的竞争,开始从模型转向数据

过去几年,人工智能行业有一个非常明确的共识:模型越大,能力越强。互联网大模型时代,企业竞争围绕参数规模、算力投入和训练数据展开。谁拥有更多数据,谁就更有机会训练出更强大的模型。

但进入具身智能时代,行业开始发现,机器人面对的问题比数字世界复杂得多。因为机器人学习的对象,不再只是文字和图片,而是整个物理世界。它需要知道一个杯子的重量是多少、不同材质的表面摩擦力有什么区别、抓取时应该使用多大力度;物体受到外力后会如何变化。

这些信息,并不是互联网数据能够直接提供的。因此,2026年前8个月,机器人行业出现了一组非常重要的新关键词:数据规模化元年、触觉元年、灵巧手产业化突破、最后一厘米。它们共同指向一个变化:机器人竞争的核心,正在从“谁的模型更大”,转向“谁拥有更多真实世界经验”。

(1)数据规模化元年:机器人开始进入“数据战争”

2026年WAIC期间,光轮智能CEO杨海波提出“2026年是具身智能数据规模化元年”。与此同时,行业内越来越多企业开始将数据能力视为具身智能发展的核心基础设施。

如果说过去几年机器人行业最关注的是:模型、算法、硬件。那么今年,一个新的关键词开始进入产业中心:数据。原因很简单。机器人不同于传统AI。对于语言模型而言,互联网已经提供了海量文本;对于视觉模型而言,公开图像数据已经非常丰富。但机器人需要的数据,是另一种完全不同的数据:机械臂如何调整姿态?手指接触物体时产生怎样的反馈?机器人失败时应该如何恢复?这些数据只能来自真实交互。因此,具身智能的发展天然面临一个数据瓶颈。

今年行业出现一个明显趋势:机器人数据规模正在快速扩大。过去,很多机器人训练可能只依赖几十小时、几百小时数据;而现在,行业开始向百万小时级甚至更大规模迈进。例如,戴盟机器人发布Daimon-Infinity数据集,计划持续扩大具身数据规模;与此同时,光轮智能凭借具身数据基础设施能力获得市场关注,进一步说明数据正在成为机器人产业新的竞争资源。

但机器人数据和互联网数据最大的不同在于:它不是简单复制。而是不断试错。一个机器人完成一次成功抓取,价值有限。但一次失败:为什么没抓住?为什么滑落?为什么碰撞?为什么动作规划错误?这些失败经验,这些坏数据,反而是模型能力提升的重要来源。因此,未来机器人企业的核心资产,可能不只是机器人数量,而是机器人持续产生数据的能力。AI时代的数据是燃料,而具身智能时代的数据更像是经验。

(2)数据金字塔:机器人不会只靠一种数据学习

随着数据重要性提升,另一个概念也开始受到关注:数据金字塔。这个概念最早由Agility Robotics CTO Pras Velagapudi在GTC相关分享中提出,强调机器人训练需要不同层级、不同来源的数据共同支撑。

简单来说,机器人训练数据并不是单一来源,而是一座金字塔。底层是互联网视频、人类行为数据。中层是仿真环境生成的数据。顶部是真实机器人采集的遥操作数据。三类数据各有价值。互联网数据规模最大,可以帮助机器人理解人类行为;仿真数据成本较低,可以快速生成大量训练样本;真实机器人数据最接近实际应用,可以解决最后的适配问题。

这也意味着,未来机器人训练不会简单复制ChatGPT模式。机器人不可能只靠读取互联网知识获得能力。因为现实世界中的很多关键经验:例如如何控制力度、如何恢复失败、如何适应不同环境,都必须通过真实交互获得。因此,行业开始强调:异构预训练。也就是让机器人同时学习:人类经验、仿真经验、机器人自身经验。

不过,在数据规模扩大的同时,行业也出现了一种冷静声音。ICRA 2026期间,Ken Goldberg提出,机器人领域的数据积累与大模型时代仍存在巨大差距,机器人真正拥有类似互联网AI的数据规模,还需要长期积累。这意味着数据规模化元年,并不意味着机器人数据问题已经解决。恰恰相反,它意味着行业刚刚开始进入数据竞争阶段。

(3)触觉元年:机器人开始拥有“触感”

如果说数据解决的是机器人如何学习,那么触觉解决的是机器人如何感知。2026年,行业越来越多声音认为:机器人正在进入触觉元年。过去,机器人感知主要依赖视觉。摄像头告诉机器人:物体在哪里、是什么颜色、是什么形状、但视觉存在天然限制。机器人可以看到一个苹果,却不知道、它有多硬、表面是否光滑、抓取力度是否合适。

而人类之所以能够完成复杂操作,很大程度依赖触觉、我们拿起玻璃杯时,会自然调整力度,握住纸张时,会减少力量;触碰不同材质时,会立即调整动作。这些能力,是视觉无法替代的。因此,触觉正在从过去的“辅助传感器”,逐渐成为机器人智能的重要组成部分。

今年行业普遍认为未来真正具备泛化能力的机器人,必须同时拥有视觉、语言、触觉、动作,最终形成完整感知闭环。这也是为什么越来越多企业开始布局触觉传感器、触觉芯片和触觉数据。例如,华威科、他山等一些企业正在推动触觉数据集建设,因为视觉让机器人知道世界是什么样,触觉让机器人知道世界是什么感觉。

440e9467e9ade1af26982e564c14b667.png

05.

结语:机器人行业,正在重新定义自己的语言

回看2026年前8个月机器人行业出现的这些新词,会发现一个有意思的现象:它们并不是简单的概念更新,而是在记录一个产业正在发生的结构性变化。

从WBI、WRAM,到Physical AI、具身原生;从部署态、作业模式,到数据规模化元年、触觉元年,这些过去并不常见的词,如今正在成为机器人行业交流的新语言。

而语言的变化,往往意味着产业阶段的变化。当行业开始讨论WBI(全身智能),意味着机器人竞争的重点,已经不只是拥有一个更强的大脑,而是让认知、身体和环境真正融合;当行业开始讨论WRAM、世界模型,意味着机器人正在从理解世界走向预测世界;当行业开始讨论部署态、作业模式,意味着机器人开始接受真实产业环境的考验,而不是停留在实验室和展厅之中。

这也是为什么今年大量新概念出现的背后,本质上都是同一个方向——机器人正在从“被制造出来”,走向“能够持续成长的智能体”。当然,今天的具身智能仍然处于早期阶段。数据规模还需要持续积累,模型能力仍需要突破,灵巧操作和泛化能力仍然是行业难题,机器人距离真正意义上的通用智能还有很长的路要走。

但不可否认的是,2026年的一个重要变化已经发生:机器人行业开始拥有自己的技术语言。过去,机器人更多借用了自动化时代的叙事:精度、速度、自由度、负载。

如今,它开始建立属于具身智能时代的新词汇:世界模型、全身智能、物理AI、数据闭环、部署态。这些词背后,连接的是机器人从实验室走向现实世界的一条完整路径。

这些新词不会是终点。多年以后,当人们回顾具身智能真正走向产业化的阶段,或许记住的不只是某一款机器人产品,也不只是某一家企业的发布会。

他们可能会发现:正是这些不断出现的新词,记录了机器人从“会运动”到“会思考”,再到“会工作”的关键转折。机器人行业正在换一套语言,而语言的背后,是一个产业正在换挡。

 

来源:WRAM、WBI、具身原生……2026年具身智能的“黑话”都是怎么来的? | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/