WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟如何转化为机器人动作?

2026年07月21日 17:20
本文共计4960个字,预计阅读时长17分钟。
来源/具身研习社 责编/LaosijiAming 老司机阿明

7 月 19 日,WAIC 2026 世界模型六小龙巅峰论坛在上海举行。大晓机器人在现场对 Kairos 3.1、环境式数据采集方案 2.0 以及三套行业方案开展了发布工作,Physical IQ具身物理智能统一评测平台也在同场进行了亮相。

现场内容虽然丰富,但这些内容在背后均指向了同一个核心技术问题:一个世界模型应当如何从预测未来画面的过程出发,继续推进到机器人可以实际执行的具体动作。

Kairos 技术报告给出的答案包含三个层面。模型首先从视觉、语言以及机器人状态里压缩出与控制有关的内部状态,再借助视频生成和动作预测共同训练这组状态,部署时可以跳过未来视频,直接生成动作片段。数据则按照开放世界视频、人类行为以及机器人交互逐步加入,让物理先验最终落到具体本体上。

Kairos希望借助同一组内部状态,同时对物理变化、任务进度以及机器人动作进行表达。它试图让视频中的物理变化、任务进度以及机器人动作,共用同一组内部状态。

WAIC 2026 世界模型六小龙巅峰论坛现场

技术报告基本信息

技术报告:https://arxiv.org/abs/2606.16533

f2527a66d1658fb10b0042002eea4303.jpg

开源代码:https://github.com/kairos-agi/kairos

模型权重:https://huggingface.co/kairos-agi

控制充分状态为何需要依赖于力触数据

论坛上反复出现的一个词是控制充分状态。它来自Kairos技术报告,指的是机器人在完成当前任务时所必须保留的内部信息,其中包括了物体所处的位置、双方接触的方式、任务所进行到的步骤、继续执行可能产生的结果,以及当前判断所具有的不确定性。

当机器人拿取杯子的时候,桌面纹理在很少情况下会改变动作选择的决策;而杯子位置、抓取姿态、摩擦以及滑动状态则会直接影响到下一步的动作执行。论文运用后悔值来对压缩状态所造成的信息损失进行衡量:模型仅依据内部状态做出的决策,与在读取完整历史之后所能做出的决策相比,会增加多少碰撞、失败、恢复以及人工介入的成本。

内部状态的好坏,最终需要依赖于所丢掉的信息是否会改变动作选择的决策。

控制充分状态所希望达成的是运用紧凑的信息来支撑低代价的决策过程

这个定义也解释了大晓为何要同步发布环境式数据采集方案2.0。如果仅仅记录画面信息,模型就很难对手指已经接触、正在受力还是物体已经开始滑动这些状态进行区分。新方案把头、手、胸多视角画面与三维力触觉、手部动捕置于同一条采集链路,现场公布的指标包括0.01N力触觉灵敏度、低于2°的关节角误差,以及20余种传感器低于1毫秒的同步误差。

视觉、手部动作以及力触状态共同对一次真实接触进行了描述

论文里的控制充分状态目前仍是一项目标定义,并没有直接证明这组隐变量已经完整恢复摩擦、受力以及失败边界。数采系统提供的同步力触数据,恰好补充了后续验证所需的观测基础。

2026年7月19日,WAIC 2026世界模型六小龙巅峰论坛在上海举行。大晓机器人在现场对Kairos 3.1、环境式数据采集方案2.0以及三套行业方案开展了发布工作,Physical IQ具身物理智能统一评测平台也在同场进行了亮相。

现场内容虽然丰富,但这些内容在背后均指向了同一个核心技术问题:一个世界模型应当如何从预测未来画面的过程出发,得以继续推进到机器人可以实际执行的具体动作。

Kairos技术报告给出的答案包含三个层面。模型首先从视觉、语言以及机器人状态里压缩出与控制有关的内部状态,再借助视频生成和动作预测共同训练这组状态,部署时可以跳过未来视频,直接生成动作片段。数据则按照开放世界视频、人类行为以及机器人交互逐步加入,让物理先验最终落到具体本体上。

95da731e177707fc59a8dc9c60973a2d.png

Kairos希望借助同一组内部状态,同时对物理变化、任务进度以及机器人动作进行表达。它试图让视频中的物理变化、任务进度以及机器人动作,共用同一组内部状态。

控制充分状态为何需要依赖于力触数据

论坛上反复出现的一个词是控制充分状态。它来自Kairos技术报告,指的是机器人在完成当前任务时所必须保留的内部信息,其中包括了物体所处的位置、双方接触的方式、任务所进行到的步骤、继续执行可能产生的结果,以及当前判断所具有的不确定性。

当机器人拿取杯子的时候,桌面纹理在很少情况下会改变动作选择的决策;而杯子位置、抓取姿态、摩擦以及滑动状态则会直接影响到下一步的动作执行。论文运用后悔值来对压缩状态所造成的信息损失进行衡量:模型仅依据内部状态做出的决策,与在读取完整历史之后所能做出的决策相比,会增加多少碰撞、失败、恢复以及人工介入的成本。

内部状态的好坏,最终需要依赖于所丢掉的信息是否会改变动作选择的决策。

控制充分状态所希望达成的是运用紧凑的信息来支撑低代价的决策过程

这个定义也解释了大晓为何要同步发布环境式数据采集方案2.0。如果仅仅记录画面信息,模型就很难对手指已经接触、正在受力还是物体已经开始滑动这些状态进行区分。新方案把头、手、胸多视角画面与三维力触觉、手部动捕置于同一条采集链路,现场公布的指标包括0.01N力触觉灵敏度、低于2°的关节角误差,以及20余种传感器低于1毫秒的同步误差。

视觉、手部动作以及力触状态共同对一次真实接触进行了描述

论文里的控制充分状态目前仍是一项目标定义,并没有直接证明这组隐变量已经完整恢复摩擦、受力以及失败边界。数采系统提供的同步力触数据,恰好补充了后续验证所需的观测基础。

Kairos 由多模态理解、视频扩散变换器以及动作扩散变换器所组成。图像首先借助视觉自编码器完成压缩处理,任务指令由视觉语言模型开展编码工作,机器人状态由状态编码器加以处理,随后进入共享的视频动作注意力。

e310b28837a892e5020617fb70653c88.png

论文架构的设计让理解、未来视频以及动作预测得以共享同一组状态表征。

理解模块会对历史视觉信息、任务指令以及机器人状态进行读取工作,从而整理出当前的任务进度。视频分支会选用流匹配训练的方法,在干净视频隐变量与噪声之间学习得到速度场,并运用未来画面对物体持续性、空间布局以及接触变化进行约束。动作分支则读取同一段历史信息,生成后续的动作片段。

训练序列被划分为历史视频、未来视频以及未来动作这三组令牌。未来视频与未来动作均会读取历史信息,然而动作分支却并不读取未来视频令牌。在开展联合训练的过程中,视频分支会提供世界动力学监督;而到了部署阶段则可以关闭未来视频解码环节,只针对动作令牌进行去噪操作,从而减少推理成本。

发布演示里的开冰箱任务把这套结构运用到了具体操作过程之中。系统从同一初始状态展开不同接触方案,比较三指、右手反关节以及左手触摸门体等轨迹,然后选择行动代价更低的方案。

发布演示展示了同一状态下所推演出的多条动作轨迹

这里需要对两层证据进行区分。其中开冰箱展示的是完整产品链路;技术报告验证的是模型结构、视频动作联合训练以及标准基准。多条想象轨迹与真机执行结果是否能够稳定对应这一点,论文仍将其列在后续验证中。

三阶段训练为什么和 ACE-Data-0 一起发布

Kairos 按照干预世界的强弱程度对训练数据开展了组织工作,开放世界视频、人类行为以及机器人交互依次进入模型之中。

跨本体数据课程会逐步完成物理规律、任务意图以及机器人动作的对齐

在开放世界阶段,模型会对视频扩散变换器开展训练工作。它从256P图像开始,逐步扩展到720P、最长241帧的视频,从而率先获得物体运动、碰撞、支撑以及时间连续性等一般先验。

c62afa2f2127d3ac8c52a4db35efdd93.png

人类行为阶段会加入第一视角、第三视角的人类行为视频以及机器人视角视频。模型开始对工具使用、操作顺序、任务目标以及恢复过程进行学习,训练文本也逐步从画面描述转变为任务指令。

在机器人交互阶段会引入时间对齐的视频、动作、本体状态以及接触信号,并同时对Video DiT与Action DiT开展训练工作。失败、滑动、危险接触和恢复片段会组成偏好样本,从而让稳定、安全、可恢复的执行结果获得更高的训练权重。

大晓同场开放的 ACE-Data-0 主要面向家居复杂任务,强调了力触过程、失败恢复以及长程标注。它与三阶段课程的关系很直接:公开视频解决了覆盖范围,人类行为补充了任务结构,机器人数据把这些知识压到具体动作空间;失败与恢复数据继续标出动作边界。

ACE-Data-0对家居任务里的物理交互与过程状态开展了记录工作。

2b66728204401891922b635b0374d536.png

125 毫秒之后,运动控制怎样接住动作

在长程任务的执行过程中还会遭遇到记忆存储以及计算量方面的问题。其中接触变化通常发生在短暂时间之内,取物移动和放置这些操作则会跨越多个不同阶段,同时遮挡之后的物体位置与失败历史需要被保存更久的时间。Kairos借助三条通路来拆分时间建模工作:滑动窗口对局部运动开展处理,扩张窗口连接中程事件,而门控线性注意力维护物体持续性任务进度和失败历史。

4ce05f2c34910efe47f021a031d36e4f.png

局部窗口、中程扩张窗口以及全局线性记忆会分担不同时间尺度的工作。

这套结构同样支持在服务端侧进行部署工作。大晓在现场公布的测试条件为 NVIDIA Jetson Thor、BF16 精度,在此设定下 Kairos 3.18B 的平均延迟是 125 毫秒。模型还运用四步扩散蒸馏、推理缓存、算子融合、混合精度量化以及异步动作运行等方式,对推理链路开展了压缩处理。

现场延迟数据所对应的正是端侧动作推理环节,这一部分需要与生成完整未来视频的过程加以明确区分。

125毫秒仍然高于电机级的控制周期。世界动作模型适合对任务状态进行更新并且生成动作片段,底层控制器继续负责关节跟踪、平衡、接触稳定以及安全保护。模型、动作接口与运动控制器会在不同频率上运行,本体反馈负责把它们重新对齐。

论文成绩为什么还要接统一评测

b3f10fd46f2030c847bc5e8ae792c844.png

在动作侧实验当中选用 RoboTwin 2.0 以及 LIBERO-Plus 来开展验证工作。Kairos 在 RoboTwin 2.0 之上取得了 96.1% 的平均成功率;LIBERO-Plus 的平均成绩为 89.0,其中推理时同时对未来视频以及动作开展联合去噪的 Kairos-joint 则达到了 90.8。

Kairos以及Kairos-joint在不同视觉输入以及场景扰动条件之下所呈现的结果

在加入人类行为预训练之后,LIBERO-Plus 从83.0提升到了89.0;当仅对动作分支开展单独训练时结果为65.8,在对视频以及动作开展联合训练之后则达到了89.0。该结果表明视频动力学监督确实为动作预测提供了有效的信息。在世界模型方面,Kairos 4B 在WorldModelBench、VideoPhy以及15秒PAI-Bench上也给出了物理合理性与长程一致性结果。

这些仍是标准数据集上的代理证据。真实任务还会对光照、物体状态、本体结构、控制频率以及接触条件这些方面进行改变。论坛发布的Physical IQ物智评测平台,目标是将不同模型以及本体置于统一协议之下,从而在零售、工业以及家居环境中继续对物理智能开展测试工作。

725d6526ece634cf8707811493c5c8fe.jpg

Physical IQ 尝试开展跨模型以及跨本体的统一评测入口的建立工作。

三套行业方案将闭环问题带回到了实际现场

大晓所发布的三套方案面向即时零售、酒店洗衣以及开放场景作业。它们的任务流程和机器人形态虽然存在差异,却都会反复遇到同一组问题:现场状态是否可以得到准确判断、动作片段能否及时得到生成、低层控制能否实现稳定执行、失败后系统能否找到接续位置。

9d12492e987ebe7efcd6ffe5462ad4d1.png

即时零售、酒店服务以及开放场景作业对应于三类连续任务环境。

技术报告中当前的自我改进实验主要发生在提示词以及视频生成层。模型生成候选结果,评估器按照物理合理性、任务完成度以及视觉质量开展打分工作,再改写提示词并继续进行生成。真实机器人上的执行前失败预判、安全过滤、恢复学习,以及想象数据能否提高策略成功率,仍需要后续实验来验证。

Kairos 已经公开了代码以及 4B 系列权重,其中 RoboTwin 2.0 与 LIBERO-Plus 版本提供了动作预测入口。现场公布的 8B 端侧能力还需要依赖于更完整的权重、测试配置以及真机复现材料。

此次发布将论文、数据采集、端侧推理、统一评测以及行业场景整合到了一条技术路线之上。下一步需要考察的,是想象出来的未来能否持续对应于真实的物理结果。

来源:WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟怎样转化为机器人动作? | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯