上海新智具身智能科技有限公司与复旦大学可信具身智能研究院联合发布N0系列技术报告,构建3万小时视觉-触觉交互语料库统一触觉数据格式。

2026年07月27日 19:03
本文共计3231个字,预计阅读时长11分钟。
来源/具身研习社 责编/PixelHunter 像素猎人

新智具身携手复旦大学联合发布了系列技术报告,该报告旨在通过运用长达3万小时的触觉数据,来有效弥补当前具身智能系统在精细操作层面的“手感”缺失问题。

机器人能够执行的任务范围十分广泛:从煮制鸡蛋面、调制柠檬水等居家料理,到进行收纳整理工作,它均能熟练掌握;即便是面对工厂流水线装配、精细零件组装以及线材缠绕梳理等精细操作,它也完全能够胜任。这恰恰体现了系列模型所展现出的强大实际操作能力。

各位是否曾目睹过机器人在实际操作中出现失误的典型场景:插头边缘与插座反复摩擦却始终难以准确插入、抓取塑料瓶时所施加的力道失去控制从而导致瓶身被压瘪、已经叠放整齐的毛巾在松手的一瞬间便散落开来…… 在具身智能技术走向落地应用的进程当中,这类"视觉系统判定结果并无异常,但物理交互环节瞬间出现失误"的现象可以说是屡见不鲜。

这些操作层面的失败,恰恰指向了业界所形成的一项共识:决定机器人能否在真实的物理世界当中顺利运作的关键因素,往往不只在于视觉感知方面所具备的精度,更在于接触瞬间所获得的触觉反馈。摄像头虽然能够确认物体的空间位置,但却无法判断是否真正接触到、是否顶到边缘、夹持力是否过载,以及是否发生滑移等状态,而缺少这层反馈,恰恰正是阻碍机器人成功跨越"最后一厘米"这一核心痛点所在。

近日,上海新智具身智能科技有限公司(NeoteAI)与复旦大学可信具身智能研究院展开合作,正式对外发布了系列三份技术报告,将触觉这一感知模态从传统的"辅助模态"定位,跃升至"核心基建"的战略高度。将三份报告整合起来进行审视,恰好可以拼凑出一张清晰的技术蓝图——即一套触觉数据底座,搭配两条侧重点各异的技术路线。

更具行业价值的是,项目的数据和模型将进行开源,用户可以直接通过以下链接查看项目的完整内容:https://research.neoteai.com

-Foundation:

统一触觉"方言",构建3万小时交互语料库

触觉数据的大规模应用长期受到各类触觉设备输出格式不统一的制约。不同传感器所输出的凝胶形变图像、电容矩阵数据或六维力向量,就如同缺乏统一语法规则的方言一般,无法在同一模型框架下实现有效融合。

为此,由 NeoteAI 所搭建的 NeoData 数据集,其核心目标旨在打破这一技术壁垒:

包含超 3 万小时视觉 - 触觉交互视频;

约 140 万条操作片段,33 亿个时间步;

对应 80 亿帧 RGB 画面与 100 亿帧触觉图像;

动用 Franka、Piper、UR5e 等 6 种机器人本体;

覆盖了450项真实长程任务,诸如叠衣、插拔接头以及倒液体等,这些任务均由90位操作员进行采集;

已开源 5 千小时视觉-触觉交互视频。

此外,研究团队还提出了一种名为 NeoForce 的统一表征模型。该模型能够适应底层传感器硬件的不同配置,学习到具备迁移能力以及时序结构化的触觉表征,从而为下游的具身智能策略提供支持。这些表征能够回答诸如哪里被按压、按压力度多大、是否存在横向拉扯等关键问题。这种“触觉普通话”有效地解决了跨设备数据融合所面临的难题。

13a9cb5b42821d22538c09cdbd0539c5.jpg

为了帮助大家能够更为直观地进行理解,下方的视频对-Foundation所具备的各项核心功能进行了完整介绍,其中涵盖了硬件配置、数据样例以及全面评测等方面的内容。

-VTLA:

以 “触觉预判” 赋能轻量级 VLA

在数据底座得到夯实之后,团队随即开始思考如何将触觉真正融入到 VLA 技术路线之中。

在现有的多模态融合实践当中,直接将触觉图像与RGB视觉信号进行简单拼接往往会面临一定的挑战:由于触觉信号仅在物理接触的瞬间才能产生高频的响应,大部分时间都处于一种"静默"状态,极易被海量的视觉Token所淹没。更为关键的是,即便模型能够成功提取当前的触觉特征,其本质上仍然只是对已发生动作的一种滞后反馈——这种类似于"后视镜"的感知机制,使得系统在动态交互的过程当中始终存在着慢半拍的问题。

-VTLA 提出了一种全新的方案:它不依赖于已经滞后于当前时刻的触觉数据,而是对未来50步时间窗口内的触觉演变进行预测。该模型将当前获取的触觉信息编码为一个紧凑的潜在 Token,并结合来自视觉信息的上下文,对诸如滑移、接触力等未来趋势进行预判,进而指导动作控制模块进行前瞻性的调整。在不同的任务上进行的测试显示:-VTLA 在插接插头这一任务上,其操作成功率达到了85%,相比之下,同类的纯视觉方案其成功率仅为60%;在拔取钥匙的任务中,其成功率高达99%,而纯视觉方案的成功率则为35%。

此外,-VTLA 成功突破了传统模仿学习仅依赖专家成功轨迹的局限性,使得机器人能够从失败数据当中实现自主进化。该模型借助触觉信息,运用部署后数据以及人类在环(human in the loop)的数据,对一个进度评估模型进行了训练,从而使其能够识别任务的执行阶段,甚至能够识别出诸如“退步”与“救场”之类的复杂行为。通过结合离线强化学习的方式,机器人在诸如毛巾折叠、书包收纳以及纸箱折叠等长程任务上的成功率,分别从50%、35%以及20%大幅提升至95%、80%以及75%,从而真正实现了从失败经验当中汲取教训的持续进化过程。

-TWAM:

在世界模型中重构 “触觉想象”

如果说-VTLA 为机器人加装了预判雷达,那么-TWAM 则是对机器人认知中枢进行的一次重构:它将触觉信息集成到世界模型当中,使得机器人在实际动手操作之前,能够在内部的想象空间里完整地推演一遍操作视角与手感。

现有世界模型在生成未来视觉图像方面取得了一定进展,但将其应用于驱动真实机器人时,便会面临一个严峻的物理对齐挑战:模型生成的画面可能显示杯子已被抓住,却无法判断手指夹持得是否稳固;画面中的插头看似已对准,但接下来会不会被卡住则无从知晓。这些在实际交互中至关重要的触觉感知信息,在此类模型中是完全缺失的。

-TWAM 的核心目标在于同时预测未来视频、触觉以及动作这三个相互耦合的序列。该模型运用了混合专家架构,其中集成了视频、触觉与动作三个异步专家网络;视频专家基于预训练模型进行热启动,而触觉和动作专家则采用更窄的结构设计,最终使得总参数量控制在72亿,仅相当于全宽方案的一半。

在仿真测试与真机验证环节当中,-TWAM展现出了明显的优势。在仿真环境当中,该模型的平均成功率达到84.5%,而世界模型领域的最强基线方法仅为36%;在真机测试当中,涵盖8项任务的平均成功率为46.3%,而LingBot-VA的成功率则为21.9%。消融实验的结果进一步证实了触觉机制的必要性,当移除"未来触觉预测"或者"当前触觉条件"时,模型的性能均会出现显著下降,从而充分确立了触觉信息在世界模型架构当中的不可或缺地位。

4424f98dff3e4bff4139664c558f7d1e.png

触觉:具身智能的下一个 Scaling Law?

纵观系列三份报告,NeoteAI明确地释放出了行业的前沿信号:其中,-Foundation成功验证了触觉模态具备有与视觉模态相类似的Scaling潜力;-VTLA则证明了触觉能够自然地接入至现有的VLA架构之中;而-TWAM更是确立了触觉在世界模型顶层设计里的核心地位,使其得以与视觉模态真正地平起平坐。

这标志着机器人的认知范式正在经历一场深刻的演进,从单一的视觉驱动模式转向视触融合的感知体系。它们不再仅仅是依赖“看”来理解世界,而是开始像学习期的婴儿那样,借助主动的触觉探索来不断验证假设,并以此规划后续的动作。“看见杯子不等于能够稳定抓握,识别插座也不意味着可以成功插入”——这一物理世界中的基本常识,如今终于得以被编码进机器人的底层决策逻辑之中。

尽管距离"随手一摸即知轻重"这一通用具身智能目标仍然有着相当长的道路需要走,其中真实场景当中的数据采集成本、跨本体泛化能力以及推理实时性等方面仍然是亟待攻克的工程难题,但NeoteAI所发布的这一组工作已经实质性地推动了触觉感知从"小众研究方向"跃升至"具身智能核心基建"的战略地位。

来源:用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」 | 具身研习社

声明:本文来自具身研习社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/