小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线

2026年07月21日 15:51
本文共计1573个字,预计阅读时长6分钟。
来源/aibase 责编/PixelHunter 像素猎人

视觉大模型长期被一个隐形门槛卡着:想拿到顶尖效果,就得先囤够天量数据和算力,这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团发布TuringViT高效视觉编码器,宣称从架构、数据范式到训练流程系统性重构了视觉编码器,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径,把先进视觉大模型从头部专属推向行业普惠。

TuringViT的定位很清晰:面向VLM与VLA时代,全面支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。它从架构、数据、训练三个维度同步突破,搭起一套线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系,在效果、效率与落地性上做三重提升。

image.png

在架构上,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,合计15层TLA加3层MHA,主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block,合计20层TLA加4层MHA,在保持线性计算主导的前提下进一步拉升表征能力。实测数据显示,随着输入分辨率升高,TuringViT的延迟增长曲线远比标准softmax ViT平缓,高分辨率下的效率优势愈发突出。在1536乘1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,这为高分辨率感知、多摄像头输入和长时序视频处理的端侧部署扫清了核心障碍。

与行业堆数据规模的粗放路线不同,TuringViT真正锋利的地方是数据治理。它打造了VISTA-Curation多模态数据治理流水线,不再追求用更多数据,而是通过提升单样本的监督价值实现数据效率的量级跃升。针对图文数据,流水线分三步精细筛选:先过滤掉低分辨率、模糊、低纹理的劣质图片;再用多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;最后在统一对比池里,按相对图文对齐度、文本信息量与歧义度综合打分,筛出视觉贴合度高、语义密度高的优质标注,淘汰模糊、泛化和弱对齐样本。针对视频数据,流水线先把长视频切分成连续短片段并均匀采样代表帧,再用语义一致性与运动一致性双重过滤保留有效片段,最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面里学到更鲁棒的视觉表征。

image.png

数据效率的提升直接反映在了成绩上。TuringViT仅用了0.85B图文对,大约是SigLIP2-L训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越那些用10B数据训练的主流开源基线;在COCO与Flickr30K图文检索任务上同样优势明显,真正实现了用十分之一数据换来更优效果的突破。

image.png

训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练第一天起就适配下游VLM与VLA的输入特性,彻底告别了固定分辨率预训练再加事后适配的传统模式。

这套编码器在小鹏的技术体系里已经有了明确落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token;面向智能座舱与驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可支撑不同画幅和比例的视觉输入,为更丰富的座舱交互功能打底;在小鹏IRON人形机器人体系里,它则扮演着视觉视网膜的核心角色,提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线 https://turingvit.github.io/。

来源:小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯