谷歌 DeepMind 发布 GenCeption,旨在打破专用模型桎梏并处理五大视觉任务

2026年07月21日 17:51
本文共计497个字,预计阅读时长2分钟。
来源/aibase 责编/huazi56 爱力方

谷歌 DeepMind 团队近日推出了全新的 GenCeption 模型,尝试将传统的视频生成 AI 逆向改造成能够深度理解现实世界的视觉分析引擎。不同于以往分割与深度估计等任务各自独立的格局,GenCeption 仅凭单一模型就能同时高效完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。

image.png

该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,在一次前向传播中即可完成预测,大幅提升了处理速度。使用者只需通过简单的文本提示输入指令,模型就能精准输出深度图、分割掩码及相机运动轨迹等丰富信息。

单人合成数据训练,惊人泛化细节保留至发丝

有趣的是,GenCeption 的训练集仅包含约 7500 段由 Blender 渲染的单人合成视频。然而,该模型展现出了极强的泛化能力,不仅能顺畅处理真实世界中的多人视频,还能轻松迁移至动物与机器人类别。

在实际测试中,小模型处理 81 帧视频仅需约 6 秒,而 140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。

来源:打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯