同一个概念为何会指向不同问题的答案

2026年07月27日 17:23
本文共计5685个字,预计阅读时长19分钟。
来源/财联社 责编/XingzheWujiang 行者无疆

《科创板日报》7月27日讯(记者余诗琪),世界模型是否为通向AGI的必经之路,在AI圈内目前尚未达成共识。

一部分人认为,世界模型与智能的上限之间并无关联,它所代表的无非是一门“好生意”;另一部分人则坚信,大语言模型无法独立走向AGI,只有让AI真正理解物理世界的运行规律,才能突破智能的边界。

分歧虽然存在,但另一个事实也正在同步发生:2026年上半年,全球风险投资流向世界模型创业公司的资金已经超过30亿美元。智象未来、生数科技、千寻智能等代表性公司都相继完成了大额融资。

一方面分歧尚未平息,另一方面资本加速涌入,世界模型赛道的叙事显然并未收敛。

今年4月,《科创板日报》记者在合肥科交会上首次对智象未来开展了报道。当时,这家总部位于合肥科大硅谷的AI公司刚刚完成了超5亿元的融资工作,并且发布了新一代原生全模态世界模型HiDream-O1。

三个月之后,智象未来已经接连完成了三轮融资,其中所累计的融资额度超过了21亿元,而且公司在密集融资的过程当中也成功跨越了独角兽的估值门槛。《科创板日报》近日再度与智象未来创始人梅涛进行了对话,试图借助这家公司的快速崛起情况,来理解一线从业者对于世界模型赛道所持有的真实判断。

梅涛所持观点表明,他可以说是世界模型路线的坚定支持者。

在先前采访过程当中,他曾经提出观点认为,大语言模型难以独立走向AGI,这是因为其所无法实现的是对机器与真实世界之间进行交互的指导工作。真正的世界模型需要具备对物理世界开展表达、建模、推理以及反馈等方面的能力。

行业通常会将世界模型概括成为“model the world”,梅涛则更加倾向于选用“mold the world”——也就是塑造世界。

在最新的采访中,梅涛进一步地解释称,如果AI仅仅只是复现世界,那么本质上它仍是在对人类已有知识开展压缩、拟合以及复刻。在这一范式下,人类文明积累的信息量也会成为模型能力所能够达到的边界。

按照他的理解,世界模型至少应当具备表达世界、推演世界以及构造世界这三种能力。这意味着模型不仅需要生成看似真实的图像或视频,而且还需要对不同模态信息之间的联系进行理解,同时也要对场景背后的空间关系、时间变化和因果逻辑加以把握。

这一判断也决定了智象未来所选用的技术路线。

当前不少多模态模型所选用的是相对分立的架构:图像以及文字等不同模态首先会分别进行编码,随后则在模型当中完成对齐以及融合的工作。智象未来则选用原生全模态路线。

根据梅涛所进行的介绍,公司自主研发的UiT(Unified Transformer)架构不再继续沿用VAE图像压缩与独立文本编码器相结合的这种传统方式,而是选用把图像像素、文本Token、视频体素以及音频、动作、空间关系等信号映射到共享的Token空间当中,从而在同一个系统内完成理解、生成和推理的工作。

原生全模态从某种意义上说,是对人类感知世界方式所进行的一种还原。梅涛举例指出,人看到一则台风即将登陆的新闻时,可能会同时联想到狂风、雷声乃至温度变化。这种联想依赖于人类多种感知系统所开展的协同,而不是单一模态所进行的独立处理。

按照梅涛所制定的规划,智象未来将会沿着“以图入视、以视入世”的路径来开展工作,从图像生成向视频生成方面进行延伸,最终得以探索世界模型所拥有的完整能力。在图像生成这一阶段性能力方面,智象未来已经获得了部分第三方评测所开展的验证。在Artificial Analysis的文生图榜单当中,其开源模型在开源模型中位列第一,闭源商用模型则进入全球前三。

梅涛进一步地表示,公司不会在通用语言模型方面与头部厂商开展正面竞争,而是继续聚焦于视频以及原生多模态。

这一情况让智象未来成为了观察当前世界模型分歧的一个样本:梁文锋所关注的是世界模型能否提升通用智能的上限这一方面,智象未来则试图从多模态生成这一路径出发,进而将世界模型转化为内容生产、视频创作乃至物理世界建模所需要的技术基础。

可以说,双方虽然运用了同一个概念,但在实际过程当中所回答的未必是同一个问题。

《科创板日报》7月27日讯(记者余诗琪),关于世界模型是否能够作为通向AGI的必经之路这一问题,在AI圈内目前所形成的观点尚未达成共识。
一部分人所持有的看法是,世界模型与智能的上限之间并无直接关联,它所代表的无非是一门好的生意;另一部分人则坚信,大语言模型无法独立引领走向AGI,只有让AI真正理解物理世界的运行规律,才能够突破智能的边界所在。
尽管分歧仍然存在,但另一个事实也正在同步发生:2026年上半年,全球风险投资流向世界模型创业公司的资金已经超过了30亿美元。智象未来、生数科技、千寻智能等代表性公司都相继完成了大额的融资工作。
一方面分歧尚未得到平息,另一方面资本正在加速涌入其中,世界模型赛道的叙事显然并未出现收敛的迹象。
今年4月,《科创板日报》记者在合肥科交会上首次对智象未来开展了相关的报道。当时,这家总部位于合肥科大硅谷的AI公司刚刚完成了超过5亿元的融资工作,并且发布了新一代原生全模态世界模型HiDream-O1。
三个月之后,智象未来已经接连完成了三轮融资,其中累计的融资额度超过了21亿元,而且公司在密集融资的过程当中也成功跨越了独角兽的估值门槛。《科创板日报》近日再度与智象未来创始人梅涛进行了对话,试图借助这家公司的快速崛起情况,来理解一线从业者对于世界模型赛道所持有的真实判断。
梅涛所持有的观点表明,他可以说是世界模型路线的坚定支持者。
在先前的采访过程当中,他曾经提出观点认为,大语言模型难以独立走向AGI,这是因为其所无法实现的是对机器与真实世界之间进行交互的指导工作。真正的世界模型需要具备对物理世界开展表达、建模、推理以及反馈等方面的能力。
行业通常会将世界模型概括成为“model the world”,梅涛则更加倾向于选用“mold the world”也就是塑造世界的表达方式。
在最新的采访中,梅涛进一步解释称,如果AI仅仅只是对世界进行复现,那么本质上它仍是在对人类已有知识开展压缩、拟合以及复刻的工作。在这一范式下,人类文明所积累的信息量也会成为模型能力所能够达到的边界。
按照他的理解,世界模型至少应当具备表达世界、推演世界以及构造世界这三种能力。这意味着模型不仅需要生成看似真实的图像或视频,而且还需要对不同模态信息之间的联系进行理解,同时也要对场景背后的空间关系、时间变化和因果逻辑加以把握。
这一判断也决定了智象未来所选用的技术路线。
当前不少多模态模型所选用的是相对分立的架构:图像以及文字等不同模态首先会分别进行编码,随后则在模型当中完成对齐以及融合的工作。智象未来则选用原生全模态路线。
根据梅涛所进行的介绍,公司自主研发的UiT(Unified Transformer)架构不再继续沿用VAE图像压缩与独立文本编码器相结合的这种传统方式,而是选用把图像像素、文本Token、视频体素以及音频、动作、空间关系等信号映射到共享的Token空间当中,从而在同一个系统内完成理解、生成和推理的工作。
原生全模态从某种意义上说,是对人类感知世界方式所进行的一种还原。梅涛举例指出,人看到一则台风即将登陆的新闻时,可能会同时联想到狂风、雷声乃至温度变化。这种联想依赖于人类多种感知系统所开展的协同,而不是单一模态所进行的独立处理。
按照梅涛所制定的规划,智象未来将会沿着“以图入视、以视入世”的路径来开展工作,从图像生成向视频生成方面进行延伸,最终得以探索世界模型所拥有的完整能力。在图像生成这一阶段性能力方面,智象未来已经获得了部分第三方评测所开展的验证。在Artificial Analysis的文生图榜单当中,其开源模型在开源模型中位列第一,闭源商用模型则进入全球前三。
梅涛进一步表示,公司不会在通用语言模型方面与头部厂商开展正面竞争,而是继续聚焦于视频以及原生多模态。
这一情况让智象未来成为了观察当前世界模型分歧的一个样本:梁文锋所关注的是世界模型能否提升通用智能的上限这一方面,智象未来则试图从多模态生成这一路径出发,进而将世界模型转化为内容生产、视频创作乃至物理世界建模所需要的技术基础。
可以说,双方虽然运用了同一个概念,但在实际过程当中所回答的未必是同一个问题。

事实上,世界模型这一概念本身也尚未实现收敛,那些被贴上这一标签的企业,如果仔细加以观察的话,则会发现其在技术路线以及商业选择方面存在着迥异的差异。结合此前所跟踪采访的企业,《科创板日报》记者试图对这些企业开展一次粗略的划分工作。

第一类便是像智象未来这样从图像以及视频生成方面切入的企业。生数科技以及爱诗科技也可以被归入这一类别,这类公司首先需要对画面质量、空间关系、长时序一致性、内容可控性以及生成成本等方面的问题进行解决。

但是当具体到不同的企业时,在具体的路径选择方面仍然存在一定的差异。其中智象未来重点强调原生全模态,希望选用统一的架构来对图像、文本以及视频等不同模态开展处理工作;生数科技则是从视频生成起步,并且提出了MoT统一架构;爱诗科技则以多模态视频大模型以及面向消费者的视频生成产品作为其主要的落点所在。

第二类世界模型公司则聚焦于具身智能基础模型方面。这类企业试图借助视频、机器人数据或仿真环境,让模型对物理世界的状态变化进行学习,并进一步对动作所可能产生的结果开展预测工作。

从《科创板日报》记者此前的采访了解的情况看,自变量、逆矩阵都可以被归入到这一类别当中。这类世界模型不以生成供人观看的视频为最终目标,而是为机器人的感知、决策以及动作生成提供服务。其核心难点包括训练数据稀缺、仿真与现实之间的差异、长时序任务规划,以及模型在不同机器人本体和应用场景中的泛化能力。

第三类公司主要面向机器人的技能生成以及动作执行方面,试图运用世界模型所具备的能力,得以打通机器人从任务理解到真机执行的链路。逐际动力以及跨维智能可以被归入到这一类别当中。

与试图建立对通用物理规律所开展表征的世界基础模型不同,这类公司并不以训练一个覆盖所有物理场景的基础模型为首要目标,而是关注机器人如何将视觉、语言以及环境状态等信息转化为可以在具体本体上执行的动作策略。世界模型在这里更像连接机器人理解任务与完成动作的“技能层”。

对于这类企业而言,世界模型所具有的商业价值并不在于单独出售一套通用基础模型,而是在于它可以缩短机器人从理解任务到执行任务的这一链路,并且最终借助机器人整机、技能方案或场景交付这些方式来得以实现收入。

由此来看,当前被冠以“世界模型”概念的企业,从底层逻辑方面来看其实并不处于同一条赛道:视频生成公司会率先在内容产业当中对收入开展寻找工作,具身智能基础模型公司试图成为物理世界的通用能力底座,世界动作模型公司则希望让机器人率先获得可以落地执行的技能。

三条路线所共享的是“理解和推演世界”的技术叙事,但在产品形态、所面对的客户以及商业化周期这些方面却并不相同。

谁在押注世界模型?

智象未来的融资速度,所对应的是观察这轮资本热情的一个切片。

最新所完成的15亿元C轮融资,是由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投的。这是社保基金首次作为LP对多模态大模型方向开展投资,工银资本也同样是第一次进入这一领域。

跟投方阵容同样跨越了多重属性,其中包括厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等。老股东合肥产投、东方富海、金浦投资、金华金投持续开展了加注工作。

梅涛对于投资者的入局逻辑开展了自己的观察。在他看来,国家级资本的进入意味着长周期投入成为可能,这是因为世界模型的研发不是一场短跑,而是需要对底层架构开展持续的原始创新工作。影视产业资本所指向的是内容生产方式的重构工作,上影以及华策带来的并不只是资金,更是高质量影像数据以及真实内容场景。地方国资的逻辑则落在了产业生态方面,合肥产投已连续三轮开展加注工作,从合肥到厦门、杭州、湖北,多地国资正在形成一个跨区域的“资本+产业”支撑网络。

智象未来并非孤例,前文不同路线的公司正在以不同的节奏对资本进行吸收,从资金分布方面来看资本青睐程度差异明显。

第一类从图像以及视频生成方面切入的企业(智象未来、生数科技、爱诗科技等),智象未来在三个月内完成了超过21亿元的融资、爱诗科技完成了29.8亿元C轮融资、生数科技B+轮单笔融资5亿美元,三家公司融资合计已经超过了百亿元,接近了独角兽的估值门槛。

第二类所聚焦于具身智能基础模型的企业是当前独角兽密度最高的方向——智元机器人(估值150亿+)、星海图(估值200亿)、智平方(估值百亿+)、银河通用(估值百亿+)均属此列,自变量在投后估值方面亦突破200亿元。

第三类所面向的是机器人技能生成以及动作执行方面的企业(逐际动力与跨维智能等均属此类),其融资阶段整体处于较为早期的位置,公开的融资信息相对有限,目前尚无独角兽级别的公司从中跑出。

可以看到,资本对“离物理世界交互更近”的这一方向的倾斜表现得较为明显,但对“离内容生成更近”的这一方向同样会保持相应的投入。

“世界模型目前所处阶段就如同2010年的移动互联网,”一位VC内部人士对《科创板日报》记者表示,“我们也不知道哪个方向最终能够跑出来,但我们知道如果不投资就一定会错过。”

资本确实已经来了,而且来得不慢。产业资本中,华为哈勃以及小米战投等相继入局;市场化VC里,顺为资本、红杉中国等在多个头部项目中密集落子;国家队方面,社保基金、中网投以及中国国新等相继进行布局;地方国资层面,杭州、厦门以及湖北等多地同步跟进。四种不同性质的资本在同一赛道交汇,百亿级的资金已经进来了。

这些资金最终能烧出什么,是实现了技术突破、形成了商业模式,还是仅仅一场估值游戏,这将取决于这些公司能否把“世界模型”从一个概念转变成可交付的产品。在此之前,分歧以及竞速都将继续。

来源:通往AGI的岔路口:谁在押注世界模型 | 财联社

声明:本文来自财联社,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯