腾讯云李郁韬谈世界杯直播:AI首次大规模走进生产,云厂商卡位多模态

2026年07月27日 10:57
本文共计3853个字,预计阅读时长13分钟。
来源/aibase 责编/NuanxinXiaoMo 暖心小茉

腾讯云为刚刚落幕的美加墨世界杯提供了全球17个国家和地区的官方赛事直播支持,覆盖了亚太及国内三分之二的官方授权平台。腾讯云副总裁、国际产品技术负责人李郁韬在近期采访中透露,这届世界杯AI第一次大规模进入直播生产,在画质增强、智能导播、自动剪辑、智能横转竖、质检溯源等大部分环节,已经由AI全自动完成。一场世界杯的赛事支持,不过是AIGC开始迈入大规模生产应用的一个切面。

李郁韬把腾讯云要做的那一层,称作多模态领域的Harness——驾驭工程。关注的不是模型如何生成,而是从生成到稳定交付给用户之间,包括预处理、质检、拼接、转码、分发以及格式适配在内的整条产业链路。

腾讯云观察到,在生成式人工智能的浪潮下,多媒体应用正面临多重挑战,尤其是直播、点播、媒体创作以及多媒体互动等场景,受限于网络传输、视频画质以及用户体验等因素的叠加,单一模型往往只能解决一部分问题。很多厂商看到新的多模态大模型,第一反应就是把它们全部对接一遍,今天接这家,明天出了新的再接那家。对接完一定会撞上这样那样的问题。如果每一家遇到的都差不多,从客户反馈中就能提炼出一个共性诉求:应该有人帮他们把底层全部做好,让他们更专注于业务创新和上层应用。如何识别用户需求、找到能解决需求的模型、修补模型天然的一些缺陷,再把最终的服务递给用户,这恰恰是作为音视频 PaaS 云服务厂商必须啃下的挑战。

早在 6 月 5 日的腾讯云 AI 产业应用大会上,腾讯云音视频就发布了 AI 品牌 Tencent Cloud WAND,构建起 6 大自研媒体专用模型以及 60 余项 AI 能力,覆盖了内容生成、理解、处理以及编码的全链路,专门为电商、短漫剧、教育以及赛事直播等垂直场景进行了训练。李郁韬说,团队会把所有模型串起来,不仅是大语言模型,还包括多模态模型,甚至那些小参数量的画质提升模型和小参数量的应用模型——他们去年就已经动手做多模态领域的 Harness,恰好今年生成式视频模型开始变多,行业内外对 Harness 的概念和理解也愈发趋同。

值得留意的是,视频生成被业内视为继 AI Coding 之后第二个跑通商业闭环的 AI 变场景。今年以来音视频大模型赛道竞争骤然加速,格局剧烈洗牌。国内厂商商业化进程凶猛,字节旗下 Seedance、快手可灵 AI 形成了 AI 视频生成赛道的双寡头。公开数据显示,今年 3 月可灵 AI 的 ARR 已逼近 5 亿美元,一年内增长 4 倍。另有媒体报道称,截至上半年 Seedance 2.0 的 ARR 已达 20 亿美元,字节方面虽辟谣称这一收入数据偏高与实际不符,但也明确提及 Seedance 2.0 已跨过生产力质变点门槛。而海外,今年 3 月 OpenAI 宣布停止 Sora 的独立 App、API 接口及 ChatGPT 内置视频功能,退出了消费级 AI 视频生成市场。

做 To B 的产品和解决方案,生态合作被李郁韬摆在战略首位。他也坦言,团队内部一直在讨论一个问题:当从生成到交互之间的链路被不断压缩,Harness 这个生态位会不会被忽略甚至绕过?他的判断是,至少过去半年的观察下来不会,甚至 Harness 的重要性还会加强。如果把大模型当成后端的生产力,生产力的提升会显著刺激前端应用需求的增长,而且需求增长的广度会一直强于生产力的提升——大模型永远满足不了最终用户的 极致 需求,中间始终存在一个"供给关系差",这正是 Harness 存在的必要性。

In his view, the maximum opportunity for Tencent Cloud to seize the multimodal harness lies in the fact that the experiences of many audiovisual scenes are worth being redone. A second opportunity point is that in the future there will be more and stronger and more comprehensive models coming out, how to quickly apply these models to enterprise-level production services, so that the ultimate users can feel the latest big model experience, this is exactly the problem that the multimodal harness needs to solve, and constantly applying the latest models to the customers most front-end, the whole production process and tool chain then appears particularly important.

Since last year, the AI compute power has shifted from training to inference, with many vendors finding that the cost of building inference capacity has surpassed that of training. This shift has enabled numerous AIGC applications to enter large-scale production. In China, short dramas and animated dramas serve as typical examples where multimodal technologies are already in widespread use for production. In the Asia-Pacific region, video and audio solutions from Tencent Cloud lead its global outreach, holding the top position in revenue, market share, and industry perception. Over the past five years, Tencent Cloud has made internationalization a key strategic direction, channeling substantial resources into overseas infrastructure. The company has reported that its overseas operations have sustained double-digit growth for the past three years.

腾讯云音视频总经理李志成则提到无论是短剧漫剧还是电商工具类场景出海最大共性在于前期客户可能关注效果关注影响力但中后期都很关注ROI也就是到底能不能盈利能产生多少价值现在被问得最多的就是短剧电商工具的使用未来1到2年估计会慢慢普及很多用户企业都会用起来就跟以前的大语言模型一样两三年前更多是垂直行业在用现在基本全普及成了大家工作中的一部分

As the era of agents arrives, the aforementioned capabilities of Tencent Cloud will also integrate with audio-visual intelligent agents, AI hardware, embodied robots, and cloud phones, relying on global infrastructure and edge inference to support AI applications in rapid deployment to the global market and online access nearby. Li Yutao introduced that the team has currently carried out collaborations with embodied intelligence companies such as Zhijì and unmanned cleaning robot enterprises, incubating the TRRO remote real-time control, which is the remote digital human solution, to address core issues such as low-latency stable communication during artificial intervention in robots under weak networks and audio-visual data return.

面向未来,李郁韬把云厂商在多模态领域的竞争归纳为三个方向。第一个方向是多模态的训练和算力,与语言模型的训练不同,多模态领域有很大比例的投入还放在理解和生成上,未来会有大量端到端的语音交互以及端到端的视频生成,对算力的要求以及对云厂商本身基础设施的投入都很大。第二个方向是存储和数据积累,多媒体相对文字的存储量要求更高,对存储的稳定性以及数据清洗和获取的要求也不一样,大量视频需要在预训练之前做数据清洗和处理,不同模态的数据要放在一起,训练前要做的处理都与文字类迥异。第三个方向是应用生产端,云服务商提供更面向最终客户的推理服务以及综合处理的应用能力,是影响客户选择的重要因素,在创新趋势中产生的需求,如何在运营端用很好的方式帮客户满足,这一点对腾讯云同样关键。

来源:腾讯云李郁韬谈世界杯直播:AI 首次大规模走进生产,云厂商卡位多模态 Harness | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/