黑森林实验室发布Flux3多模态模型,首次支持20秒原生音视频同步生成

2026年07月24日 10:36
本文共计556个字,预计阅读时长2分钟。
来源/aibase 责编/Zhuangdian 妆点人生

 7月23日,德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型Flux3,标志着生成式视频技术迎来重大突破。该模型基于Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,实现了对物理与数字环境的统一理解与生成。

QQ20260724-100544.jpg

作为首款支持原生音频生成的模型,Flux3可一次性输出长达20秒的音视频同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与Seedance2.0及Gemini Omni Flash等顶尖模型的对标中保持微弱优势。

此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。BFL采取分阶段推出策略,Flux3Video现已上线,Flux3Image与开源权重的“Flux3Dev”也将在近期陆续发布。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。

来源:黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/