MiniMax正式发布全模态视频模型H3 并承诺开源权重

2026年07月31日 11:52
本文共计574个字,预计阅读时长2分钟。
来源/aibase 责编/huazi56 爱力方

在文本大模型领域持续发力之后,人工智能企业 MiniMax 于近日正式推出了全新的全模态生成模型MiniMax H3,并向行业承诺将在几天内全面开源模型权重。

作为一款支持多模态上下文输入的生成模型,MiniMax H3能够同时接收文本、图像、视频以及声音的任意组合作为输入,并最终输出带有原生双声道音频的高清视频。在实际应用中,用户只需向模型提供参考视频、图片或音频素材,并结合自然语言指令,即可一气呵成完成复杂的视听内容创作。

image.png

在技术架构上,MiniMax H3彻底打破了传统多模态模型按任务拆分专家模型的做法。研发团队将文生图、文生视频、图到视频以及音频处理等多种任务全部整合进同一个预训练框架中,推出了更简洁的 H3-Omni Transformer 架构,使端到端训练吞吐量提升了近30%。同时,通过重写 Tokenizer 带来的 H3-VAE 架构,实现了极高的压缩率,有效降低了高分辨率下的推理成本。

在定价与生态方面,MiniMax H3在2K 分辨率下的每秒价格不到主流同类模型的三分之一,同时在设计初期便充分考虑了对国产芯片的兼容性。目前,该模型在电影片头、游戏 UI 动画、动态海报以及广告电商等场景中展现出广阔的应用潜力,其对文字渲染和品牌信息呈现的准确度也得到了显著提升。

来源:全模态视频模型迎来新突破:MiniMax正式发布H3 并承诺开源权重 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯