阿里发布Qwen-Image 3.0,支持4.5K Token超长输入与复杂图文生成

2026年07月21日 15:37
本文共计743个字,预计阅读时长3分钟。
来源/aibase 责编/XingzheWujiang 行者无疆

阿里正式发布新一代图像生成基础模型Qwen-Image-3.0。作为千问图像生成与编辑系列的第三代基础模型,新模型支持最高4.5K Token超长文本输入,可一次性生成包含公式符号、几何图形、逻辑推导、多层UI界面等复杂内容,并原生支持12种语言和20余款字体渲染,进一步提升商业级图文内容生成能力。

QQ20260721-151544.jpg

相比上一代模型,Qwen-Image-3.0将文本输入长度提升至4.5倍,在影视分镜、知识图解、产品说明页等依赖长提示词的场景中,用户无需压缩需求,可像撰写设计文档一样完整描述画面结构、文案内容、视觉风格和版式细节,从而获得更加精准的生成结果,降低反复修改和人工调试成本。

在复杂内容理解方面,Qwen-Image-3.0进一步强化了语义解析和空间布局能力,能够一次生成覆盖多个主题的九宫格知识图解,兼顾文字清晰度与内容准确性。同时,模型支持复杂逻辑嵌套,可根据单条指令生成网页、软件界面、聊天窗口、海报等多层视觉元素组合。例如,在“VSCode编程界面中,通过千问App生成一张发布在聊天界面的手冲咖啡海报”等复杂场景下,模型能够准确理解多层UI关系,并保持各级界面风格一致,甚至对约10像素的小字号文字也能实现清晰呈现。

QQ20260721-151554.jpg

官方表示,Qwen-Image-3.0在人像摄影、数学试卷、古碑拓片、直播页面等场景均具备较强的细节还原能力,对复杂图文混排和高密度信息承载进行了重点优化。

随着生成式AI逐步进入专业设计和商业内容生产环节,图像模型的竞争正从基础画质转向复杂信息表达、可读性和工程化能力。Qwen-Image-3.0的发布,进一步推动AI图像生成向高精度、多语言和商业可用方向发展。

来源:阿里发布Qwen-Image-3.0,支持4.5K Token超长输入与复杂图文生成 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/