千问发布语音合成大模型Qwen-Audio-3.0-TTS:支持自然语言直接控制,实时版首包延迟降至300毫秒

2026年07月21日 11:28
本文共计502个字,预计阅读时长2分钟。
来源/aibase 责编/NuanxinXiaoMo 暖心小茉

大模型厂商在语音赛道的军备赛,又多了一名重量级选手。 7 月 20 日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,把说话这件事的控制权,从繁琐的参数配置交还到了一句自然语言指令手里。

这款新模型最鲜明的标签是Free-style自然语言指令控制。过去要让AI念出某种语气、节奏或风格,往往得在后台调一堆工程参数;如今用户只需用日常语言描述想要的效果,模型就能照着指令把声音合成出来,门槛被大幅削平。

更关键的是,千问为不同场景准备了两副面孔。面向实时交互的Flash版本,把首包延迟压到了 300 毫秒级别,这个量级意味着对话里的语音响应几乎感觉不到停顿,足够撑起实时问答、语音助手这类对延迟极度敏感的现场;面向高质量生成的Plus版本,则把火力集中在音质与表现力上,主攻有声书、配音、内容创作等需要细腻声音质感的任务。一条产品线,同时覆盖了快和好两条原本相互拉扯的需求曲线。

当自然语言成了控制语音的遥控器,千问这一步,把语音合成从工程活儿又往普通人的工具箱里推进了一格。

来源:千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/