阿里巴巴正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心目标很直接——让 AI 精准听懂专业词汇。模型在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,同时具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT 编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。在最新行业词汇内部评测中,新模型对各行业专业词的"听中率"均有明显提升,其中医疗场景更是突破了 95.36%。
三个版本覆盖五大场景,已拿全球第一
Qwen-Audio-ASR-Flash 系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到验证,此前曾在 AI 评测平台 Artificial Analysis 上以 1.7% 的错字率拿下全球第一。这意味着在真实的办公和教育环境中,AI 语音转文字的准确度已经摸到了可用性的天花板。
目前该模型已通过阿里云百炼平台开放调用,提供三个版本:实时语音识别最长 5 分钟的 Flash 版、离线文件转写的 Filetrans 版,以及实时语音识别 Streaming 版。当 AI 不仅"能听",还能听懂你行业里那些拗口的专业术语,语音交互的最后一公里,或许就快跑通了。