2026-07-31 · AI 资讯
通义千问发布Qwen-Audio-3.0语音模型,深耕行业场景
7月31日,阿里通义千问正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,该模型在长音频上下文处理及专业术语识别方面实现重大突破,目前已在阿里云百炼平台开放调用。新模型的核心竞争力在于其行业词库的自适应能力,无需额外训练即可大幅提升医疗、IT编程等领域的专业术语召回率。
模型在五大维度实现性能跃升:长音频上下文具备跨片段记忆,解决了复杂会议中人名与术语的一致性难题;内置多行业词库配合分级热词定制,使识别精度达到了行业领先水平;集成的语音润色功能可实现去口头禅、语义重组,显著提升输出文稿的可读性;一套模型覆盖30余种语言,在跨国场景下表现出色。
此外,同期推出的 Qwen-Audio-3.0-ASR-Streaming 模型专注实时场景,出字延迟仅300毫秒,中文与英文识别错字率均处于行业领先地位。作为曾多次在 Artificial Analysis 评测中夺冠的系列续作,该模型已广泛应用于智能客服、教育录播及大型会议纪要整理。
