当前位置: 首页 » 资讯 » 新科技 » 正文

阿里千问发布 Qwen-Audio-3.1:五款语音模型同发,ASR 价格直降 95%

IP属地 中国·北京 编辑:苏婉清 Chinaz 时间:2026-09-23 16:16:34

千问当日正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型全面进化,还重磅推出全新的音频创作模型 Qwen-Audio-3.1-TTS-Next 与音频理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同时亮相,形成覆盖“理解—生成—交互—创作”的完整音频能力栈。为进一步降低使用门槛,Qwen-Audio 全线语音模型价格均下调,其中 TTS 降约 70%、Realtime 降约 85%、ASR 降幅达 95%。

五款模型同发,ASR 价格直降 95%

Qwen-Audio-3.1-ASR 是新一代语音识别模型,新增原生转写润色能力,可自动去除语气词与重复表达并重组语义;其分角色转写能完整呈现“谁在什么时候说了什么”,为会议、访谈提供可追溯的结构化记录。该模型一套支持 30 种语言与 16 种中文方言,支持行业词与分级热词识别,并提供低延迟流式识别,首字响应约 160 毫秒。性能上,其在 KeSpeech 与 WSYue 的 11 个子集平均字错误率(CER)4.55%,中文方言内部测试集平均 CER 10.38%,AST 平均语义句准率 82.10%。

基于下代架构的 ASR-Next 则把处理对象从“语音中的文字”扩展为“完整音频信息”,可理解人物情绪、环境声与机械声,完成声音描述、事件定位与音频问答推理。在分角色 ASR 评测中,其 Flash-Next 与 Flash 版本分别取得五项和三项最优,全面优于此前的 Fun-ASR 级联系统。

语音合成方面,Qwen-Audio-3.1-TTS 支持多语种及方言合成,并让同一音色在跨语言时自然迁移,可通过指令控制情绪、语速与表达方式。新一代 TTS-Next 更进一步,围绕文本、时间戳与参考音频统一生成人声、音效与环境音,一次创作完整音频内容,并支持 48kHz 输出与细粒度时间戳控制,满足播客、有声书、影视和游戏等需求。

从听懂到创作,语音成 AI 自然入口

实时交互模型 Qwen-Audio-3.1-Realtime 采用全双工架构,可同时说和听、支持随时插话打断,并从识别文字升级为理解情绪与交流意图——识别到用户语气低落时会放慢语速、调整措辞。它还支持多语言实时切换,并在对话中调用 API、知识库与业务系统工具完成任务;基于多教师蒸馏架构,在保持低延迟的同时强化了事实可靠性与安全边界。

目前,Qwen-Audio-3.1-Realtime 正与 Qoder、千问办公等 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等智能硬件结合。在这些场景中,用户无需始终打开电脑或手机,即可通过语音直接发起任务,并在实时对话中追加条件、修改需求或了解执行情况。千问表示,Qwen-Audio 3.1 的升级并非单点指标优化,而是沿五条技术路径推进,让“能听懂、能创作、能聊天”的语音成为连接人、内容与 AI 的自然入口。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。