该系列包含三款自研语音模型:语音识别大模型Qwen-Audio-3.0-ASR、语音合成大模型Qwen-Audio-3.0-TTS,以及实时语音交互对话模型Qwen-Audio-3.0-Realtime。
依托Hy3基座大模型打通声学识别与语义理解,彻底摆脱传统语音识别生硬转写短板,在多方言口音、嘈杂收音、远距离拾音等复杂场景稳定输出精准文本。
该模型基于最新大语言模型Hy3,融合语音识别与深度语义理解,旨在从“逐字转写”演进为“理解语境、兼容场景”。
在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”都有明显提升,其中医疗场景更是突破了 95.36%。
阿里升级Fun-ASR-Realtime语音识别模型,支持30种语言+16种方言
博客中国于2002年8月由博客教父方兴东创立。作为中国博客发源地,博客中国汇聚国内众多具新锐思想的意见领袖,是中国最具影响力的博客平台。“每天5分钟,给思想加油”是我们的宗旨!
近日,国家知识产权局公开信息显示,北京全科在线科技有限责任公司提交了一项名为“基于大模型医学会议内容分析方法”的专利申请,公开号为CN121842449A,申请时间为2025年12月。系统首先对音频进行语音识…
千问上线Qwen3.5-Omni 具备全模态感知与生成能力
科大讯飞AI眼镜亮相:支持多模态同传翻译,仅重40克
岁寒,然后知松柏之后凋也
豆包发布语音识别模型2.0,支持多模态视觉识别和13种海外语种识别
更像是字节对微信的又一次突袭
豆包输入法宣布正式上线!没广告 语音识别错误率比友商低50%
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16