当前位置：首页 » 资讯 » 新科技 » 正文

通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源可实现极速克隆音色

IP属地中国·北京 智通财经 时间：2025-12-15 18:22:11

智通财经APP获悉，12月15日，“通义大模型”微信公众号发文表示，通义百聆语音模型再升级，本次发布包括：Fun-CosyVoice3模型升级，首包延迟降低50%，中英混字准确率翻倍，支持9语种 18方言口音、跨语种克隆与情感控制；Fun-CosyVoice3(0.5B)正式开源，该版本提供了zero-shot音色克隆能力，只需要提供一段3秒以上的参考音频，即可复刻其音色并合成新语音，并且支持本地部署和二次开发。此外，通义推出轻量化版本Fun-ASR-Nano模型，总参数量压缩到0.8B，推理成本更低，现已开源，支持本地部署与定制化微调。
通义团队称，本次Fun-CosyVoice3大模型完成多项关键升级：
首包延迟降低50%，支持双向流式合成，真正实现“输入即发声”，适用于语音助手、直播配音、无障碍阅读等实时场景；
中英混说词错误率(WER)相比之前降低 56.4%，不论是含专业术语、大小写混排，还是语码转换的句子，都能精准、自然地发音；
在 zero-shot TTS评测中，内容一致性与音色相似度全面提升，复杂场景(test-hard)字符错误率(CER)相对降低 26%，接近人类录音水平；
9种通用语言、18种中文方言、9种情感控制，并具备跨语种音色复刻能力——用一段普通话录音，即可生成粤语、日语、英语等语音，音色保持高度一致。
Fun-ASR模型能力同样得到了增强。作为通义百聆推出的端到端语音识别大模型，Fun-ASR 基于数千万小时真实语音数据训练，已在钉钉“AI听记”、视频会议等场景中大规模落地。本次，通义对 Fun-ASR 的核心能力进行了全面升级，重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力，并将流式识别模型的首字降低到160ms。

免责声明：本网信息来自于互联网，目的在于传递更多信息，并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益，请及时联系我们，本站将会在24小时内处理完毕。

同类资讯

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

机器人伴侣来了！10天预售3800台搭载养成系情感大模型

SpaceX历史性IPO后，马斯克称将深化与英伟达的关系

全站最新

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

热门推荐

智谱宣布GLM-5.2面向GLM Coding Plan全量用户开放

标致“纯电小钢炮”E-208 GTi发布：281马力5.5秒破百，42900欧元

首尔禁止中小学生戴AI眼镜参加期末考试，否则将一律按作弊处理

江淮汽车总经理李明：要让尊界等优秀产品惠及全球用户

机器人伴侣来了！10天预售3800台搭载养成系情感大模型

SpaceX历史性IPO后，马斯克称将深化与英伟达的关系

今夜过后，马斯克成为人类首位万亿富翁

萝卜快跑在瑞士启动道路测试 2027年将实现常态化运营

Anthropic：最先进模型，外国人禁用

网传阿里合伙人周靖人拟离职，仅出任阿里首席科学家6天

人物 | 陈宇森，那个让AI管人的技术极客，开启钉钉新时代

雷军用小米YU7装120箱车厘子共600斤，被指违规！刚刚直播回应：是卡车送过来的，是在封闭道路分装

湾区“造芯”更“追光”，粤芯闯关创业板

苹果为折叠屏iPhone Ultra铺路：iOS 27新增多款原生应用横屏模式

华为鸿蒙NEXT座舱发布计划公布，预计年底商用

首页

资讯

财经号

智能车

专题

电商资讯

人物资讯

滚动资讯

首页

新科技

新金融

新零售

智能车

房地产

科技探索

人物资讯

网络游戏

人工智能

专题

通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源可实现极速克隆音色

首页

资讯

财经号

智能车

专题

电商资讯

人物资讯

滚动资讯

通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源 可实现极速克隆音色

同类资讯

通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源可实现极速克隆音色