9月16日,科大讯飞发布语音基座大模型 Spark-Audio-1.0-Preview。最扎眼的标签是"全国产"——这个模型基于全国产化算力训练而成,从底层就把供应链风险挡在了门外。
能力上,Spark-Audio-1.0-Preview 支持文本和语音两个模态的输入、以文本模态输出,能接的活儿相当杂:语音转写、多语言翻译、多方言识别只是基本功,环境音识别、说话人识别、情感分析以及复杂的音频问答也都在射程之内。它一口气覆盖99种语言和202种方言识别,讯飞把这总结为智能语音完成从"听清"到"听懂"的跃升——过去机器追求把声波准确转成文字,现在它要分辨是谁在说、语调里藏着什么情绪、背景里有什么声音。
目前 Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。



京公网安备 11011402013531号