通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源 可实现极速克隆音色
智通财经网·2025-12-15 08:40
智通财经APP获悉,12月15日,"通义大模型"微信公众号发文表示,通义百聆语音模型再升级,本次发 布包括:Fun-CosyVoice3模型升级,首包延迟降低50%,中英混字准确率翻倍,支持9语种 18方言口 音、跨语种克隆与情感控制;Fun-CosyVoice3(0.5B)正式开源,该版本提供了zero-shot音色克隆能力, 只需要提供一段3秒以上的参考音频,即可复刻其音色并合成新语音,并且支持本地部署和二次开发。 此外,通义推出轻量化版本Fun-ASR-Nano模型,总参数量压缩到0.8B,推理成本更低,现已开源,支 持本地部署与定制化微调。 首包延迟降低50%,支持双向流式合成,真正实现"输入即发声",适用于语音助手、直播配音、无障碍 阅读等实时场景; 通义团队称,本次Fun-CosyVoice3大模型完成多项关键升级: 9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力——用一段普通话录音,即可 生成粤语、日语、英语等语音,音色保持高度一致。 Fun-ASR模型能力同样得到了增强。作为通义百聆推出的端到端语音识别大模型,Fun-ASR 基于数千万 小时真实语音数据训练,已在钉钉"A ...