通义大模型开源语音AI双升级：Fun-CosyVoice3实现3秒音色克隆，Fun-ASR嘈杂环境识别率达93%

12月15日，通义大模型团队宣布其语音大模型Fun-CosyVoice3与Fun-ASR完成重大升级并同步开源。此次升级聚焦核心性能与实用性，为开发者与企业提供更强大的语音AI工具。

Fun-CosyVoice3作为实时语音合成模型，首包延迟降低50%，实现“输入即发声”的流畅体验。中英混说错误率大幅下降56.4%，显著提升含专业术语、大小写混排等复杂场景的发音精准度。该模型支持9种通用语言、18种中文方言及9种情感控制，并在zero-shot TTS评测中实现内容一致性提升26%，接近人类录音水平。其开源版本Fun-CosyVoice3-0.5B具备突破性音色克隆能力，仅需3秒参考音频即可跨语种复刻音色，支持粤语、日语、英语等多语言合成。

同步升级的Fun-ASR模型在嘈杂环境下识别准确率达93%，新增歌词与说唱识别功能。其流式识别首字延迟仅160毫秒，支持31种语言自由混说及多种中文方言。轻量化版本Fun-ASR-Nano-0.8B将参数量压缩至0.8亿，显著降低推理成本。

目前两款模型已在魔搭、HuggingFace及GitHub等平台开源，适用于语音助手、直播配音、无障碍阅读及视频会议等场景。通义团队表示，此次升级标志着语音合成与识别技术向实时化、精准化迈出关键一步。

文章版权归作者所有，未经允许请勿转载。

通义大模型开源语音AI双升级：Fun-CosyVoice3实现3秒音色克隆，Fun-ASR嘈杂环境识别率达93%

谷歌整合Gemini与NotebookLM：AI交互精准度迎来重大升级

LG电视强制预装微软Copilot AI应用引争议，用户选择权与AI集成矛盾凸显

相关文章

快手可灵AI数字人技术重大升级：突破60秒长视频生成，实现精准表情动作控制

阿里巴巴瓴羊推出行业首款数据分析Agent系统，10秒响应20分钟生成专业报告

中国开放权重AI模型实现技术超越与全球市场渗透，推动全球AI竞争格局重构

OpenAI Sora2震撼发布：AI视频生成进入GPT-3.5时刻，四天登顶美国应用榜

最新资讯

热门AI工具

热门资讯