Token导航 LogoToken导航TokenDH.com

微软发布新一代语音合成模型MAI-Voice-2

更新时间 2026-06-04来源 品玩正文 432字阅读约 2分钟1 张图片

品玩6月4日讯,微软近日宣布正式推出新一代文本转语音模型MAI-Voice-2。该模型作为目前表现最出色的语音合成技术,已在保真度、语言覆盖、说话人一致性及情感范围等多个维度实现显著提升,旨在为品牌助手、有声读物及无障碍服务等对语音质量要求严苛的场景提供核心支持。

MAI-Voice-2将语言支持从单一英语扩展至15种语言,并保留了与英语同等的自然度与表现力。其核心功能包括通过情感标签实现的精细情感控制(如悲伤、耳语、兴奋等),以及仅需5至60秒参考音频即可实现的零样本语音生成。为确保负责任的部署,系统内置了基于授权的同意机制,仅允许合成获得许可的授权声音。

在性能方面,对比测试显示MAI-Voice-2的受欢迎程度较前代高出72%。模型在长篇内容中能保持稳定的说话人身份,并支持印地语-英语、西班牙语-英语等语言对的自然语码转换。目前,该模型已在Azure Foundry上线,并正集成至VSCode及Dynamics 365 Contact Center等产品中。

文章标签微软模型发布
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多