Token导航 LogoToken导航

微软发布三款语音AI模型 MAI-Transcribe-2-Streaming登准确率榜首

更新时间 2026-10-02来源 华尔街见闻正文 2669字阅读约 9分钟1 张图片

微软加速补齐语音AI能力。美东时间10月1日,微软发布三款新的语音模型,包括实时语音转文字模型 MAI-Transcribe-2-Streaming,以及文本转语音模型 MAI-Voice-2.1 和更低延迟的 MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基准测试平台Artificial Analysis的流式语音识别测试中拿下准确率第一。

AI基准测试与分析平台Artificial Analysis公布数据显示,MAI-Transcribe-2-Streaming的最终转录词错误率(WER)为2.5%,在38款模型中表现最佳;从说话结束到返回最终文本仅需约0.13秒。在更强调实时性的“首次部分转录”测试中,其WER同样为2.5%,延迟约0.12秒。相比之下,此前排名第一的SpaceXAI Grok Voice Transcribe 2.0最终WER为2.7%、延迟0.49秒。

实时转录冲到第一,微软瞄准“边听边行动”

此次发布的核心模型是MAI-Transcribe-2-Streaming。微软称,该模型支持60种语言,并能够持续自动识别语言,不必等到用户一句话说完后才开始输出文字。

与传统语音转文字模型“听完—处理—输出”的模式不同,流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。微软表示,模型能够在接收到音频后100多毫秒就开始产生首批结果。

这意味着语音AI的应用场景可以从单纯“把声音变成文字”,进一步向实时交互延伸。例如,在客服场景中,AI智能体可以在用户尚未说完一句话时就开始识别需求;语音助手则可以提前进行推理、准备工具调用,而不是等用户说完后才启动整个处理流程。

微软称,在实时听写和字幕等应用中,其内部测试显示,文字出现速度约为最接近竞争对手的两倍。

Artificial Analysis的测试也显示了这一特点:MAI-Transcribe-2-Streaming的最终WER为2.5%、延迟0.13秒,均优于Grok Voice Transcribe 2.0的2.7%和0.49秒;Muse Voice Transcribe的WER为3.1%、延迟0.16秒,ElevenLabs Scribe v2 Realtime则为3.6%和0.14秒。

不过,速度并非绝对领先。Artificial Analysis数据显示,Cartesia Ink Preview的最终转录延迟约0.11秒,略快于微软模型,但WER为3.1%,准确率低于微软。

每小时0.54美元,实时能力并不走“极致低价”

在价格方面,微软为MAI-Transcribe-2-Streaming提供了每小时0.54美元的年末前优惠价格,相当于每1000分钟9美元。微软表示,该模型目前处于面向开发者的推广阶段。

从Artificial Analysis的横向比较看,0.54美元/小时处于主流流式语音模型价格的相对较高位置:与Gemini 3.5 Transcribe Live的约9美元/1000分钟相当,高于ElevenLabs Scribe v2 Realtime和Deepgram Flux的约6.50美元,也明显高于Cartesia Ink-2约4美元和Muse Voice Transcribe约3美元。

这也意味着微软此次并非单纯通过低价抢市场,而是试图将准确率、延迟和企业级部署能力结合起来。

微软此前9月推出的非流式MAI-Transcribe-2主打准确率、说话人识别、时间戳和复杂真实场景等能力,目前支持60种语言。微软当时称,该模型在FLEURS基准测试中平均WER为5.2%,并在Artificial Analysis的准确率与延迟测试中位于Pareto前沿。

一端“听得快”,另一端“说得快”

除了转录模型,微软此次还发布MAI-Voice-2.1和MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。

其中,MAI-Voice-2.1支持23种语言、26个地区/语言环境,微软强调,同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。这意味着开发者可以让一个AI助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。

MAI-Voice-2.1的价格为每100万字符22美元,更适合对语音表现力要求较高的场景;MAI-Voice-2.1-Flash则面向对延迟和成本更加敏感的应用,价格降至每100万字符15美元。微软称,Flash版本的模型推理速度提升55%,成本较可比模型低约60%。

微软还表示,两款模型均支持基于数秒参考音频进行声音克隆,并加入同意机制等安全措施。

从产品组合来看,微软此次实际上是在同时压缩语音AI交互的两端延迟:MAI-Transcribe-2-Streaming负责快速“听懂”,MAI-Voice-2.1-Flash负责快速“说出”。微软称,两者结合后,可以为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。

微软继续补齐自研AI模型矩阵

此次发布也延续了微软今年以来扩大MAI自研模型矩阵的动作。

微软此前已经推出MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash以及MAI-Image系列模型,并将这些模型逐步接入Microsoft Foundry以及Copilot、Teams、GitHub、Dynamics 365等产品和服务。

其中,MAI-Transcribe-2目前已经覆盖会议记录、视频字幕、客服文档、无障碍服务以及语音智能体等场景;微软此次进一步加入实时流式版本,意味着其自研模型的竞争重点正从单项识别准确率,转向实时语音智能体完整链路。

对于微软而言,这一方向的意义并不只在于增加几个模型。随着AI智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。

此次MAI-Transcribe-2-Streaming在Artificial Analysis测试中登顶,至少显示微软在语音AI这一细分赛道正在加速追赶并进入第一梯队。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多