Token导航 LogoToken导航

Qwen-Audio-3.1发布 覆盖识别合成与实时对话

更新时间 2026-09-24来源 AIGC开放社区正文 2462字阅读约 8分钟
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

语音模型正在从“把声音转成文字”,走向“理解声音、生成声音,再直接完成任务”。

阿里这次更新的Qwen-Audio-3.1系列,集中覆盖语音识别、语音合成、实时交互和音频创作。公开信息中涉及ASR、ASR-Next、TTS、TTS-Next和Realtime五个模型或方向。

其中最有辨识度的,是Qwen-Audio-3.1-TTS-Next。它不再只负责把文字读出来,而是尝试把人物对白、环境声和动作音效一次生成出来。

先让语音转写更像一份成稿

传统语音识别的结果,往往是一大段没有层次的文字。多人说话时,谁在发言、什么时候插话,通常还要人工整理。

Qwen-Audio-3.1-ASR把重点放在了上下文和结构化处理上。

它支持多语种和中文方言识别,可以输出说话人标签、时间戳和转写文本,也能结合上下文识别人名、行业词和专业术语。

在会议、访谈和客服场景中,模型不仅要记录“说了什么”,还要尽量还原“谁说的”和“先后顺序”。

它还加入了转写润色能力,可以删除部分语气词和重复表达,再把口语重新组织成更适合阅读的文本。

根据公开介绍,Qwen-Audio-3.1-ASR支持30种语言和16种中文方言,并支持流式识别。对于会议纪要、直播字幕、访谈整理和跨语言沟通,这类能力比单纯提高几个识别指标更容易转化为实际体验。

ASR-Next开始理解声音里的“现场”

如果说ASR主要负责听清楚人说的话,那么ASR-Next处理的范围更大。

一段音频里可能同时存在人物对话、背景音乐、机器运转声、风声和脚步声。ASR-Next尝试识别这些声音,并进一步回答音频中发生了什么。

它可以用于声音描述、事件定位和音频问答。例如,模型不仅能转写一段采访,还能识别其中的笑声、掌声和背景音乐;面对设备录音,也可以辅助判断异常声音出现的大致时间。

这意味着语音模型的输入对象,正在从“人声”扩展到“完整声音场景”。

对于会议分析、视频内容理解、设备巡检和客服质检,这会带来更多应用空间。不过在工业、医疗和安全等场景中,它更适合作为辅助分析工具,最终判断仍需要专业流程接管。

TTS-Next把音效也纳入生成流程

Qwen-Audio-3.1-TTS-Next是这次更新里最容易引起内容创作者兴趣的模型。

过去,制作一段完整音频通常要经过配音、音效、环境声和后期混音多个环节。TTS-Next试图把这些工作合并到一次生成中。

根据阿里云模型文档,TTS-Next支持文本和参考音频输入,可以生成包含对白、环境声和音效的完整音频,适用于播客、有声书、影视、游戏和短视频制作。

比如,用户可以输入一段有声书脚本,要求模型生成旁白、两名角色对白、街道环境声和开门声;也可以为一段游戏剧情同时安排人物台词、脚步声、风声和背景氛围。

模型还支持多角色声音和情绪控制。对于连续内容而言,角色不能每句话都像换了一个人,音色保持、情绪衔接和对白节奏都会影响最终效果。

这并不意味着专业音频后期会消失。对于影视和游戏项目,音量、混音、节奏和版权素材依然需要人工处理。但在短视频、播客和有声内容中,制作流程确实可能被压缩。

TTS模型开始关注跨语言表达

Qwen-Audio-3.1-TTS主要负责语音合成。

它支持多语种和方言合成,并尝试让同一音色在不同语言之间保持相对一致。用户还可以用自然语言控制语速、情绪和表达方式。

这类能力适合虚拟角色、智能客服、配音和跨语言内容制作。

过去,一条中文内容如果要制作英文、日文或其他语言版本,通常需要重新寻找配音演员和录音。现在,模型可以先保留角色声音,再完成不同语言的表达。

但跨语言合成并不只是“换一种语言朗读”。口音、停顿、情绪和文化表达都可能影响自然度。模型是否适合专业配音,仍然要看具体语言和内容类型。

Realtime模型让语音交互更接近通话

Qwen-Audio-3.1-Realtime面向实时语音交互。

阿里云公开文档显示,该模型支持音频和文本双向输入输出,并提供函数调用、联网搜索和声音克隆等能力。

与传统语音助手相比,实时双工模型更强调“边听边说”。用户不必等模型说完再开口,可以随时打断、补充条件或改变要求。

这种交互方式更接近真人通话,也更适合车载语音、智能眼镜、客服和办公助手。

如果模型能够在持续对话中记住上下文、理解语气变化,并在需要时调用外部工具,那么语音助手就不再只是一个问答入口,而可能成为可以持续执行任务的Agent。

当然,实时场景对延迟、打断处理、事实准确性和安全边界要求更高。声音听起来更自然,只是第一步。

价格调整降低了语音应用的使用门槛

伴随Qwen-Audio-3.1发布,阿里云还对部分音频模型的价格进行了调整。

语音识别、配音和实时交互的调用成本下降后,开发者更容易把这些能力加入会议记录、客服质检、短视频制作和智能硬件,而不是只在演示环节调用。

不过,实际成本还要结合音频时长、并发量、区域、模型版本和实时模式计算。对于企业用户来说,稳定性、响应速度和调用限制同样重要。

结语

Qwen-Audio-3.1系列的变化,不是简单增加几个语音模型,而是把音频处理拆成了一套更完整的工具链:

ASR负责听清和整理,ASR-Next负责理解环境声音,TTS负责生成自然语音,TTS-Next负责制作完整音频,Realtime则负责持续交流和工具调用。

用户最终感受到的,可能不是模型名称增加了多少,而是语音应用开始变得更像一个真正的工作入口:它能听懂会议内容,也能把脚本变成成片;能回答问题,也能在对话中继续执行任务。

从“识别声音”到“生成一个完整的声音世界”,Qwen-Audio-3.1正在把语音模型的边界往前推了一步。

参考资料

阿里云:全栈AI战略与Qwen-Audio系列更新

Qwen-Audio-3.1-TTS-Next官方文档

Qwen-Audio-3.1-Realtime官方文档

Qwen-Audio-3.1-ASR官方文档

文章标签Qwen阿里云
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多