Token导航 LogoToken导航TokenDH.com

千问发布Qwen3.8-LiveTranslate:同传延迟降至2.3秒,还能保留你的音色

更新时间 2026-09-20来源 AIBase正文 470字阅读约 2分钟2 张图片

新一代同声传译大模型 Qwen3.8-LiveTranslate,在翻译质量、延迟、说话人识别和语音合成四个维度上全面升级。

该模型采用音频-文本交织的 Interleave 架构,将流式理解、文本输出与语音生成整合为单条因果序列,字均延迟从上一代的2.8秒压缩至2.3秒。

QQ20260920-092354.jpg

三大新增能力是本次升级的核心看点:实时说话人分离让多人交替发言时每句话归属清晰,译文语音还能稳定保留原说话人音色;原文译文同帧同出实现双语同步显示,兼顾即时理解与原文核对;长上下文消歧则通过跨轮关联历史语境,减少专有名词和指代带来的翻译歧义。

QQ20260920-092718.jpg

模型采用 Hybrid MoE 的 Thinker–Talker 双模块设计,Thinker 负责理解与翻译,Talker 负责合成保留原音色的译文语音。在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,该模型在翻译忠实度、流畅度、简洁度及说话人分离错误率上均优于当前主流实时同传系统。

目前模型已支持60种语言,API 同步上线千问 AI 平台。团队表示,下一步将聚焦端到端时延的极限压缩、跨会话长期记忆以及更多语种覆盖。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多