Token导航 LogoToken导航TokenDH.com

翻译不只听声音了:千问Qwen3.8-LiveTranslate 开始“看懂”实时现场

更新时间 2026-09-20来源 AIGC开放社区正文 2182字阅读约 7分钟
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

跨语言会议最容易冷场的时刻,往往不是翻译出错,而是所有人都在等翻译。

有人说完一句,字幕还没出来;字幕终于出现,下一位发言者已经开口。多人同时说话时,系统还可能分不清声音和译文到底属于谁。

千问近日推出实时同声传译模型 Qwen3.8-LiveTranslate,重点放在说话人分离、原文与译文同步,以及声音和画面结合的实时翻译上。

同传先要知道“谁在说话”

传统实时翻译大多按照“语音识别—机器翻译—语音合成”的顺序工作。

一个人安静讲话时,这条链路能够正常运行。换到会议、访谈或直播现场,情况就复杂多了:发言人会打断彼此,声音会重叠,系统也很难及时判断一句话属于谁。

Qwen3.8-LiveTranslate加入了实时说话人分离功能。模型不只需要识别内容,还要尽量区分不同发言者,并将译文对应到具体声音。

这个变化看起来不如“准确率提升”醒目,却直接关系到产品能不能进入真实会议。用户需要知道的不只是译文内容,还要知道这句话是谁说的。

模型还支持原文和译文同步输出。会议字幕可以保留双语对照,直播画面也不必完全覆盖原始字幕。对于需要核对人名、数字和专业术语的场景,这种呈现方式更加实用。

画面也参与了翻译

Qwen3.8-LiveTranslate处理的不是单纯的音频。

QwenCloud文档显示,qwen3.8-livetranslate-flash-realtime支持音频和图像输入。接入视频流时,开发者可以把声音和画面帧一起发送给模型,系统再利用屏幕文字、字幕、唇形和现场画面辅助理解。QwenCloud实时翻译文档

这类视觉信息,往往决定了一句话到底该怎么翻。

演讲者提到一个缩写,投影屏幕上可能已经显示了完整名称;主持人说出一个人名,画面下方可能同时出现字幕;一句话存在多个同音词,镜头中的产品或设备可以帮助模型缩小判断范围。

千问将这套处理方式称为 Interleave架构。按照技术介绍,模型把音频、画面、原文和译文按时间顺序交织处理,而不是将不同模态完全割裂。

模型结构采用Hybrid-MoE的Thinker–Talker双模块设计:Thinker负责理解语音、画面和上下文,Talker负责生成译文文本或语音。千问技术博客

它试图做的,是在信息持续进入时不断更新判断,而不是等整句话结束后再启动下一步。

支持60种语言

千问公开资料显示,Qwen3.8-LiveTranslate支持60种语言。

这个数字需要拆开看。按照开发者文档,其中29种语言支持文本和语音输出,另外31种主要提供文本输出。也就是说,60种语言代表模型的语言覆盖范围,并不表示每种语言都支持完全相同的语音互译能力。

对开发者而言,具体语言组合比总数量更重要。

跨境会议需要确认目标语言能否语音输出;字幕制作更关心文本翻译覆盖面;在线客服则要继续考察延迟、专业术语和多轮交流的稳定性。

模型同时提供热词配置、说话人识别、声音保持和声音克隆等能力。企业可以提前加入品牌名、车型名、药品名和行业缩写,降低专有名词被识别错误的概率。

声音克隆能够让译文保留原说话人的音色,但这项能力进入直播、会议录音和内容二次分发时,也需要同步考虑授权和提示。

2.3秒很快,但现场变量更多

千问研究页面介绍,模型的平均滞后指标LAAL从2.8秒降至2.3秒,QwenCloud文档也将2.3秒作为实时翻译的延迟描述。

同传延迟越低,译文越接近现场交流,而不是事后字幕。不过,公开指标不等同于所有环境下的实际体验。

网络状况、音频质量、背景噪声、说话速度、多人切换以及输出方式,都会影响响应时间。文本输出和语音输出也可能存在差异。

千问技术博客还公布了多说话人长音频和多语言测试结果,并称模型在多个维度上优于上一代及部分主流实时同传系统。这些属于千问公开的测试结果,目前不能直接视为独立第三方结论。

真正的难题在模型之外

从开发者文档来看,Qwen3.8-LiveTranslate-Flash-Realtime主要通过实时API接入,开发者可以选择只返回文本,也可以同时返回文本和音频。

这使它更像一套可嵌入其他产品的实时翻译能力,而不是一个面向普通用户的独立应用。

会议软件、直播平台、在线课程和跨境客服要解决的,不只是模型能不能翻译,还包括一整套工程问题:

音频多久切分一次;多人发言如何标记;画面帧怎样发送;译文如何和原文同步;网络中断后怎样恢复;用户能否在文字和语音之间切换。

千问已经开放了WebSocket接入、音频和图像输入、文本及音频输出,以及热词和声音克隆等配置。开发者获得了更大的组合空间,也需要承担更多系统调试工作。

实时同传最难的地方,始终不是安静环境中的单句翻译,而是嘈杂、混乱、不断变化的现场。

背景有人走动,发言人突然换语言,几个人互相打断,屏幕上出现大量专业名词,网络又不稳定——这些情况叠加在一起,才能真正检验模型的价值。

Qwen3.8-LiveTranslate的方向已经从“听到一句、翻译一句”,转向同时理解声音、画面、人物和上下文。

它能否让会议真正少一些等待,还要看不同语言、不同网络和真实业务中的长期使用。但至少在产品路线层面,实时同传的竞争已经不只是“翻得准不准”,还包括能不能更少打断现场。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多