跨语言会议最容易冷场的时刻,往往不是翻译出错,而是所有人都在等翻译。
有人说完一句,字幕还没出来;字幕终于出现,下一位发言者已经开口。多人同时说话时,系统还可能分不清声音和译文到底属于谁。
千问近日推出实时同声传译模型 Qwen3.8-LiveTranslate,重点放在说话人分离、原文与译文同步,以及声音和画面结合的实时翻译上。
同传先要知道“谁在说话”
传统实时翻译大多按照“语音识别—机器翻译—语音合成”的顺序工作。
一个人安静讲话时,这条链路能够正常运行。换到会议、访谈或直播现场,情况就复杂多了:发言人会打断彼此,声音会重叠,系统也很难及时判断一句话属于谁。
Qwen3.8-LiveTranslate加入了实时说话人分离功能。模型不只需要识别内容,还要尽量区分不同发言者,并将译文对应到具体声音。
这个变化看起来不如“准确率提升”醒目,却直接关系到产品能不能进入真实会议。用户需要知道的不只是译文内容,还要知道这句话是谁说的。
模型还支持原文和译文同步输出。会议字幕可以保留双语对照,直播画面也不必完全覆盖原始字幕。对于需要核对人名、数字和专业术语的场景,这种呈现方式更加实用。
画面也参与了翻译
Qwen3.8-LiveTranslate处理的不是单纯的音频。
QwenCloud文档显示,qwen3.8-livetranslate-flash-realtime支持音频和图像输入。接入视频流时,开发者可以把声音和画面帧一起发送给模型,系统再利用屏幕文字、字幕、唇形和现场画面辅助理解。QwenCloud实时翻译文档
这类视觉信息,往往决定了一句话到底该怎么翻。
演讲者提到一个缩写,投影屏幕上可能已经显示了完整名称;主持人说出一个人名,画面下方可能同时出现字幕;一句话存在多个同音词,镜头中的产品或设备可以帮助模型缩小判断范围。
千问将这套处理方式称为 Interleave架构。按照技术介绍,模型把音频、画面、原文和译文按时间顺序交织处理,而不是将不同模态完全割裂。
模型结构采用Hybrid-MoE的Thinker–Talker双模块设计:Thinker负责理解语音、画面和上下文,Talker负责生成译文文本或语音。千问技术博客
它试图做的,是在信息持续进入时不断更新判断,而不是等整句话结束后再启动下一步。
支持60种语言
千问公开资料显示,Qwen3.8-LiveTranslate支持60种语言。
这个数字需要拆开看。按照开发者文档,其中29种语言支持文本和语音输出,另外31种主要提供文本输出。也就是说,60种语言代表模型的语言覆盖范围,并不表示每种语言都支持完全相同的语音互译能力。
对开发者而言,具体语言组合比总数量更重要。
跨境会议需要确认目标语言能否语音输出;字幕制作更关心文本翻译覆盖面;在线客服则要继续考察延迟、专业术语和多轮交流的稳定性。
模型同时提供热词配置、说话人识别、声音保持和声音克隆等能力。企业可以提前加入品牌名、车型名、药品名和行业缩写,降低专有名词被识别错误的概率。
声音克隆能够让译文保留原说话人的音色,但这项能力进入直播、会议录音和内容二次分发时,也需要同步考虑授权和提示。
2.3秒很快,但现场变量更多
千问研究页面介绍,模型的平均滞后指标LAAL从2.8秒降至2.3秒,QwenCloud文档也将2.3秒作为实时翻译的延迟描述。
同传延迟越低,译文越接近现场交流,而不是事后字幕。不过,公开指标不等同于所有环境下的实际体验。
网络状况、音频质量、背景噪声、说话速度、多人切换以及输出方式,都会影响响应时间。文本输出和语音输出也可能存在差异。
千问技术博客还公布了多说话人长音频和多语言测试结果,并称模型在多个维度上优于上一代及部分主流实时同传系统。这些属于千问公开的测试结果,目前不能直接视为独立第三方结论。
真正的难题在模型之外
从开发者文档来看,Qwen3.8-LiveTranslate-Flash-Realtime主要通过实时API接入,开发者可以选择只返回文本,也可以同时返回文本和音频。
这使它更像一套可嵌入其他产品的实时翻译能力,而不是一个面向普通用户的独立应用。
会议软件、直播平台、在线课程和跨境客服要解决的,不只是模型能不能翻译,还包括一整套工程问题:
音频多久切分一次;多人发言如何标记;画面帧怎样发送;译文如何和原文同步;网络中断后怎样恢复;用户能否在文字和语音之间切换。
千问已经开放了WebSocket接入、音频和图像输入、文本及音频输出,以及热词和声音克隆等配置。开发者获得了更大的组合空间,也需要承担更多系统调试工作。
实时同传最难的地方,始终不是安静环境中的单句翻译,而是嘈杂、混乱、不断变化的现场。
背景有人走动,发言人突然换语言,几个人互相打断,屏幕上出现大量专业名词,网络又不稳定——这些情况叠加在一起,才能真正检验模型的价值。
Qwen3.8-LiveTranslate的方向已经从“听到一句、翻译一句”,转向同时理解声音、画面、人物和上下文。
它能否让会议真正少一些等待,还要看不同语言、不同网络和真实业务中的长期使用。但至少在产品路线层面,实时同传的竞争已经不只是“翻得准不准”,还包括能不能更少打断现场。







