Token导航 LogoToken导航

网易有道开源实时语音全家桶登顶Hugging Face

更新时间 2026-09-27来源 十字路口Crossing正文 4644字阅读约 15分钟22 张图片
Voice Agent 赛道迎来新开源模型。
图片

👦🏻 作者: GaKi

🥷 编辑: Koji

🧑‍🎨 排版: NCon

图片

7 月 24 日,黄仁勋在 X 上发布了自己的第一条推文,附带一封联名公开信,标题是 《开放权重与美国在 AI 领域的领导地位》 ,几天内,联署名单增加到 150 多家,包含了 OpenAI 和 Google 。

图片

这封信发布时的一个直接的背景,是中国开源模型这一年的进展。

过去几个月,国内发布了多款相当不错的开源模型,像是 2.8 万亿参数的 Kimi K3、Qwen3.8-27B、Step 5 Preview(预计 10 月开放权重)。这些都是大语言模型,也吸引了行业大部分的注意力。

但真正值得注意的变化,已经不只发生在大语言模型上。

9 月中旬,网易有道开源了两款实时语音模型 R2T2 和 T3PO。R2T2 负责实时语音转写,T3PO 负责实时翻译。发布几天后,两款模型分别登上 Hugging Face 的 ASR(语音识别)和 Translation(翻译)Trending 榜第一。

图片

同一个月,OpenAI 开放了全双工语音模型 GPT-Live-1 的 API,Google 发布 Gemini 3.8 Live。

在海内外大厂的注意力同时集中在「实时语音」这个细分赛道的同时,网易有道获得了一个相当不错的成绩,这很不容易。

中国开源模型开始从最受关注的大语言模型主战场,继续往语音识别、实时翻译这些更细、更具体的技术环节里深入。而且,已经站到了榜单最前面。

所以,这两个模型上榜真正值得关注的,不只是「网易有道做出了两款不错的模型」。

更重要的变化是,中国开源模型的影响力,正在一层一层往整个 AI 技术栈里渗透。

🚥

本文将从这 2 款模型出发,讨论 2 个问题:

【1】「实时语音」这一个「相对大语言模型,注意力较低的细分赛道」为什么重要?

【2】网易有道为什么选择在这里一直坚持。

中国开源模型,开始进入细分方向

Hugging Face 在 2026 年 3 月发布了一份春季开源报告,显示过去一年中国模型占平台下载量的 41%,月度下载量和总下载量都超过了美国。

如果看中国模型在下载量上反超美国的时间点,则更早,是从 2025 年 7 月开始的。

2025 年 9 月,阿里 Qwen 超过 Meta Llama,成为 Hugging Face 上下载量最大的语言模型家族。按 Hugging Face 官方统计,基于 Qwen 开发的衍生模型超过 15 万个,比 Google 和 Meta 两家基础模型的衍生数量加起来还多。

图片

下载量之外,模型聚合平台 OpenRouter 上,中国开源模型的 token 真实调用占比在 2024 年底还不到 1.2%,到 2026 年 4 月已经接近一半。

不过,这些数字里的大部分份额仍然来自通用大模型,比如 DeepSeek、Qwen、Kimi、GLM 。大家讨论的大多还是是参数规模多大、是不是 Dense 模型、有没有 1M 上下文,以及 Coding 和推理榜单上的分数。

但是,如果平常关注模型进程的话,会发现细分方向上的情况有所不同,尤其是「实时语音类模型」。

毕竟,开发者在 ASR、翻译等实时语音模型的细分榜单上下载一个模型,通常就已经准备把它集成到自己的产品里。

因此,某种角度来说,细分榜单更能反映具体场景里的真实需求。

开发者社区对 R2T2 和 T3PO 的反应,可以说明这一点。

图片

先介绍下这两款模型。

R2T2 是一个流式语音识别模型,也就是人一边说话,它一边把声音转成文字,已经显示出来的字不会再被改动。

T3PO 则是一款同声传译模型,可以在中文和英文之间实时互译。

其中,R2T2 发布后,Hugging Face 开源团队的 Apolinario 在模型评论区发了一条帖子。

帖子里说:他们用 Agent 为 R2T2 做了一个交互 Demo,托管在 Spaces 上,运行在免费的 ZeroGPU 基础设施上,并提出把这个 Space 转交给有道。

图片

有第三方开发者把 R2T2 移植到纯 C++ 的本地语音推理框架 audio.cpp 上,重新实现了它的流式状态机,还加入了本地麦克风实时识别。

图片

这部分代码在 9 月 19 日合入了主仓库。

社区还为 R2T2 和 T3PO 制作了从 Q2 到 Q8 的多个 GGUF 量化版本。开发者可以用 llama.cpp 或 Ollama,在自己的电脑上运行这两款模型。

图片

移植、量化、适配本地框架,这些工作都需要开发者投入一定的时间成本。有人愿意做,说明已经有团队准备在实际项目里使用它们。

所以,细分方向上的模型,也是开发者二次开发最集中的地方之一。

说完开源模型、尤其是「实时语音类」细分模型在开发商表现,接下来再聊聊「商业化场景」。

Voice Agent 最难的一点,是「实时」

实时语音类模型,最大的商业场景之一就是 Voice Agent。

十个月前,「十字路口」团队曾经在《盘点:2025 年最值得关注的 18 家 AI Voice Agent 创业公司》一文中,详细梳理了这一赛道的初创团队,当时我们有个预测:

「大家严重低估了 Voice 作为 AI 交互界面的潜力。」
图片

Voice Agent 指的是能听、能说,还能执行任务的 AI Agent,它可以在一通电话里帮用户完成预约、退款、下单这类多步骤操作。

2026 年了,这个方向的热度甚至比 2025 年还要高。

a16z 把「Voice Agent 从技术演示走向规模化部署」列为 2026 年的三大预测之一。吴恩达也公开说过,很多人低估了语音技术栈的重要性。

技术上的变化也集中在今年。

7 月,OpenAI 发布全双工模型 GPT-Live-1,替换了 ChatGPT 原来的高级语音模式。全双工的意思是,模型可以一边听一边说,会用「嗯」「对」回应,也能分辨用户是在思考停顿,还是已经说完。

图片

语言学习公司 Speak 的测试显示,GPT-Live-1 误打断学习者思考停顿的情况,比轮次式系统减少了近 80%。

这是一个非常大的升级,也因此,很多人在各类社区平台中「吐槽」:

GPT-Live-1 说真的,有点恐怖谷了。
图片

9 月,GPT-Live-1 开放 API,定价约 0.05 美元/分钟。加上电话线路和其他环节,一分钟 AI 通话的综合成本也已经低于人工客服。

实时语音类模型在 AI 硬件侧,也有着非常大的想象力。

AI 眼镜和耳机大多没有屏幕,语音是主要的输入和输出方式。Meta 与 EssilorLuxottica 在 2025 年卖出超过 700 万副眼镜,是前一年的三倍多。

图片

EssilorLuxottica 2025 财报原文

这类硬件最常用的功能之一是实时翻译。Meta 的眼镜、Google 和三星的 Android XR 眼镜、苹果的 AirPods,都把实时翻译作为主打功能。

翻译场景对延迟非常敏感,毕竟你面前的说话人并不会等着你「思考、收听翻译」。

所以,Voice Agent 的难点集中在「实时」上。

有道首席科学家段亦涛在 9 月 16 日的有道 AI Open Day 上曾提到过一个观点:

过去人与 AI 的交流是「我说一句、你说一句」,系统能判断用户什么时候说完、什么时候该回答。在实时语音场景里,模型每时每刻面对的都是不完整的信息。
图片

因为,一条实时语音链路通常分为三段:

【1】语音识别把声音转成文字

【2】AI 理解文字并决定如何回复或翻译

【3】语音合成再把结果读出来

第一段的输出,决定了后面两段能不能及时开始工作,而这就是 R2T2 这个模型的领域了。

R2T2 这个模型最大的特点是「只增不改」,也就是:已经输出的字不再修改,新识别的内容只在末尾追加。

图片

值得注意的是,「只增不改」之后,准确率并没有下降。

在网易有道团队内部 160 毫秒分块的测试中,以及在更接近真实场景的 AMI 会议数据集上,R2T2 所获得评分都相当不错:

图片

延迟方面,R2T2 的平均识别延迟在 200 到 600 毫秒之间。

模型参数是 2B,量化后可以在个人电脑上运行。

眼镜和耳机的电池和算力都有限,这个体量的语音模型对硬件厂商很有实际价值。

另一方面,T3PO 则更擅长「在质量和延迟之间做取舍」。

图片

T3PO 是一个 15B 参数的同传模型,支持中译英和英译中,可以提供低延迟、原生、高质量三档模式。

重要的是,它使用 Apache 2.0 协议,开发者可以免费商用。

两款模型串联使用,在真实的任务中会表现更好,比如语音输入后,R2T2 实时转写成文字,T3PO 实时翻译,最后输出字幕或合成语音。

网易有道为什么一直在投入「实时语音」?

以海外实时语音赛道为例,资金集中在两端。

一端是底层语音模型和实时音视频技术公司。ElevenLabs 在 2026 年 2 月以 110 亿美元估值融资 5 亿美元,Deepgram 和 LiveKit 也在今年初各自完成了 1 亿美元以上的融资。

另一端是企业客服应用。Sierra、Decagon、Parloa 三家公司在 2026 年上半年合计融资约 15.5 亿美元。

图片

大厂也在进入下游,OpenAI 和 Google 直接提供低价的一体化语音 API,苹果和 Meta 把实时翻译做成耳机和眼镜的免费功能。

所以,处在中间层的独立公司压力最大,比如专做实时同传的创业公司 Palabra,今年 1 月的融资是 840 万美元,有些人认为这被低估了。

图片

在这样的格局下,后来者需要选择一个具体的位置,并在这一个位置里建立自己的技术辨识度。

网易有道所选择的「实时识别和实时翻译」,目前来看和它过去的积累有关。

有道长期做词典、翻译和翻译笔这类产品,服务的都是查词、翻译、口语练习这些语言场景。所以它对语言数据、翻译质量和用户在真实场景中的需求,都有长期的积累。

2023 年,有道发布了教育大模型「子曰」。现在,它的模型矩阵已经覆盖多模态推理、翻译和语音交互。

图片

在 9 月 16 日的 Open Day 上,有道把这次开源的两款模型归入「子曰 Live」系列。这个系列定位为实时交互模型矩阵,R2T2 和 T3PO 是首批发布的两款。

过去,外界对有道的印象更多来自词典、翻译和学习类应用。这次登上 Hugging Face 细分榜单的是两款底层模型,对应的是有道在语音方向上长期的模型投入。

这一部分工作,过去外界关注得比较少。

另一方面,大厂往往提供的是端到端的方案,也就是 Cover 掉语音输入,语音输出,中间过程开发者很难干预。

有道开源的是两个可以拆开使用的组件,开发者可以把 R2T2、T3PO 和自己选择的大模型、语音合成模型自由组合,也可以部署在自己的服务器上。

企业对这种可控性是有需求的,比如,语音 Agent 开发平台 Vapi 今年在 40 家竞争对手中赢得了 Amazon Ring 的订单。 Vapi 的做法是让开发者自行替换识别、大模型和语音合成模块。

图片

Amazon Ring 没有直接使用大厂的一体化 API,说明大企业仍然看重对每个环节的控制。

🚥

回看这一年,中国开源模型的影响力仍在持续上升。

Kimi K3、Qwen 3.8 27B、Step 5 Preview 这些模型,让中国在开源大模型的前沿有了自己的位置。

现在,这种影响力开始向更细分的方向延伸。

Voice Agent 需要实时识别、实时翻译、全双工对话和端侧部署。每一项都是一个具体的技术问题,也都需要专门的模型来解决。

R2T2 和 T3PO 登上 Hugging Face 两个细分榜单第一,就是一个很有代表性的节点。

图片

过去几年,海外开发者认识中国 AI,先是通过 DeepSeek、Qwen、Kimi 这样的通用模型。

接下来,他们很可能会开始通过一个语音识别模型、一个翻译模型、一个端侧模型,认识更多来自中国的 AI 团队。

中国开源模型已经不只是在最受关注的主赛道上竞争。现在,连那些更窄、更难被普通用户看到,却直接决定产品体验的技术环节,也开始出现中国模型的身影。

而 AI 真正进入产业之后,竞争会聚焦到一个个具体的问题,一个个具体的模型。

R2T2 和 T3PO,只是其中两个。

加入会员群
文章标签模型发布开源大模型应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多