Token导航 LogoToken导航

Tavus数字人模型演示视频图灵测试 视频通话1分钟近半数人未识破

更新时间 2026-10-03来源 DeepTech深科技正文 4029字阅读约 13分钟3 张图片

图片

这家数字人公司把感知、对话和视频生成放进了同一个模型。

在 Tavus 放出的一段演示视频中,用户 Sagar 正在焊接一块电脑主板,屏幕里的 AI 一边观察他的操作,一边提示下一步该怎么做。当 Sagar 停下手里的活儿、半天不说话时,AI 并没有急着搭话。它清楚已经过了多长时间、手头的进度到了哪一步,直到该进行下一步时才开口提醒。

人与人之间这样的配合再平常不过,但对 AI 来说却很不容易。现有的语音助手和数字人大多要等用户完全停下来才开始响应,它们往往把沉默当成轮到自己说话的信号;用户只要稍有停顿,AI 就可能抢着接话。

这段演示来自 Tavus 10 月 1 日发布的新模型 Griffin。这家 AI 视频公司将 Griffin 定义为首个“人类交互模型”(Human Interaction Model,HIM),也就是专门用于理解和生成实时面对面交流的模型。本次发布的是研究预览版 Griffin-Lite。

Tavus 此前组织了一项测试:54 名受试者与它进行了 1 分钟的视频通话,其中 26 人(48%)误以为对方是真人。在英伟达的全双工音视频对话基准 VideoFDB 上,它的生成得分达到 3.83 分(满分 5 分),而真人基准为 3.92 分。

Griffin 是一个全双工的“视频到视频”模型。所谓全双工,是指双方可以同时说话、实时做出反应,能像真人聊天那样互相打断、点头附和、话语交叠。

Tavus 公布的其他几段演示也都在展现这一点:用户分享自己升职的消息时,AI 形象 Vanessa 没等他说完就有了表情和声音反馈,两人抢着说了几句,话题也完全没断;用户和它玩“西蒙说”游戏,它只在对方念出口令时才跟着做手势,如果对方省略了口令,它便会当场点破;用户转动魔方时,它会盯着魔方的变化持续回应,对方中途停下来思考,它就在一旁安静等待。

图片图丨Griffin的架构(来源:Tavus)

这些演示试图解决的,是当前实时数字人在架构上的硬伤。业内传统的做法是级联式系统:先用语音识别将用户的话转成文字,再交由大语言模型生成回复,随后用语音合成读出来,最后由形象模型去驱动口型与表情。Tavus 自己过去走的就是这条路。

Tavus 由 Hassaan Raza 和 Quinn Favret 于 2020 年创立,孵化自 Y Combinator,总部位于旧金山。公司最早做的是面向销售与营销团队的个性化视频:销售人员只需录制一段基础视频,系统就能自动替换客户姓名、公司等信息,批量生成一对一的推销视频,Meta 和 Salesforce 都曾用它给企业客户发送产品演示。

2024 年 3 月,Tavus 完成了由 Scale Venture Partners 领投的 1800 万美元 A 轮融资,当时其自研的 Phoenix 模型已经能用 2 分钟的视频素材生成个人的数字分身。

此后,公司把业务重心转向了实时对话视频。2025 年 11 月,Tavus 又完成了由 CRV 领投、红杉资本及 Y Combinator 等跟投的 4000 万美元 B 轮融资,累计融资金额约 7000 万美元。在上一代对话视频系统中,Tavus 使用了三个模型进行级联:Phoenix-4.5 负责渲染,Sparrow-2 负责把握对话节奏,Raven-1 负责多模态感知。

在做了几代级联系统之后,Tavus 在 Griffin 的技术文档中直言了这种架构的弊端:系统内部每交接一次,就会增加一层延迟,同时损失一部分信息。比如语气中的细微变化在转成文字后就丢失了,系统也无法在对方说话的同时进行附和或插话。这种机制的结果就是用户反过来要迁就机器,不得不调整自己的说话节奏、简化用词,刻意避免冷场。Raza 在发布声明中也谈到,AI 如今已经变得非常聪明,但人们依然得按照机器的习惯去和它交流。

Griffin 换了一种思路,将感知、决策和生成整合进一个端到端系统,让三者并行运行。这套方案出自 Tavus 的科研团队,由研究负责人、伦敦玛丽女王大学教授 Ioannis Patras,以及帝国理工学院情感与行为计算教授 Maja Pantic 共同领衔。两人长期从事人脸与非语言行为分析的研究,Pantic 此前还曾在 Meta 主管过 AI 科研工作。

Tavus 表示,该团队成员的学术论文累计被引用已超过 9 万次,伦敦玛丽女王大学也参与了 Griffin 的联合研发。

整个系统由两大部分构成。第一部分是“连续对话建模引擎”,它会同时接收用户的音频与视频信号。该引擎不再遵循传统“你说完一句、我再接一句”的轮流模式,而是以不足 1 秒的“微轮次”持续评估当前的对话状态,以此来判断这一刻究竟该开口说话、继续倾听、让出话轮、随声附和,还是保持安静。

它输出的是一组控制信号,不仅决定回复什么内容,还决定以怎样的方式呈现,包括说话的时机、身体姿态、面部表情、手势动作以及情绪和语气。

第二部分是“音视频生成引擎”,负责将这些控制信号实时转化为声音与画面,音频与视频各有一套流式生成架构。语音方面,Tavus 自研了名为 Tavec 的音频编解码器,能把 48kHz 的音频压缩为连续的潜在表示(每帧 40 个数值,每秒 100 帧),期间不使用离散码本。

其解码器严格遵循因果逻辑,能以最小 10 毫秒的数据包实现边生成边播放。在这套表示层之上,由一个自回归扩散 Transformer 模型负责生成语音,通常只需约 10 秒的参考音频就能克隆一个人的声音。

视频方面则采用了一个步数较少的自回归扩散生成器,并搭配 VAE 解码器。只需一张参考照片,就能输出 720p、每秒 25 帧的动态画面。每个潜在表示对应 8 帧画面(即 320 毫秒的视频),仅需扩散 3 步即可完成实时渲染。

在生成过程中,模型还能随时接收有关手势、视线和情绪的控制信号。它生成的也不单单是一张面孔,人物的肢体与背景同样是逐帧渲染出来的。

为了确保画面在长时间对话中不会失真或漂移,Tavus 采用了三阶段蒸馏训练:先进行分布匹配蒸馏(DMD),随后进行教师强制(teacher forcing)训练,最后引入自强制(self-forcing)训练。

根据 Tavus 公布的数据,在英伟达 H100 上,从音频输入到视频输出的平均延迟为 0.43 秒,比目前已公开的最快方案还要低上一半。在纯音频驱动视频模式下,Griffin 在 DOVER、FID 和 THEval 三项画面质量指标上均位列 5 种对比方案之首,口型同步指标 LSE-C 则排名第二。

评测结果主要分为两组。第一组来自 VideoFDB,这是英伟达研究团队于今年 5 月发布的评测基准,也是业内首个针对全双工音视频对话智能体的基准测试。其测试素材取自真实的视频通话,共有 237 段双人对话片段,涵盖了视线回避、停顿、附和以及话轮转换等 11 类非语言交流场景。该基准设有“生成”和“感知”两个赛道,均由大语言模型根据打分规则进行客观评审,开发者提交模型输出后由英伟达统一打分。

图片图丨VideoFDB 基准测试结果(来源:Tavus)

在考察模型自身表现的“生成赛道”中,Griffin-Lite 拿到了 3.83 分,排在第二名的是基于 Gemini 2.5 搭配 Anam 数字人的级联方案(2.80 分)。从分项数据来看,Griffin-Lite 在“双人情感呼应”上拿到了 4.40 分,甚至高出真人基准(4.14 分);但在“非语言线索恰当性”上得分为 2.83 分,略低于真人的 3.18 分。两者的差距主要体现在响应速度上,Griffin-Lite 的中位响应时间为 1892 毫秒,而真人的反应时间大约在 900 毫秒左右(NVIDIA,2026)。

在考察模型能否准确理解当下情境的“感知赛道”中,Griffin-Lite 的得分是 3.73 分(真人基准为 4.20 分),作为对比,开源模型 MiniCPM-o 4.5 得分为 3.40 分,OpenAI 的 gpt-realtime 与谷歌的 Gemini 3.1 Flash Live 则分别为 2.75 分和 2.84 分。

第二组数据来自 Tavus 自己组织的真人实测。受试者招募自一个独立的研究平台,他们在测试前只被告知需要与另一名参与者进行 1 分钟的视频通话,聊聊今年自己最期待的事情。通话结束后,受试者先要填写对对方的多项主观评价,问卷直到最后一题才问:在刚才的通话中,是否想过对方可能不是真人?

在与 Griffin-Lite 通话的 54 人中,有 26 人(48%)认为对方就是真人。而在同样的测试流程下,上一代系统的这项数据仅有 2.4%(41 人中仅 1 人认为是真人)。判断对方是真人的受试者,平均确信度为 79%;判断对方是 AI 的受试者,平均确信度为 81%。

Tavus 还提到,那些察觉到异样的受试者,大多在前 20 秒内就产生了怀疑。不过这项研究完全由 Tavus 自行开展,样本量相对有限、单次通话时间较短,且没有设置与真人通话的盲测对照组。

目前,Griffin 尚未接入 Tavus 的商业化平台。该平台上现有超过 15 万名开发者和企业用户,包括亚马逊、梅奥诊所(Mayo Clinic)和 Salesforce 等客户,主要将数字人应用于招聘面试、销售拓展、教育培训以及客户服务等领域。

Griffin-Lite 现阶段并不对这些客户开放,仅提供给少数受信任的测试人员,能力更为完善的完整版 Griffin 将在后续推出。Tavus 为其规划的应用场景包括一对一课外辅导、协助员工预演棘手对话,以及文章开头提到的那种看着用户实操并随时提供技术指导的陪伴场景。

至于暂不对外开放的原因,Tavus表示:正是那些让模型表现得像真人一样自然的交互特质,会让人极易误以为自己在与一个真正的人交谈。自今年 8 月 2 日起适用的欧盟《人工智能法案》第 50 条明确规定,凡是与人类直接交互的 AI 系统,必须明确让用户知晓对方的 AI 身份。

Tavus 表示,团队正在加紧开发“安全披露”(强制身份告知)功能,并正与相关的 AI 安全组织展开合作,待这些合规与安全问题解决后会“很快”推出 Griffin,但目前尚未公布具体的时间表和定价方案。

参考资料:

1. https://www.tavus.io/griffin#intro

注:封面/首图由 AI 辅助生成

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多