Token导航 LogoToken导航

Tavus发布Griffin模型尝试通过图灵测试

更新时间 2026-10-03来源 AI先锋官官方正文 1922字阅读约 7分钟

刚刚, @tavus 发布了一个叫“Griffin”的新模型。

公司创始人 Hassaan Raza  称,构建 Tavus 的整个初衷其实很简单,就是“与机器对话应该像与朋友或同事聊天一样自然”。

与传统AI对话系统主要理解文字和语音不同,Griffin试图理解面对面交流中的完整信号,如语言、声音、表情、目光、手势、停顿,以及对话发生的时间和节奏。

Tavus直接给它定义了一个新类别,“人类交互模型”(Human Interaction Model,HIM)。

在Tavus进行的一项一分钟视频通话测试中,54名参与者被告知自己将与另一名参与者聊天,实际上他们面对的是由Griffin-Lite驱动的PAL。

通话结束后,26人认为自己的交流对象是真人,占48%。

相比之下,Tavus此前由Phoenix 4.5、Sparrow-2和Raven-1组成的系统,在同样测试中,41名参与者只有1人认为对方是真人,通过率为2.4%。

Tavus 因此把 Griffin 称作,第一个通过实时视频图灵测试的模型。

更有意思的是,参与者并不是简单觉得Griffin“画得像人”。

超过一半的人表示,在通话过程中从未想到过对方可能不是真人;那些产生怀疑的人,通常在前20秒内就开始怀疑。

这背后的关键,并不是数字人的外表变得更加逼真,而是Griffin改变了AI进行实时交流的方式。

传统的语音对话系统通常是一条流水线。先进行语音识别,再交给语言模型理解和生成答案,最后通过语音合成说出来,再驱动数字人。这意味着系统往往需要等用户说完,才能开始回应。

Griffin采用的,则是一种“全双工视频到视频”架构。

它把系统分成两个部分:连续对话建模引擎负责持续感知用户的音频和视频,并不断决定什么时候回应、回应什么以及应该怎样表达;视听生成引擎则把这些控制信号实时转换成声音和视频。

最重要的变化是,这些过程不是一个接一个发生,而是同时运行。

Griffin会以亚秒级的间隔重新评估对话状态。用户还在说话时,它就可以点头、附和、调整表情,甚至开始回应;如果用户突然停顿,它也不会简单地把停顿理解成“对方已经说完”。

这让AI开始处理过去很难处理的“对话时机”。

比如,一个人说话时移开视线、停顿、改变语气,Griffin可以结合这些视觉和声音信号判断当前发生了什么,而不是只看说了哪些词。

Tavus展示的能力也不只是聊天。

Griffin可以根据对话上下文改变语调、笑声、表情和手势;可以从一张参考图片实时生成整个场景,而不仅仅是脸部,包括椅子的运动、人物产生的阴影以及背景;它还可以理解用户展示的视觉信息。

在技术层面,Griffin-Lite的流式视频生成器可以以320毫秒为一个视频块生成720p视频,并接受实时控制信号,让对话模型直接控制手势、目光和情绪变化。

语音生成同样针对实时交互进行了设计。Griffin-Lite可以从大约10秒的音频中克隆说话人的声音,并逐步生成语音,而不是等待完整句子结束之后再输出。

Tavus还将Griffin-Lite放到了NVIDIA的VideoFDB全双工视听对话基准上测试。

在生成方向,Griffin-Lite得分3.83,而人类参考值为3.92;第二高系统为2.80。

在感知方向,Griffin-Lite得分3.73,人类参考值为4.20,第二高系统为3.44。Tavus称,在该基准评估的15个模型中,Griffin-Lite的感知成绩最高。

视频生成方面,Griffin-Lite在DOVER、FID和THEval三个指标上排名第一,在LSE-C唇形同步指标上排名第二,得分7.27。其音频到视频延迟在H100上平均为0.43秒,是下一个最快方法的一半。

但Griffin最值得注意的地方,可能恰恰是它暂时没有开放给普通客户。

Tavus明确表示,让人类交互模型能够自然地与人交流的能力,同样意味着它可能让人类误以为自己面对的不是AI。

公司认为,在正式发布之前,还需要进一步的安全和对齐措施,并正在开发安全披露功能。

目前,Griffin-Lite仅作为研究预览版向一小批经过筛选的测试者开放。

Tavus对Griffin的定义也很明确:它不是让人“操作计算机”,而是让人“与计算机一起工作”。

未来,一个学生可以直接面对AI解释自己哪里没听懂,AI根据表情和反应换一种方式讲;一个人在工作中可以和AI演练一场艰难的谈话;一个客户甚至可以直接把坏掉的零件举到摄像头前,让AI通过看到的东西和当下的交流理解问题。

不需要记住正确的命令,也不需要找到正确的菜单。

只需要像和另一个人说话一样,把事情说出来。

这正是Tavus所谓的“人类计算”,而Griffin,是它目前为止最大的一步。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多