刚刚, @tavus 发布了一个叫“Griffin”的新模型。
公司创始人 Hassaan Raza 称,构建 Tavus 的整个初衷其实很简单,就是“与机器对话应该像与朋友或同事聊天一样自然”。
与传统AI对话系统主要理解文字和语音不同,Griffin试图理解面对面交流中的完整信号,如语言、声音、表情、目光、手势、停顿,以及对话发生的时间和节奏。
Tavus直接给它定义了一个新类别,“人类交互模型”(Human Interaction Model,HIM)。
在Tavus进行的一项一分钟视频通话测试中,54名参与者被告知自己将与另一名参与者聊天,实际上他们面对的是由Griffin-Lite驱动的PAL。
通话结束后,26人认为自己的交流对象是真人,占48%。
相比之下,Tavus此前由Phoenix 4.5、Sparrow-2和Raven-1组成的系统,在同样测试中,41名参与者只有1人认为对方是真人,通过率为2.4%。
Tavus 因此把 Griffin 称作,第一个通过实时视频图灵测试的模型。
更有意思的是,参与者并不是简单觉得Griffin“画得像人”。
超过一半的人表示,在通话过程中从未想到过对方可能不是真人;那些产生怀疑的人,通常在前20秒内就开始怀疑。
这背后的关键,并不是数字人的外表变得更加逼真,而是Griffin改变了AI进行实时交流的方式。
传统的语音对话系统通常是一条流水线。先进行语音识别,再交给语言模型理解和生成答案,最后通过语音合成说出来,再驱动数字人。这意味着系统往往需要等用户说完,才能开始回应。
Griffin采用的,则是一种“全双工视频到视频”架构。
它把系统分成两个部分:连续对话建模引擎负责持续感知用户的音频和视频,并不断决定什么时候回应、回应什么以及应该怎样表达;视听生成引擎则把这些控制信号实时转换成声音和视频。
最重要的变化是,这些过程不是一个接一个发生,而是同时运行。
Griffin会以亚秒级的间隔重新评估对话状态。用户还在说话时,它就可以点头、附和、调整表情,甚至开始回应;如果用户突然停顿,它也不会简单地把停顿理解成“对方已经说完”。
这让AI开始处理过去很难处理的“对话时机”。
比如,一个人说话时移开视线、停顿、改变语气,Griffin可以结合这些视觉和声音信号判断当前发生了什么,而不是只看说了哪些词。
Tavus展示的能力也不只是聊天。
Griffin可以根据对话上下文改变语调、笑声、表情和手势;可以从一张参考图片实时生成整个场景,而不仅仅是脸部,包括椅子的运动、人物产生的阴影以及背景;它还可以理解用户展示的视觉信息。
在技术层面,Griffin-Lite的流式视频生成器可以以320毫秒为一个视频块生成720p视频,并接受实时控制信号,让对话模型直接控制手势、目光和情绪变化。
语音生成同样针对实时交互进行了设计。Griffin-Lite可以从大约10秒的音频中克隆说话人的声音,并逐步生成语音,而不是等待完整句子结束之后再输出。
Tavus还将Griffin-Lite放到了NVIDIA的VideoFDB全双工视听对话基准上测试。
在生成方向,Griffin-Lite得分3.83,而人类参考值为3.92;第二高系统为2.80。
在感知方向,Griffin-Lite得分3.73,人类参考值为4.20,第二高系统为3.44。Tavus称,在该基准评估的15个模型中,Griffin-Lite的感知成绩最高。
视频生成方面,Griffin-Lite在DOVER、FID和THEval三个指标上排名第一,在LSE-C唇形同步指标上排名第二,得分7.27。其音频到视频延迟在H100上平均为0.43秒,是下一个最快方法的一半。
但Griffin最值得注意的地方,可能恰恰是它暂时没有开放给普通客户。
Tavus明确表示,让人类交互模型能够自然地与人交流的能力,同样意味着它可能让人类误以为自己面对的不是AI。
公司认为,在正式发布之前,还需要进一步的安全和对齐措施,并正在开发安全披露功能。
目前,Griffin-Lite仅作为研究预览版向一小批经过筛选的测试者开放。
Tavus对Griffin的定义也很明确:它不是让人“操作计算机”,而是让人“与计算机一起工作”。
未来,一个学生可以直接面对AI解释自己哪里没听懂,AI根据表情和反应换一种方式讲;一个人在工作中可以和AI演练一场艰难的谈话;一个客户甚至可以直接把坏掉的零件举到摄像头前,让AI通过看到的东西和当下的交流理解问题。
不需要记住正确的命令,也不需要找到正确的菜单。
只需要像和另一个人说话一样,把事情说出来。
这正是Tavus所谓的“人类计算”,而Griffin,是它目前为止最大的一步。







