过去,视频通话常被视为确认身份的重要凭证。文字可代笔,声音能合成,但让对方开启摄像头,聊几句、看表情,似乎总能多一份安心。
如今,这份眼见为实的信心也开始面临挑战。
近期,AI研究团队Tavus推出了实时视频交互模型Griffin,并公布了一项实验结果。在与该模型的研究预览版Griffin-Lite进行一分钟视频通话后,54名参与者中有26人认为屏幕另一端是真人,比例约为48%。
▲ 截至发稿时,近1736万网友关注
作为对比,Tavus上一代系统在相同实验流程下,41人中仅有1人被误认为真人,比例为2.4%。
Tavus据此宣称,Griffin是首个通过实时“视频图灵测试”的模型,并将其归入一个新类别——Human Interaction Model,简称HIM,即人类交互模型。
不过,“首次通过”目前仍是Tavus对实验结果的界定,且由于尚未全面开放预览,不排除存在画饼Demo的可能。要理解这次发布,需同时看清三个问题:参与者如何被说服,模型如何完成互动,以及一分钟的表现究竟能证明多少。
让人信服的细节,藏在言语之外
与AI聊天时,最容易让人出戏的瞬间,未必是答案有多离谱,有时只是它太不会接话。
你停下来组织语言,它立刻抢着回答;你讲了一件难过的事,屏幕上的脸却还挂着笑;你打断它,它仍沿原节奏继续说。答案可能没错,交流却始终有些别扭。
Griffin尝试处理的,正是这些发生在语言之外的细节。根据Tavus的介绍,它能同时看、听、说,并根据对方的表情、视线、语气和停顿,持续决定下一步行动。
在官方演示中,模型展示了随对话改变情绪、语调和动作的能力,还参与了模仿指令游戏、魔方互动,以及观察用户焊接电路板等场景。Tavus希望借此说明,模型能结合画面和时间信息参与交流。
例如,同样一段沉默,有人正在思考,有人已经说完,有人可能希望对方继续解释。系统需结合上下文与非语言信号判断,避免把每次声音停止都当成发言结束。
视觉生成的范围也扩大了。Tavus称,Griffin能从一张参考图像出发,实时生成整个画面,包括人物的脸、手臂、手指,以及椅子的移动、阴影和背景变化。
因此,屏幕上的角色在听人说话时,可以点头、调整视线或改变表情,不必等到自己的台词开始才突然有动作。
AI想学会聊天,需摆脱轮流答题的节奏
上述能力背后,是交互方式的变化。
常见的级联系统会依次完成语音识别、语言模型回答、语音合成和数字人驱动,多个环节前后衔接。用户说完一句,系统处理一句,再把结果交给下一环节。
Griffin采用全双工视频交互方案。所谓全双工,就是系统在输出语音和视频的同时,仍持续接收并处理用户的声音与画面。
▲ 左为原图,右由AI辅助翻译,仅供参考
它由两个主要部分构成。
持续对话建模引擎负责感知现场、决定说什么以及何时回应,同时输出情绪、表情和动作等控制信号;音视频生成引擎则将这些信号转化为连续的声音与画面。
对话引擎以低于一秒的间隔重新评估交流状态,因此模型在一句话说到一半时,也能根据用户反应决定暂停、继续或让出发言机会。
实现这种配合,还需生成速度跟得上。
Griffin-Lite的语音模块采用流式生成,能随着控制信号到来逐步输出声音,并支持利用约10秒参考音频克隆声音。
视频模块则以每段320毫秒的方式,实时生成720p、25帧每秒的视频。团队通过模型蒸馏和自回归训练,将原本多步生成的过程压缩为少步生成,同时改善长时间输出时的画面稳定性。
在Tavus公布的H100测试中,音频到达后,其效果出现在画面上的平均延迟为0.43秒,约为比较对象中次快方法的一半。该数字衡量的是音频到视频的生成延迟,不能直接等同于用户提问到收到完整回答的时间。
画面质量方面,Griffin-Lite在与四种已发表流式扩散模型的比较中,取得了DOVER、FID和THEval三项指标的最佳成绩;唇形同步指标LSE-C得分为7.27,位列第二。
榜单接近人类,一分钟实验仍有局限
除内部测试外,Griffin-Lite也出现在英伟达的VideoFDB公开榜单上。该基准分别评估模型能否理解交流中的非语言信号,以及能否生成符合情境的声音、表情和动作。
生成赛道中,Griffin-Lite的总分为3.83,人类参考分为3.92,排名下一位的Gemini 2.5与Anam组合为2.80。感知赛道中,Griffin-Lite得分3.73,人类参考分为4.20,最高的其他公开基线成绩为3.44。
两项成绩均领先榜单中的其他AI系统,但它们属于特定基准下的评分。尤其需注意,部分比较对象只接收音频,部分接收音视频,输入条件存在差异,排名不能直接推广为所有能力的比较结论。
至于最受关注的48%,来自另一项由Tavus组织、通过独立研究平台招募参与者的实验。
参与者事先被告知,将与另一名参与者视频通话一分钟,讨论今年最期待的事情。实际出现在屏幕上的,是由Griffin-Lite实时生成脸、声音和回应的AI角色。
通话结束后,参与者先评价对方的自然程度、可信度和交流体验,直到问卷最后才被问及是否怀疑过对方并非真人。研究结束时,所有人都被告知了AI身份。
最终,26人判断对方是真人,这组参与者对判断的平均信心为79%;认为对方是AI的参与者,平均信心则为81%。产生怀疑的人,通常在通话开始后的20秒内就有所察觉。
模型也尚未消除所有交流障碍。在七分制评价中,自然程度为5.4,可信度为5.6,再次交流意愿为5.8,而对话流畅程度为4.9,是五项评价中最低的一项。
实验说明,实时合成的面孔已能在特定条件下让部分人信以为真。但样本只有54人,通话仅持续一分钟,参与者又被提前告知对方是另一个人,结果仍需更大规模、更长时间和更多场景的验证。
越像真人,越需说明自己是谁
在Tavus对Griffin的愿景中,你永远不会去思考交流的“机制”。你不会去想“我要用什么词汇才能让他听懂”,你只是自然地表达,让对话如水般流淌。
想象一下,未来的在线辅导,不再是冷冰冰的PPT录播。AI老师能从你紧锁的眉头看出你没听懂,然后主动换一种更通俗的比喻;
未来的客服,不需要你费尽心机描述零件型号,你只需把它举到摄像头前,AI就能和你一起研究如何修理它。
机器终于俯下身来,走进了人类的语境里。
这也是为何,Tavus在发布Griffin-Lite预览版的同时,宣布只向部分可信测试者开放研究预览,尚未供普通客户使用。
团队表示,正在开发AI身份披露功能,并开展进一步的安全与对齐评估,更广泛的发布将取决于相关问题的处理进展。
过去,数字人的挑战是如何让人愿意与它交流;随着实时生成越来越自然,产品还必须回答如何让人知道自己正在与谁交流。让AI学会看眼色,可能会降低使用门槛,让用户看清它的身份,则将决定这份便利能否建立在信任之上。
本文来自微信公众号“APPSO”,作者:发现明日产品的,36氪经授权发布。


围绕北单赛果说明,北单让球胜平负持续打磨更优质的服务。
北单让球胜平负深耕北京单场让球领域,用心服务每一位用户。
北单让球胜平负深耕让球比分对照领域,用心服务每一位用户。
在北单玩法解析方面,北单让球胜平负提供贴心周到的支持。
北单让球胜平负以覆盖北单全部让球玩法,按常见疑问分类整理规则说明。为核心,带来高效便捷的体验。
想了解更多每项概念均配有实际比赛赛果对照示例,直观展示判定逻辑。相关内容,尽在北单让球胜平负。