视频通话不再是”真人保险”
过去,视频通话常被当作确认身份的一道保险。文字可以代写,声音可以合成,但让对方打开摄像头、聊几句、看表情,似乎总能多一分把握。10月1日,AI研究团队Tavus发布的实时视频交互模型Griffin,正在挑战这份”眼见为实”。
48%对2.4%:一分钟视频通话实验
Tavus公布了一项实验结果:在与研究预览版Griffin-Lite进行一分钟视频通话后,54名参与者中有26人认为屏幕另一端坐着真人,占比约48%。作为对照,Tavus上一代系统在相同流程下,41人中只有1人被当成真人,比例仅2.4%。
实验通过独立研究平台招募参与者,他们事先被告知将与另一位参与者视频通话,讨论今年最期待的事情。实际出现的,是由Griffin-Lite实时生成脸、声音和回应的AI角色。判断对方是真人的一组,平均信心为79%;怀疑是AI的一组,平均信心81%。产生怀疑的人通常在通话开始20秒内就已察觉。
不只是会说话:读懂表情、视线与停顿

与AI聊天时最容易出戏的瞬间,往往不是答案离谱,而是它”太不会接话”:你停下组织语言,它立刻抢着回答;你讲难过的事,屏幕上的脸却还挂着笑;你打断它,它仍按原来的节奏继续说。
Griffin处理的正是这些语言之外的细节。它能够同时看、听、说,根据对方的表情、视线、语气和停顿,持续决定接下来该做什么。官方演示中,模型展示了随对话改变情绪、语调和动作的能力,还参与了模仿指令游戏、魔方互动,以及观察用户焊接电路板等场景。它甚至能从一张参考图像出发,实时生成整个画面——人物的脸、手臂、手指,以及椅子的移动、阴影和背景变化,角色在听人说话时也能点头、调整视线。
全双工架构:AI不再”轮流答题”
常见的级联系统会依次完成语音识别、语言模型回答、语音合成和数字人驱动,用户说完一句,系统处理一句。Griffin则采用全双工视频交互方案:在输出语音和视频的同时,仍持续接收并处理用户的声音与画面。
它由持续对话建模引擎和音视频生成引擎两部分构成。前者感知现场、决定说什么以及何时回应,同时输出情绪、表情和动作等控制信号;后者将这些信号转化为连续的声音与画面。对话引擎以小于一秒的间隔重新评估交流状态,所以模型在一句话说到一半时,也能根据用户反应决定暂停、继续或让出发言机会。
生成速度也跟得上。Griffin-Lite的语音模块采用流式生成,支持用约10秒参考音频克隆声音;视频模块以每段320毫秒实时生成720p、25帧每秒的画面。在H100测试中,音频到达后其效果出现在画面上的平均延迟为0.43秒,约为比较对象中下一快方法的一半。
榜单成绩与”首次通过”的争议

在英伟达VideoFDB公开榜单上,Griffin-Lite生成赛道总分3.83,人类参考分3.92,排名下一位的Gemini 2.5与Anam组合为2.80;感知赛道得分3.73,人类参考分4.20。画面质量方面,它与四种已发表流式扩散模型相比,在DOVER、FID和THEval三项指标上取得最佳成绩。
不过”首次通过”目前仍是Tavus对实验结果的定义。样本只有54人,通话仅持续一分钟,参与者又被提前告知对方是另一个人,结果仍需更大规模、更长时间验证。由于尚未全面开放预览,也存在画饼Demo的嫌疑。
身份披露决定信任边界
Tavus发布Griffin-Lite预览版的同时,宣布只向部分可信测试者开放,尚未供普通客户使用,团队正在开发AI身份披露功能,并开展进一步的安全与对齐评估。
过去,数字人的挑战是如何让人愿意与它交流;如今实时生成越来越自然,产品还必须回答:怎样让人知道自己正在与谁交流。让AI学会看眼色,或许能降低使用门槛;但让用户看清它的身份,才决定这份便利能否建立在信任之上。







