美国AI视频公司Tavus发布人类交互模型Griffin,告别传统数字人级联拼凑架构。该模型支持全双工、端到端视频对话,平均延迟低至0.43秒,近半数受测者误认为自己在与真人视频通话。
一个男人对着镜头拧魔方,屏幕里的女孩注视着他的动作,时不时点头,提醒下一步该转动哪一面。当他卡壳低头思索时,女孩并未插话,只是安静等待;等他重新动手,她才顺势接上下一句。
这并非一次普通的视频通话。屏幕中女孩的脸庞、声音以及每一次点头和停顿,均由 AI 实时生成。
近日,美国 AI 视频公司 Tavus 发布了一款名为 Griffin 的模型,并将其定义为全球首个「人类交互模型」(Human Interaction Model,HIM)。测试数据显示,在一项 1 分钟的视频通话盲测中,54 名参与者中有 26 人误以为自己正在和真人交流,比例高达 48%。而 Tavus 上一代系统在同样测试下的真人通过率仅为 2.4%。
这标志着数字人技术从单纯卷「画面精细度」,转向了攻关「人类交互逻辑」。

在官方公布的演示中,Tavus 联合创始人兼 CEO Hassaan Raza 与名为 Vanessa 的虚拟形象进行跨时区视频沟通。整场对话流畅自然,无论是打趣调侃、要求比大拇指,还是另一位同事突然入镜,AI 都能自然承接互动。系统彻底摆脱了传统数字人「你说完、愣一秒、再机械作答」的卡顿感。

在开放场景测试中,Griffin 展现出几项关键能力:

市面上大多数实时数字人采用级联架构,类似接力赛:语音识别转文字,交给大语言模型生成回复,语音合成念出文本,最后通过形象驱动模型渲染口型。这种串联方案每一步都在堆积延迟、丢弃语气和表情信息,且只能以单向轮流方式交互。

Griffin 则转向了全双工、端到端「视频到视频」的处理架构,主要分为两大核心:

此外,Griffin 摆脱了传统 3D 人脸先验约束,仅凭一张参考图片即可实时推演身体晃动、阴影与手势细节。在 NVIDIA 的全双工音视频对话基准 VideoFDB 评测中,Griffin-Lite 在生成维度拿下 3.83 分(满分 5 分),逼近人类基准的 3.92 分;感知维度同样以 3.73 分位列榜首,超过 MiniCPM-o 与 OpenAI gpt-realtime。
过去,以播报和口播为主的数字人主要依靠渲染精度生存。但在实时交互场景中,拼接式架构的物理延迟容易彻底打破沉浸感。

如同 GPT-4o 掀起语音端到端风潮一样,Griffin 将端到端全双工范式推进至视觉模态,倒逼行业将竞争重心从「图形渲染」迁移至「实时对话建模」。
不过,该测试仍存在一定局限。54 人的样本量较小,且受测者预先被告知对方是真人,存在心理暗示。在没有防备时容易蒙混过关,但一旦产生怀疑,部分受测者在 20 秒内便能察觉异样。
目前 Griffin-Lite 仅面向少数受信任机构内测。Tavus 表示,正在联合安全组织开发「AI 身份主动披露」机制,以规避可能引发的视频诈骗与身份冒充风险。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断