前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.04 · 13:27/4 MIN/编译自 极客公园/1 阅读

Tavus发布端到端全双工视频模型Griffin

美国AI视频公司Tavus发布人类交互模型Griffin,告别传统数字人级联拼凑架构。该模型支持全双工、端到端视频对话,平均延迟低至0.43秒,近半数受测者误认为自己在与真人视频通话。

一个男人对着镜头拧魔方,屏幕里的女孩注视着他的动作,时不时点头,提醒下一步该转动哪一面。当他卡壳低头思索时,女孩并未插话,只是安静等待;等他重新动手,她才顺势接上下一句。

这并非一次普通的视频通话。屏幕中女孩的脸庞、声音以及每一次点头和停顿,均由 AI 实时生成。

近日,美国 AI 视频公司 Tavus 发布了一款名为 Griffin 的模型,并将其定义为全球首个「人类交互模型」(Human Interaction Model,HIM)。测试数据显示,在一项 1 分钟的视频通话盲测中,54 名参与者中有 26 人误以为自己正在和真人交流,比例高达 48%。而 Tavus 上一代系统在同样测试下的真人通过率仅为 2.4%。

这标志着数字人技术从单纯卷「画面精细度」,转向了攻关「人类交互逻辑」。

Vanessa 展示举起大拇指

告别机械感:实时对话不再「出戏」

在官方公布的演示中,Tavus 联合创始人兼 CEO Hassaan Raza 与名为 Vanessa 的虚拟形象进行跨时区视频沟通。整场对话流畅自然,无论是打趣调侃、要求比大拇指,还是另一位同事突然入镜,AI 都能自然承接互动。系统彻底摆脱了传统数字人「你说完、愣一秒、再机械作答」的卡顿感。

Vanessa「看到」另一位工作人员入镜后开起了玩笑

在开放场景测试中,Griffin 展现出几项关键能力:

  • 理解沉默的意义:指导工程师焊接电路板时,模型会记录任务进度,在关键节点主动开口,而不是将对方的沉默误判为插话时机。
  • 支持双向抢话打断:在讲故事或分享喜讯时,模型允许用户随时打断,并能在两人短暂同时发声的状态下维持逻辑连贯。
  • 动态像素生成:在「西蒙说」动作互动中,肢体动作、光影投射和背景画面均实时生成,不再受限于静态贴图。

Vanessa 受到表扬后表示「脸红」了

端到端全双工架构重塑交互

市面上大多数实时数字人采用级联架构,类似接力赛:语音识别转文字,交给大语言模型生成回复,语音合成念出文本,最后通过形象驱动模型渲染口型。这种串联方案每一步都在堆积延迟、丢弃语气和表情信息,且只能以单向轮流方式交互。

Griffin 模型技术细节解析

Griffin 则转向了全双工、端到端「视频到视频」的处理架构,主要分为两大核心:

  1. 连续对话建模:模型以亚秒级频率持续重新评估对话状态,综合语义、语气、微表情和画面动作,决定当前是该回答、点头附和还是安静倾听。输出信号直接涵盖情绪、姿态与手势参数。
  2. 音视频生成引擎:音频侧自研了 Tavec 编解码器,配合自回归扩散模型,以最小 10 毫秒为单位流式输出语音;视频侧通过分布匹配蒸馏与 Self-Forcing 自回归训练,将庞大的视频扩散模型压缩到可以逐帧生成,以 320 毫秒为块生成 720p 视频。从听到输入到画面做出反应,平均延迟仅 0.43 秒。

Griffin 模型在测试中的成绩

此外,Griffin 摆脱了传统 3D 人脸先验约束,仅凭一张参考图片即可实时推演身体晃动、阴影与手势细节。在 NVIDIA 的全双工音视频对话基准 VideoFDB 评测中,Griffin-Lite 在生成维度拿下 3.83 分(满分 5 分),逼近人类基准的 3.92 分;感知维度同样以 3.73 分位列榜首,超过 MiniCPM-o 与 OpenAI gpt-realtime。

数字人下半场:从「像不像」到「懂不懂」

过去,以播报和口播为主的数字人主要依靠渲染精度生存。但在实时交互场景中,拼接式架构的物理延迟容易彻底打破沉浸感。

在游戏中测试 AI 数字人在指示下做动作

如同 GPT-4o 掀起语音端到端风潮一样,Griffin 将端到端全双工范式推进至视觉模态,倒逼行业将竞争重心从「图形渲染」迁移至「实时对话建模」。

不过,该测试仍存在一定局限。54 人的样本量较小,且受测者预先被告知对方是真人,存在心理暗示。在没有防备时容易蒙混过关,但一旦产生怀疑,部分受测者在 20 秒内便能察觉异样。

目前 Griffin-Lite 仅面向少数受信任机构内测。Tavus 表示,正在联合安全组织开发「AI 身份主动披露」机制,以规避可能引发的视频诈骗与身份冒充风险。

标签:多模态全双工

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

微软推出ThinkingBox:用真实数据库检验AI智能体
TOP1

微软推出ThinkingBox:用真实数据库检验AI智能体

马斯克芯片超级工厂接触台积电
TOP2

马斯克芯片超级工厂接触台积电

3

Tavus发布端到端全双工视频模型Griffin

5小时前
Tavus发布端到端全双工视频模型Griffin
4

白宫成立超级智能工作组,由国家情报总监牵头

7小时前
白宫成立超级智能工作组,由国家情报总监牵头
5

无人化大行其道,为什么我们依然需要载人机器人?

7小时前
无人化大行其道,为什么我们依然需要载人机器人?
6

Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队

7小时前
Kimi接入OpenAI结算体系,AMD巨资收购李飞飞团队
7

通用模型进军3D,Meshy不到两年ARR破1亿美元

10小时前
通用模型进军3D,Meshy不到两年ARR破1亿美元
8

FBI员工数据遭窃案嫌疑人在约旦被捕

11小时前
FBI员工数据遭窃案嫌疑人在约旦被捕
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断