模型#视频生成#跑分

Tavus 发布 Griffin:首个「人类交互模型」

Tavus 10 月 1 日发布全双工视频到视频模型 Griffin:一分钟通话里 48% 的测试者误认其为真人,目前仅限受信任测试者。

Griffin 官方宣传图:左侧是标题「Griffin,首个人类交互模型(HIM),Tavus 出品」,右侧是山崖上的狮鹫插画

Tavus 10 月 1 日发布了 Griffin,一款它称为「人类交互模型」(Human Interaction Model,HIM)的实时视频对话模型:边听边看边说,只靠一张参考照片就逐帧生成人物的脸、声音和肢体。据 Tavus 自己做的测试,54 位以为自己在和另一位参与者通话的人里,有 26 位(48%)事后认为对面是真人;该公司上一代系统在同样的测试里是 41 人中 1 人(2.4%)。目前只有名为 Griffin-Lite 的研究预览版,开放给少数受信任的测试者,没有 API,也没有价格。

要点

  • 架构:全双工、视频到视频的单一系统,感知、决策、生成并行运行,不再是「语音识别 → 大模型 → 语音合成 → 形象驱动」的接力。
  • 自测成绩:一分钟视频通话,26/54(48%)的人认为对面是真人;上一代 Phoenix-4.5 方案是 1/41(2.4%)。
  • 第三方基准:在 NVIDIA 的 VideoFDB 上,生成赛道 3.83 分(真人参考 3.92),感知赛道 3.73 分(真人参考 4.20),均为榜单最高。
  • 可用性:仅 Griffin-Lite 预览版,限受信任测试者;Tavus 称要先解决披露与安全问题才会放开。

背景

Tavus 过去做的是「数字人」的流水线:Phoenix-4.5 负责渲染人脸,Raven-1 负责感知用户,Sparrow-2 负责判断什么时候该开口。三个模型各管一段,已经有约 15 万开发者和企业在用,但官方承认它在真人盲测里最高只有 2% 的通过率。

这类级联方案的毛病不在画质,在交接。语气、表情、手里拿的东西,一转成文字就丢了;系统还得等你说完才开始处理,所以你停下来想一想,它就把沉默当成轮到自己,或者愣一两秒才接话。语音这边已经走过类似的路:端到端的实时语音模型取代三段式流程之后,AI 才有了插话和语气,Griffin 想把同样的转变从声音推进到画面。

事实部分

以下数字除特别注明外,均为 Tavus 官方发布页所述。

技术路线。 Griffin 由两部分组成:连续对话建模引擎,每隔不到一秒重新评估一次对话状态,决定说、停、让话还是附和;音视频生成引擎,把这些控制信号转成语音和 720p 视频。视频生成器由一个大型多步扩散模型蒸馏而来,官方称在 H100 上从音频到画面的平均延迟为 0.43 秒,是次快方法的一半。语音侧用自研编解码器 Tavec,可用约 10 秒的录音克隆声音。

视频质量。 与四个已发表的流式扩散模型相比,Griffin-Lite 在 DOVER、FID 和 THEval 上领先;唇形同步指标 LSE-C 为 7.27,排第二(AvatarForcing 为 7.73)。

VideoFDB。 这是 NVIDIA 的全双工音视频对话基准,官方称由 NVIDIA 独立评分:

赛道系统总分抢话对齐 / 响应时间
生成真人基准3.9278% / 900 ms
生成Griffin-Lite3.8362.8% / 1892 ms
生成Gemini 2.5 + Anam2.8044% / 2840 ms
感知真人基准4.2090% / 1400 ms
感知Griffin-Lite3.7373.8% / 2232 ms
感知MiniCPM-o 4.53.4073% / 720 ms

感知赛道共评测 15 个模型,Griffin-Lite 排第一。数据来源:Tavus 发布页,2026 年 10 月 1 日。

真人盲测。 参与者被告知会和「另一位参与者」聊一分钟「今年期待什么」,事后才在问卷最后一题问是否想过对方可能不是真人,随后告知真相。认为是真人的人平均自信度 79%,认为是 AI 的人 81%。七分制评分里,自然度 5.4、可信度 5.6、愿意再聊 5.8、「真的在听」5.5,「对话流畅」4.9 最低。

各方说法

The Rundown 在 10 月 2 日的报道里指出,这是一次很小的短时测试,参与者本来就以为会遇到真人,更长的通话里印象能否保持尚不清楚。它还注意到,生成赛道的对比表里只列了两个竞争的 AI 系统,Griffin-Lite 的领先幅度要放在这个表的范围里看;感知赛道与真人的差距(0.47 分)比生成赛道(0.09 分)大得多。

极客公园 在 10 月 4 日的长文里做了一个粗算:54 人、48% 的比例,统计误差大约在正负 13 个百分点。我们按常规正态近似自己算了一遍,结果一致,区间大约是 35% 到 61%。该文还提醒这不是严格意义上的图灵测试,因为经典设定里裁判知道对面可能是机器,而这里参与者被告知对面是人。另外它引用 Decrypt 记者的经历:想体验 Tavus 模型,才发现 Griffin-Lite 并不对客户开放。

什么值得买 上的一篇综述把账分成三笔:自测分、榜单分、可用性。它特别指出,起疑的参与者大多在前 20 秒内就起了疑,意思是有戒心的人露馅很快,这点与官方披露的结果一致。

三方说法有一个共同点:2.4% 到 48% 的跳跃真实发生在同一套测试方法里,但没人认为这个数字可以外推成日常场景里的欺骗率。

编辑判断

比 48% 更值得记的,是 Tavus 把比拼的指标从「脸像不像」换成了「懂不懂」:什么时候点头,什么时候别说话。焊接演示里它等对方沉默完再开口,这在级联架构里很难做出来,因为系统不存在「同时听、看、决定」这回事。如果端到端路线站得住,靠语音识别、大模型、语音合成、形象驱动四件套拼出来的数字人产品,护城河会变浅。

要打的折扣也很明确。48% 来自厂商自己设计、执行并公布的实验;一分钟、闲聊、事先暗示对面是人,是最宽松的条件。响应时间中位数 1892 毫秒,约是真人 900 毫秒的两倍。官方也没有说成本:720p 实时生成跑在 H100 上,而 Griffin-Lite 的价格和 API 都没有公布。

对开发者,现阶段没有可接的东西,只能继续用 Tavus 现有的 PAL 和 API(Phoenix、Raven、Sparrow)。对其他人,安全面更要紧:Tavus 自己写明,让模型像真人的那些特性,同样能让人误以为对方不是 AI。The Rundown 提到的香港「假 CFO 视频会议」转账 2500 万美元一案,说明伪造视频会议早已有人得手;一个能对提问做出反应的对象会让这类骗局更难识别。谁来强制披露 AI 身份,Tavus 还没有给出答案。同样因安全顾虑暂缓放开的前沿模型,我们此前报道过 OpenAI 叫停 GPT-6.1 Astra。我们没有看到 Griffin 的任何独立复现,所以建议把它当作「方向被验证了」,而不是「图灵测试被攻破了」。

怎么试

目前没有公开入口。Tavus 在发布页放了一张申请表,受信任测试者可申请 Griffin-Lite 的研究预览;官方说 Griffin 要等安全问题处理好才会进入 Tavus 平台。想先体验同类产品,可以用现有的 Tavus API 或 PAL Maker 搭一个基于 Phoenix、Raven、Sparrow 的 PAL。

接下来

三件事值得盯:Griffin 何时进入 API 以及定价;Tavus 说的「主动披露 AI 身份」功能长什么样;有没有第三方在更长、更有戒心的通话里复现类似的结果。