点头、抢话、会脸红,一半人分辨不出这是位「AI 小姐姐」

栏目:互联网 | 来源:极客公园 | 2026-10-03 11:38

AI 数字人,第一次学会了「察言观色」。

作者|宇航猿

编辑|靖宇

一个男人对着镜头拧魔方,屏幕里的女孩盯着他手上的动作,时不时点头,提醒他下一步该转哪一面。他卡住了,低头琢磨,她没有插话,只是安静地等着。等他重新动手,她才接上一句。

如果没人告诉你,这看起来就是一次再普通不过的视频通话。

但屏幕里那个女孩并不存在。她的脸、她的声音、她的每一次点头和停顿,全部由 AI 实时生成。

Griffin 模型的演示效果确实非常惊艳|视频来源:X

10 月 1 日,美国 AI 视频公司 Tavus 发布了一个名为 Griffin 的模型,并把它定义为全球第一个「人类交互模型」(Human Interaction Model,简称 HIM)。

Tavus 公布的数据显示,在一项一分钟视频通话测试里,54 名参与者中有 26 人事后认为自己是在和真人聊天,比例接近 48%。作为对照,Tavus 上一代系统在同样的测试中,41 个人里只骗过了 1 个,比例 2.4%。

从 2.4% 到 48%,这不是一次常规的版本迭代。

过去几年,数字人赛道拼的是「脸像不像」;Griffin 想证明的,是 AI 已经开始学会「像人一样聊天」。

01

不「出戏」的 AI

Tavus 给 Griffin 准备的发布视频,本身就是一次 AI 视频通话。

画面里,Tavus 联合创始人兼 CEO Hassaan Raza 深夜坐在办公室,打开笔记本电脑,屏幕那头是一个戴眼镜的年轻女孩,名叫 Vanessa。她先开口,说这么晚了你还没走。两人聊起一件正事,新模型要怎么向外界介绍。

Hassaan 有点犹豫,说解释来解释去都不如直接给大家看。Vanessa 接过话头,提议干脆就放一段他俩聊天的录像,「他们甚至都不用去想这件事」。

于是你看到的这段视频,就是那段录像。

Vanessa 展示举起大拇指|图片来源:X

接下来的一分多钟里,两个人像老同事一样互相打趣。Hassaan 让她比个大拇指,她立刻照做;他夸她是自己最喜欢的同事,她笑着说你让我脸红了;他炫耀身上那件二手淘来的衣服,她吐槽他「活在边缘」,顺便开了个玩笑,说自己会保持呼吸平稳,免得把他电脑的 CPU 耗得更快。

Vanessa「看到」另一位工作人员入镜后开起了玩笑|图片来源:X

中途还有另一位同事凑进 Hassaan 的镜头,Vanessa 也自然地跟两个人聊了起来。视频临近结尾,Hassaan 感慨说,跟机器说话和跟人说话之间的那条线,正在变得非常非常薄。

整段视频最「出戏」的地方,恰恰是它没有出戏。她的笑点接得上,停顿也停得自然,没有那种数字人特有的「等你说完、愣一秒、再开口」的机械感。

Vanessa 受到表扬后表示「脸红」了|图片来源:X

当然,这是一段精心挑选的宣传片。更能说明问题的,是 Tavus 在技术博客里放出的几段测试片段。他们找来从没用过 Griffin 的普通人,和模型进行开放式对话。

第一段是魔方教学。一个叫 Ari 的人边转魔方边听 Griffin 指导,模型盯着他手里的魔方,持续给出确认。当他停下来思考时,它会一直等到他准备好再开口。

Vanessa 指导工作人员如何玩魔方|视频来源:X

第二段更进一步。工程师 Sagar 在焊一块主板,Griffin 在旁边指导。它会记录时间和他在任务中的进度,在该做下一步的时候主动开口,而不是一见他沉默就插话。这件事对人来说稀松平常,对 AI 却很难,它需要理解「沉默」本身也是一种信息。

第三段是经典的「西蒙说」游戏。只有当对方说出「西蒙说」时,Griffin 才模仿动作,没说就当场拆穿。值得注意的是,画面里的每一个动作都是现场生成的,身体和背景也包括在内。

还有几段展示了「抢话」的能力。有人告诉 Griffin 自己升职了,它在对方话还没说完时就做出反应,两人短暂地同时说话,却没有乱了线索。另一段里,Ari 和 Griffin 一起编故事,互相打断,模型接住了每一个转折。

这些片段指向同一件事。过去的数字人是「会动的播音员」,而 Griffin 开始像一个「会接话的人」。

02

全双工,视频到视频

要理解 Griffin 为什么能做到这一步,先看过去的数字人是怎么工作的。

市面上绝大多数实时 AI 数字人,用的都是一种「级联」架构,像一场接力赛。先由语音识别模型把你说的话转成文字,交给大语言模型生成回复,再由语音合成模型把文字念出来,最后由形象驱动模型让一张脸跟着声音动起来。

这套流程的问题很明显。每多一次交棒,就多一份延迟,也多丢一份信息。你说话时的语气、皱眉的表情、手里拿着的东西,在文字转写那一步就被扔掉了,后面的模型根本看不到。更要命的是,它必须等你把话说完才能开始处理,于是就有了那种标志性的尴尬,你说完,屏幕里的人愣上一两秒,然后才开口。

Tavus 自己就是这条路线上的头部玩家。它上一代的方案由三个模型组成,Phoenix-4.5 负责渲染人脸,Sparrow-2 负责判断什么时候该说话,Raven-1 负责感知用户的情绪。这套组合已经被 15 万开发者和企业使用,但在真人测试里只有 2.4% 的通过率。

Griffin 的思路是把这场接力赛,变成一个大脑同时处理所有事情。

Tavus 把它描述为一个「全双工、视频到视频」的模型。所谓全双工,就是像打电话一样能同时听和说,而不是像对讲机那样你一句我一句。它由两大部分构成。

Griffin 模型技术细节解析|图片来源:https://www.tavus.io/griffin

第一部分是「连续对话建模」。它不再按轮次等待,而是每隔不到一秒就重新评估一次对话状态,综合你说了什么、怎么说的、脸上什么表情、镜头里有什么,决定此刻该说话、该点头、该「嗯」一声,还是继续安静地听。它输出的不只是要说的字,还有一整套控制信号,涵盖情绪、姿态、表情和手势。正因为判断依据是语义而不是「声音停了没有」,它才能分辨出你是说完了,还是在停下来想事情。

Griffin 模型技术细节解析|图片来源:https://www.tavus.io/griffin

第二部分是音视频生成引擎,负责把这些控制信号变成声音和画面。

语音这一侧,Tavus 自研了一个叫 Tavec 的音频编解码器,把 48kHz 的音频压缩成每秒 100 帧、每帧仅 40 个数值的连续表示。在这个紧凑的空间里,一个自回归扩散模型边接收指令边生成语音,最小以 10 毫秒为单位往外输出声音。一句话还没生成完,前半句已经在播放了。它还能用大约 10 秒的录音克隆一个人的声音。

Griffin 模型技术细节解析|图片来源:https://www.tavus.io/griffin

视频这一侧是最难的部分。高质量的视频扩散模型通常需要几十步迭代,且一次生成一整段,根本不可能实时。Tavus 的做法是「蒸馏」,分三步把一个庞大缓慢的模型压缩成又快又稳的版本。先用分布匹配蒸馏把几十步压到几步,再改造成一帧接一帧生成的自回归结构,最后用一种叫 Self-Forcing 的方法训练,让模型在自己生成的历史画面上继续生成,避免时间一长画面漂移、人脸走样。

再加上视频编码器在时间维度上做了 8 倍压缩,最终 Griffin 可以以 320 毫秒为一块,实时生成 720p 视频。从听到声音到脸上做出反应,平均延迟 0.43 秒,Tavus 称这只有次快方案的一半。

还有一个容易被忽略的变化。Tavus 前几代模型依赖大量 3D 人脸先验,因此很难做出大幅度的手势和身体动作,背景也只能是静态的。Griffin 抛掉了这些先验,只用一张参考照片,就能实时生成画面里的每一个像素。椅子的晃动、投在墙上的影子、手指的动作,以及人物身后的背景,都在模型的控制之内。

Griffin 模型在测试中的成绩|图片来源:https://www.tavus.io/griffin

第三方评测也给了一些佐证。在 NVIDIA 推出的全双工音视频对话基准 VideoFDB 上,Griffin-Lite 在「生成」赛道拿到 3.83 分(满分 5 分),比排名第二的 Gemini 2.5 加 Anam 的组合高出 1 分多,离人类参考值 3.92 只差 0.09。在考察「看懂对方」的感知赛道,它也以 3.73 分排名第一,领先 MiniCPM-o 4.5、Gemini 2.5 Flash 和 OpenAI 的 gpt-realtime。

如果把视野拉长一点,这条路其实并不陌生。2024 年 GPT-4o 发布时,OpenAI 就是靠端到端的语音模型取代了「语音识别、大模型、语音合成」的三段式流程,让 AI 语音第一次有了插话、语气和停顿。

Griffin 做的,是把这场端到端革命从声音推进到了画面。

03

AI 数字人的下半场

Griffin 真正的冲击,可能不在于它有多像真人,而在于它重新定义了数字人这门生意该比拼什么。

过去几年,数字人行业的主线一直是「做一张更像的脸」。HeyGen、Synthesia 这类公司,主打的是预先生成的口播视频,你写好稿子,它生成一个数字人替你念。国内大量的直播带货、政务客服数字人,本质上也是同一套逻辑,形象逼真、口型对得上,就算及格。

这条路线解决的是「播」的问题,不是「聊」的问题。一旦进入实时对话,级联架构的天花板就暴露无遗,脸做得再精细,那一两秒的迟滞和不合时宜的微笑,都会瞬间把人拉出来。

Griffin 把赛道的核心指标,从「像不像」换成了「懂不懂」。

它的卖点不是某一帧画面有多高清,而是什么时候点头、什么时候插话、什么时候闭嘴。这是一个「对话建模」问题,而不是「图形渲染」问题。

这对整个行业意味着一次不小的路线拷问。如果端到端的全双工模型被证明是对的,那么那些靠堆砌「语音识别、大模型、语音合成、形象驱动」四件套搭起来的产品,护城河会迅速变浅。就像 GPT-4o 之后,单纯做语音合成的公司都不得不重新思考自己的位置。

在游戏中测试 AI 数字人在指示下做动作|图片来源:X

不过,在为「图灵测试被攻破」欢呼之前,有必要给这个 48% 泼一点冷水。

Griffin 通过的算不上严格意义上的图灵测试。经典的图灵测试里,裁判明知对面可能是机器,需要在人和机器之间做出判断。而 Tavus 的实验中,参与者被告知自己会和另一位参与者视频通话,直到问卷最后才被问到是否想过对方可能不是真人。

先告诉一个人「对面是人」,他最自然的答案当然是「人」。换个角度看,在这样的心理暗示下,仍有 52% 的人判断出对面是 AI,这个数字本身就耐人寻味。

另外,这次测试的样本量很小。54 个人,按 48% 的比例粗略估算,统计上的误差范围大约在正负 13 个百分点,真实的比例可能低至三成多。测试只有一分钟,话题是「今年有什么期待」这类轻松寒暄,并没有涉及需要深度理解或持续追问的场景。用这样一个样本得出「首个通过视频图灵测试的模型」的结论,难免有以偏概全的嫌疑。X 上的社区笔记也已经标注,这一结果未经独立验证,也没有遵循标准测试协议。

数据里还藏着一个细节。超过一半的参与者表示,通话中压根没想过对方可能是 AI,而那些起了疑心的人,大多在前 20 秒内就察觉了。

Griffin 骗得过没有防备的人,但面对有警觉的人,它露馅得很快。

即便在 NVIDIA 的基准上,差距也依然存在。Griffin-Lite 在「生成」上已逼近人类,但在「感知」上,它与人类参考值仍差了 0.47 分,「看懂对方」这件事远比「演得像」更难。

不过,普通用户目前还用不上它。Decrypt 的记者尝试体验 Tavus 的模型,结果并不理想,后来才发现 Griffin-Lite 根本没有对客户开放,只提供给少数受信任的测试者。

但所有这些疑虑,都无法抹掉一个事实。从 2.4% 到 48%,不管实验设计有多少瑕疵,同一家公司在同一套测试方法下实现了 20 倍的提升,这本身就说明了端到端架构带来的是一次质变。数字人,或者说 AI 真人交互模型,确实迈过了一道此前没人迈过的门槛。

至于安全问题,Tavus 自己也承认,让 Griffin 成为强大交互界面的那些特性,同样可以被用来让人误以为对面不是 AI。这也是它迟迟不公开发布的原因,公司表示正在开发「主动披露身份」的功能,并与 AI 安全组织合作。考虑到今年年初就有朝鲜黑客利用深度伪造视频,在 Zoom 通话中冒充熟人实施攻击,这份谨慎并非多余。

回到那段发布视频的结尾。Hassaan 说,跟机器说话和跟人说话之间的那条线,正在变得越来越薄。

当那条线薄到肉眼看不见的时候,我们要重新学会的,或许不是如何分辨 AI,而是如何在一个分辨不出的世界里,决定该信任谁。

*头图来源:X

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

视频里哪些细节暴露了她是位 AI 人造人?

了解更多

猜你想看

← 返回首页