视频通话中48%的人被骗了:Tavus Griffin 正在摧毁最后一道真人验证防线

2026.10.03 16:19
Tavus 发布实时视频交互模型 Griffin,在一分钟视频通话实验中,54名参与者中有26人(48%)误认为对方是真人。公司声称是首个通过视频图灵测试的模型,但实验自行执行、样本量小、时长仅一分钟,实际表现仍有明显短板。更深层的信号是:视频作为最后一道身份验证防线的信念,正在被技术瓦解。

你最后一次深信不疑地认为看到的就是真的,是在什么时候?

可能是昨天和同事的视频会议,也可能是上周和家人的视频通话。文字可以代写,声音可以合成,但让对方打开摄像头——聊几句、看表情——似乎总能多一分把握。

如今,连这份眼见为实的笃定也开始受到挑战。

2026年10月1日,旧金山AI公司Tavus发布了名为Griffin的实时视频交互模型,并公布了一项实验结果:在一分钟视频通话后,54名参与者中有26人——恰好48%——认为屏幕另一端是真人。公司将其称为首个通过实时视频图灵测试的模型。

截至发稿,Tavus在X平台发布的预告视频已吸引超过1736万次观看。评论区里,赞叹与质疑各占一半。有人说科幻成真,有人问第一个能想到的用途就是诈骗。

两个反应都是对的。它们恰好指向同一件事的两面。

48%背后的飞跃与陷阱

Tavus将Griffin称为Human Interaction Model(HIM)——一个全双工视频到视频模型,能在同一系统中同时监听、观看和回应。它生成的不只是面部:椅子的阴影、背景的灯光变化、转头时的身体运动——整个画面都在实时渲染。

技术参数上:720p分辨率、25fps帧率、每320毫秒生成一个视频潜空间块(一个latent对应8帧),每块只需3步扩散推理。音频到视频的平均延迟为0.43秒——Tavus称这是业界最快。模型只需要一张参考照片和大约10秒的语音样本,就可以创建一个完整的数字分身。

在NVIDIA于2026年9月独立运行的VideoFDB全双工视频基准测试中,Griffin-Lite以3.73分(满分5)位居感知赛道15个模型之首,仅次于人类基准的4.20分。开源模型MiniCPM-o 4.5(仅音频配置)得分3.44,Gemini 2.5 Flash Native得分3.17,OpenAI gpt-realtime得分2.97。

但快速不等于完美。Griffin-Lite的中位响应延迟为2,232毫秒(约2.2秒),慢于开源MiniCPM-o的720毫秒和人类参考值的1,400毫秒。生成画质虽领先同行,但唇形同步精度排在第二——Tavus自己在发布页上诚实标注了这项不足。

然而,真正让这次发布引发两极反应的,是Tavus设计的那场镜像实验——

上一代系统(由Phoenix-4.5、Sparrow-2和Raven-1三件拼凑而成)在同流程下仅有2.4%的参与者被欺骗(41人中仅1人)。Griffin-Lite将这一数字从2.4%拉升到48%,提升了整整20倍。

这也是Griffin名字中首款宣称的依据。

但数字背后有必须正视的细节。这48%来自Tavus自己的实验:参与者通过未公开名称的众包平台招募,被告知将与另一位参与者进行一分钟视频通话,话题是今年你最期待什么。实验由Tavus内部执行,无第三方监督。

54人是一个相当小的样本。那些判断被骗的参与者事后平均置信度仅79%——他们自己也没有十足把握。判断正确的参与者平均置信度81%,两个群体之间仅差2个百分点。更关键的是,那些最终产生怀疑的参与者,大多数在通话开始后的前20秒内就已经心存疑虑。

如果把通话时长从1分钟延长到5分钟、10分钟,48%很可能守不住。

这恰恰点出了视频图灵测试概念的脆弱性。图灵测试在文本领域已被GPT-4.5以73%的被认为真人率击穿;每一次将测试的感官维度从文本扩展到语音再到视频,本质上都在重复同一个故事:在受限条件下,AI越来越擅长模仿人类的外壳,但它是否真正跨过了智能的标杆,仍然存疑。

一张自拍就够了,这意味着什么

Griffin最值得关注的技术特质,不是它能做得多好,而是它的启动门槛有多低。

一张参考照片,10秒音频,就能生成一个可以在实时视频通话中与人交流的数字分身。不需要多角度扫描,不需要专业影棚,不需要几十张训练数据。

而Tavus的API平台已有15万开发者和企业注册。虽然Griffin目前尚未进入该平台——公司明确表示在安全与披露机制就绪前不向公众提供——但其上一代技术的生成和交互能力已经通过API被广泛集成。

这意味着什么?技术门槛已经低到了这样的程度:任何有API访问权限的人,理论上都可以在应用里嵌入一张看起来像真人的面孔,让它开口说话、实时回应。

这幅画面的背面,是一个正在急剧膨胀的黑色产业。

据Surfshark研究数据,2025年全球深伪相关欺诈损失飙升至11亿美元,是2024年的3倍,是2020至2023年四年总和的9倍。83%的深伪损失来自社交媒体平台。2024年香港发生的奥雅纳(Arup)深伪骗案更是典型案例:一名员工被邀请参加视频会议,对面所有参会者全是AI生成的假人,公司因此损失2,500万美元。

Tavus的CEO Hassaan Raza在发布声明中明确表达了这种担忧:同样的技术能力既能成为产品,也能成为欺骗工具。

但问题在于,当技术本身已经被造出来、API基础设施已经铺好,一家累计融资约6,400万美元的公司,如何在开放和安全之间划出那条真正有效的界线?

目前Griffin-Lite仅限受信任测试者申请研究预览。但Tavus没有公布具体的筛选标准,也没有公布产品的最终定价和时间表。X平台上那条推文下的热门回复里,点赞最高的一条写着:除了欺诈操纵和宣传,这东西还能用来做什么?

从营销视频到实时数字人的两步跨越

Tavus的故事并不长,但浓缩了AI创业的典型轨迹。

2020年,Hassaan Raza和Quinn Favret在旧金山创立了Tavus。公司出身Y Combinator 2021夏季批次,最初的核心业务是企业级个性化视频生成——用AI替销售人员和营销团队生成数字分身,自动化发送个性化的视频消息。客户包括Verkada、Genesys、Pathrise等。公司声称产品能让点击率提升5倍、转化率提升8倍。

2024年3月,Tavus完成1,800万美元A轮融资,由Scale Venture Partners领投,Sequoia Capital和Y Combinator跟投。彼时,它还在讲用AI替销售人员批量生成个性化视频的故事。

2025年11月,Tavus完成4,000万美元B轮融资,由CRV领投,Sequoia、Scale Venture Partners、Y Combinator、HubSpot Ventures和Flex Capital跟投,累计融资约6,400万美元。与OpenAI、Anthropic动辄百亿美元的账本相比,这支体量不算什么。然而18个月后,同一个团队发布了一个能在实时视频通话中以假乱真的模型。

从替销售人员拍视频到替AI生成一个会实时回应的脸,Tavus走了两步:第一步是把数字分身做得足够逼真;第二步是让分身能实时互动。Griffin就是第二步的产物。

这两步之间不到两年时间。它揭示了一个更深层的行业事实:在AI领域,护城河的时间窗口正在急剧缩短。你用来做营销数据的资产,换一个角度,可能就是未来最危险的竞争武器。

被重新定义的对面有人

给AI视频领域画一个谱系,一端是Synthesia和HeyGen——它们帮你从文字脚本生成一段有人说话的预制视频,相当于视频界的预制菜。另一端是实时交互模型:不仅能提前录制好菜,还能在餐桌上和你聊天、理解你的表情、回应你的语气。

Tavus Griffin走的是后一条路,但这条路上并非只有它一个玩家。

D-ID在2026年推出了V4 Expressive Visual Agents——基于真人演员训练的数字人,能连接LLM实时对话,根据情绪调整面部表情,通过WebRTC以最高100fps流式传输。起步价每月5.9美元,比Tavus未公开的定价更具侵略性。

而谷歌、Meta和OpenAI的实时视频生成能力都在向通过摄像头理解世界的方向演进。只不过这些巨头更加专注通用AI助手,而非专门优化像真人的视频通话体验——这也正是Tavus选择的一条更窄、但也更深的路线。

如果AI实时视频通话的成本降到足够低、质量好到无法分辨,所有需要人脸出镜的交互场景都将被重写——客服、销售、教育、心理咨询、线上诊疗。每一个行业都可能面临一个选择:用真人成本高,用AI用户可能发现不了。

站在用户这一侧,你需要重新定义一件事:什么才叫对面有人。

这个问题没有标准答案。但Griffin的价值恰恰在于它把这个问题从哲学假设变成了日常现实。

从技术文明演进的大尺度来看,每当人类发明一种新的通信技术——电报、电话、Email、短信——我们总是先用它来缩短距离,然后花很长时间才学会提防里面的骗子。视频通话作为最真实的通信方式的地位,正在经历这个转折点。

Tavus的创始人们把他们的愿景称为Human Computing——让计算机变得像人一样自然地和你对话。这个愿景美好而充满未来感。但它也潜藏着另一种可能性:当计算机真的学会了像人一样说话、看人、回应表情时,像人本身就不再是一个充分条件。

这个人造的Griffin——半狮半鹰的神话生物——也许并不是来摧毁什么防线的。它只是提前把一道选择题摆在了我们面前:当你面前的这张脸、这个声音、这段实时视频都可以被AI完美模拟时,你要靠什么来判断,对面是不是一个真实的人?

眼见为实这句话,可能必须从我们的词典里划掉了。

作品声明:内容由AI生成