找回密码
 立即注册
搜索
查看: 828|回复: 3

[科技] 首次通过“视频图灵测试”,新AI模型在视频对话中的表现几可乱真

[复制链接]
     
发表于 2026-10-9 15:12 | 显示全部楼层 |阅读模式
此帖将于2026-11-08 15:11自动关闭
首次通过“视频图灵测试”,新AI模型在视频对话中的表现几可乱真
2026-10-09 01:01:00



视频截图。图片来源:Tavus官网

科技日报记者 张梦然

美国旧金山AI视频公司Tavus官网称,该公司最新发布的新模型Griffin-Lite,在组织54名受试者进行一分钟视频通话后,26人误以为对方是真人,占比48%。同样的测试流程下,上一代系统只有2.4%的受试者这样判断。Tavus称,这是首个通过“视频图灵测试”的实时视频对话模型,并把它定义为“人类交互模型”。与传统语音助手不同,Griffin-Lite能在双方同时说话的情况下,实时做出反应,无论是附和还是打断,都如同真人聊天一样。

“视频图灵测试”是在实时视频通话场景下检验AI能否在对话中表现得更像真人,受试者不知道对方身份,通过自然交流判断对方是人还是机器。如果相当比例的人在短时间内误以为AI是真人,就视为通过了测试,标准比纯文本图灵测试更严格,还要考验表情、语气、反应速度等非语言能力。

这项成绩也被拿到独立基准中验证。英伟达的VideoFDB专门考察全双工视频对话(双方可以同时说话、同时做反应),从生成和感知两条线打分。Griffin-Lite在两条线上都超过参与对比的公开模型,生成得分与真人参考水平相当接近,主要差距在于响应速度仍慢于真人。在画质、口型同步和延迟的单项对比中,它也处于领先。

能做到这一步,关键是改变了技术路线。Griffin-Lite用端到端方式把感知、判断和生成合在一起。一个连续对话引擎不断接收对方的音视频,以不足一秒的间隔判断当下该说话、附和、插话还是安静等待,同时定下内容和语气,以及表情、手势、身体姿态。另一套生成引擎随之实时生成语音和全身画面,从一张参考照片就能渲染出动态影像,背景、阴影、椅子移动都会跟着变,长时间对话也不会失真。

目前Griffin-Lite仅向少量受信任测试者开放,商业平台没有接入。Tavus解释,暂不大范围开放的原因是太像真人,容易让人误以为对话对象不是AI。

欧盟《人工智能法案》已要求,与人类直接交互的AI必须明确告知AI身份。Tavus正加紧开发强制身份披露功能,并与AI安全机构合作,完整版Griffi则要等合规问题解决后推出,时间表和定价尚未公布。

总编辑圈点

我们靠什么判断一个人物形象是真人还是机器?过去的数字人,需要语音识别、文本对话、语音合成、形象渲染去进行逐级接力,每交接一次,都会增加延迟,语音中的微妙语气也容易丢失。凭借直觉,我们能很容易地作出判断。但现在,倾听、附和、插话与表情,可以同步发生,人类赖以识别同类的非语言线索失效了。令人欣喜的是,这次技术似乎并未跑在规则前面。令人焦虑的是,“眼见为实”的防线塌了,这套信任重建的成本可能会非常高。





回复

使用道具 举报

发表于 2026-10-9 15:19 来自手机 | 显示全部楼层
tavus真能炒作,这种东西是在特定环境下的。一个大头只会对着摄像头讲话,你让他做点动作来证明立马就傻逼了。

— from samsung SM-S911U1, Android 16, S1 Next Goose v3.5.99
回复

使用道具 举报

发表于 2026-10-9 15:30 | 显示全部楼层
利好OnlyFans
回复

使用道具 举报

     
发表于 2026-10-9 15:41 | 显示全部楼层
国外有个话题就是拿ai面试官做奇怪的事
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-9 20:14 , Processed in 0.025301 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表