不知道大家有没有同感,每次试图跟 AI 好好对话,总觉得哪里别扭。
尤其是直接语音交流时,AI 和真人的界限显得格外清晰。
究其根本,当下的 AI 语音交互更像是在玩回合制游戏:你讲完它才接,它说完你得听着。
你没法自然地插话或停顿,它也搞不清你是对它说话,还是在跟旁人聊天。
这种交互上的硬伤,把 AI 牢牢限制在了答题机和代码工具的生态位里。
上个月,OpenAI 发布了 GPT-Live,实现了边说边听的功能,外界反响不错。
但很多人觉得这没什么新鲜的,因为今年 4 月,豆包的语音通话模式就已经升级了该功能。
前两天,豆包又反手升级了视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime,号称能提升音视频理解力,增强抗干扰和打断判停效果。
所谓的全模态全双工交互模型,核心就是针对前面提到的那些别扭之处,对回合制对话模式进行大版本迭代。
听起来挺有意思,我们赶紧找了几个真实场景实测一番。
技术再高大上,咱们更关心的还是这些新能力实不实用,用起来顺不顺心,遇事能不能帮上忙。
先来个基础的,看看新版豆包视频电话,是不是还停留在回合制阶段。
还真别说,现在的豆包聪明多了。之前的视频通话中,它像个单线程生物,耳朵和嘴巴只能有一个在工作:它开口时很难听见你的新指令;它倾听时就没法思考。
如今的豆包就好多了,即便它正喋喋不休,只要听到你的声音,立马闭嘴,并根据你的新问题调整回答。
从测试视频也能看出,它对人类提问和断句的判断更精准了。
以前,你可能只是卡壳一下,话没说完,它却 get 不到,自顾自地开始回答;现在,它基本能分辨出你是否说完,对话过程更像和一位小姐姐面对面聊天。
不仅如此,现在的豆姐抗干扰能力确实强了不少。
以前,它像长了顺风耳,身边有点动静就容易误判为你的新指令,转头去回应杂音;现在,它仿佛有了声纹解锁,基本做到和你一对一私聊。
此外,我们还发现豆包视频的识别速度非常快。
比如下面这个视频,我们在玩小游戏让它帮忙选武将,以我们滑动的速度,豆包的识别又快又准。
测试中我们发现,即便面对编辑部玩游戏、一人在前操作、后面坐着几个“狗头军师”的情况,豆包也能 hold 住这种多人对话的复杂场景。
它能随时在线听大家说话,清楚分辨说话对象和内容。
就连沉浸操作的同事小声嘀咕了一句“怎么冲刺”,都被豆包精准捕捉,并打上了“不太会玩”的标签。
接下来,我们给豆包上了点强度。刚好编辑部在装测试平台,我们让豆包充当装机高手,指导操作流程。
结果豆包简单扫了一眼,就知道这台测试平台的进度如何。
紧接着我们发现,豆包不仅能指导装机步骤,还能在误操作时主动提醒。
豆包甚至很有眼力见,实时盯着我的手部动作,在装内存条时,提前提醒注意正反面,别用蛮力硬怼。
而且我们发现,豆包完全可以全流程跟踪装机这种大型任务。就在我们根据指导装完显卡,以为大功告成准备收工时,这哥们儿居然查漏补缺了:“你丫的显卡供电线还没接呢!”
甚至连角落里最容易被忽略的主板 CPU 供电线,也被豆包发现,主打一个你随便折腾,它来兜底。
在这个过程中,我们还发现了豆包强大的记忆功能。
因为全程开着视频,等我们装完测试平台,准备离开影棚时,想起有台测试机不知放哪儿了。
我突然想到,豆包会不会知道?结果它还真记着呢。
要知道,这不仅是听懂话,简直就是 AI 吃了哆啦 A 梦的记忆面包。
我就问,平时和真人打电话,谁会帮你记随手放的东西?但豆包偏偏就帮你盯在眼里了。
如果说装机只是在影棚里的极客游戏,那在人声鼎沸、流程复杂的真实医院里,豆包还顶得住吗?
于是,我们把豆包带到了医院,想试试更新后的视频能力能否辅助老人等特殊人群在大医院独自看病。
到医院门口后,我们两眼一抹黑,问豆包先去哪儿取号。
豆包表示,面前的自动挂号窗口或旁边的自助取号机都可以。
豆包还贴心建议,如果提前预约好了且人工窗口排队人多,选自助取号更方便。
按照引导取好预约号后,常见的问题是不知道怎么走才能找到诊室。特别是大医院,很容易把病人绕晕。但现在,你只要给豆包看一眼,它会告诉你怎么走。
同样,到了诊室门口,现在很多医院得先签到才会进入排队队列。不同医院、科室的签到规则和机器各不相同,不少人会傻眼,而豆包能一眼告诉你怎么操作。
整个测试下来,从医院大门开始,豆包一步步带我们去自助机取号、找电梯到指定楼层、签到……除了路过的护士和路人会用奇怪的眼光看世超,几乎挑不出毛病。
所以在取号、找楼层、识别签到设备这些流程性任务上,豆包已能提供全程陪同帮助。
总得来看,豆包的视频能力确实有了不小提升。但在我看来,最有意思的进步不是它能多认几个东西或反应更快,而是它真的在尝试理解语气、声音等,学会了像人一样沟通。
我们也研究了一下,为何豆包视频能力提升这么快,发现真正的功臣是底层模型 SeedRealtime。
以前 AI 所谓的视频通话,本质上是流水线:
AI 先听到声音,转成文字,看一眼屏幕截图,综合处理思考,最后生成语音回答。
这种串联思路,每个步骤反应再快,连起来也显得慢半拍。
但 SeedRealtime 最狠的一点,是将声音、画面、时序与表达全部融入一个端到端模型。
这样一来,看听说在同一套系统中进行,不分步骤前后。AI 能通过手势和现场画面,秒懂你说的“这个、那个”指什么,也能精准过滤旁人的杂音。
同样的,能持续理解视频中的场景变化,AI 也就分得清何时该闭嘴,何时能主动开口提醒。
最后给人的表现就是懂得察言观色,像个真正的人了。
搞明白这些底层逻辑后,你就会发现,豆包这次展现的能力,也是目前整个 AI 行业死磕的方向之一。
隔壁海外大厂也在提实时语音、多模态交互和思考模型。除了前面提到的 GPT-Live,OpenAI 还展示了 Thinking Machines,但其功能还在演示阶段,公众无法随意使用。
所以,豆包的音视频全双工能力,才是真正往我们期待的贾维斯方向进化。
当然,离贾维斯还有距离。现在你还得举着手机,视频通话也受网络、续航等条件限制。
但至少从这次体验看,AI 助手正在从“你问一句、它答一句”,变成一个能边看、边听、边协助的角色。
再多说两句,我们突然觉得手机形态有点制约未来 AI 的能力。如果视频能力未来能跳出手机,应用到智能眼镜、手环、AI 小硬件上(当然,得解决续航、散热、网络、算力等问题),或许真是一个崭新的原生 AI 世界。
所以,不久的将来,如果在街上看到有人嘀嘀咕咕,别以为人家魔怔了,或许他正在和豆包打电话呢。
撰文:八戒
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
豆包
