消息称某厂工程机采用左上角方形 Deco、非对称四筒排列,预计为小米 18
2026-08-07
2026-08-08 0
8月6日,豆包正式宣布视频通话功能全面升级,并将接入原生音视频全双工大模型SeedRealtime,让用户在通过豆包进行视频对话时获得更完善的体验。
从名字上就能看出,SeedRealtime并非传统意义上主要负责文本问答的通用大语言模型,而是一套面向实时视频通话、持续环境感知和自然语音交流的多模态交互模型。

这个模型的特性使其能够实时理解接收到的音频和视频信息,不再需要像过去那样,先将信息拆分为视频、音频和语言三部分,然后再分别交给对应的模型处理。
用过豆包视频通话功能的朋友应该都有印象,它和你的交互就像是“对讲机”,你说话结束后,AI判断你的话已经结束了,然后它开始理解和分析,最后再回复你。
而在这个过程中,如果有第二个人插嘴,AI可能会把对方的插话也当作你尚未说完的内容,继续听下去,让你不得不结束当前对话,重新问一遍。再比如说,你说到一半停下来思考接下来该怎么说时,AI就很容易以为当前对话已经结束,然后开始回应你前半段说的话。
说实话,在目前AI企业推出的同类功能中,豆包的语音和视频通话功能已经是做得最好的了,但是在这方面也确实受限于模型特性,无法给到完美的体验。不过,现在有了SeedRealtime模型就不同了,它的音视频全双工技术让AI能够同时理解多个维度的信息,而不必将其拆开后分别理解。
换句话说,豆包在视频通话的过程中,可以时刻结合“视觉和听觉”的信息,实时理解用户的需求,知道该听谁说话、何时回应或保持沉默,也就是更有“活人感”。

比如说,以前的豆包只会被动等待你的提问,然后再做出回答,现在则会根据现场环境和之前的对话信息,主动进行交互。而且,当周围有多个人说话时,豆包可以分辨不同的说话人,然后根据上下文信息和实时对话内容,选择回应或保持沉默,这样就不用担心两个人闲聊的时候豆包突然插嘴,也不用担心自己的提问被别人打断后,豆包无法正确理解。

目前,豆包表示,搭载该模型的视频通话功能已经全面推送,用户只需要升级到最新版本的app并打开视频通话功能,就可以免费体验。只能说还得是豆包,如此给力的功能直接免费给大家用。

从此次升级来看,豆包已经不满足于做一个“会回答问题”的AI,而是开始尝试成为一个能够主动提供帮助的智能助手。而且,视频通话或许只是起点,后续如果豆包将这种实时多模态能力应用于AI眼镜等产品,想必会带来完全不同的体验。
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
WRC 2026报道团,空降北京重磅呈现。
