SeedRealtime 音视频全双工大模型发布:走向全模态自然交互

SeedRealtime 音视频全双工大模型发布:走向全模态自然交互

日期

2026-08-05

分类

模型发布

今天,我们正式推出原生音视频全双工大模型 SeedRealtime。

作为走向全模态交互的关键一步,SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破:

  • 音视频联合理解: 原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。

  • 主动的交互能力: 具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

  • 流畅的交互节奏: 能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。

端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半——模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够顺畅、完整交流的概率也有明显提升。

目前,SeedRealtime 已在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地,欢迎大家体验。

项目主页:

https://seed.bytedance.com/seedrealtime

体验入口:

将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入视频通话界面体验即可。

原生音视频交互,走向全模态,实现边看、边听、边说

音视频实时交互此前长期卡在两种形态之间:级联系统依赖 ASR、VLM、TTS 等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置 VAD 判断轮次,本质上仍接近一问一答的半双工交互。

SeedRealtime 的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上,让感知、理解、决策与表达同步进行,使“听到的”和“看到的”能够共同参与每一次实时判断。

难点首先在于对话节奏。语音天然带有停顿,可以借此判断何时接话;视频却始终在线、持续变化。模型既要不断理解画面中正在发生什么,又不能因为背景噪声干扰而频繁介入,而是要持续判断该关注哪个对象、该听谁说话,以及此刻是否应该回应。

更深层的挑战在于音视频的联合建模与时序对齐。用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么;遇到同音词或模糊语音时,也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模,模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系,模型便不再只是等待用户提问,而能持续理解场景变化,在合适的时机主动开口。

接下来,我们通过 7 个具体案例,来看看 SeedRealtime 在真实场景中的表现。

音视频联合理解,看得懂画面,分得清对象

SeedRealtime 能在多人、嘈杂、开放的真实环境中,把画面、声音和时序对齐理解。

四位好友聚餐,人多话杂。用户逐一介绍在场的人,SeedRealtime 就能根据外形特征把名字和人对上 —— 认出浅色头发的七七、戴眼镜的 Julia,还主动和乐乐打招呼;在之后的交谈中,始终把每个人的声音和身份对应起来。

随后大家你一言我一语聊起旅行:有人想去海边拍照、逛海洋馆,有人怕热怕累,还有人对海鲜过敏。 SeedRealtime 能分辨每句话出自谁,并根据大家的交流,给出一份兼顾每个人需求的旅行方案。认人、辨声、听懂各自的需求,这些都在同一场对话里由一个模型实时完成。

在川菜馆,外籍食客面对中文菜单一筹莫展。SeedRealtime 直接从画面中认出菜品、用英语推荐,还能顺着文化背景解释“为什么‘鱼香肉丝’里没有鱼”、“皮蛋是怎么做的”。

服务员上菜时顺道说“很下饭”,它能结合画面中的菜,理解这句话并翻译给客人听。视觉信息无需先转成文字再理解,而是与语音在同一模型里对齐,做到眼前有什么,就能答什么。

主动的交互能力,持续观察,适时介入

模型会根据实时画面的持续变化,自主判断是否需要主动介入,而不必每次都等用户先开口。

在河北博物院逛展,用户交代一句“看到错金银铜虎噬鹿屏座就提醒我”,SeedRealtime 便在镜头不断移动的过程中留意画面,扫过那件展品时出声提醒。

随后,它结合画面细节,讲解错金银四龙四凤铜方案座、长信宫灯等镇馆之宝,以及铸造、错金银、焊接等多种工艺。将任务保存在上下文中、目标出现即提醒,正是持续视觉感知与主动介入能力的体现。

操作一台复杂咖啡机的过程中,模型能够基于视觉状态的变化实现实时纠错与反馈。

当观察到用户把整粒咖啡豆直接倒进萃取手柄时,模型快速指出:“豆子不能直接倒进去,得先磨成细粉”;萃取结束后,它基于对杯中油脂成色与液量的视觉解析,主动给出“下次萃取时间缩短 2-3 秒”的调整建议。无需用户逐步提问,模型便能基于实际场景进行点评。

研读 ResNet 论文时,模型结合网络结构图讲清跳接如何缓解梯度消失;当用户说“帮我盯着,翻到训练参数那部分提醒我”,它便在快速翻页的过程中持续观看画面,准确认出 “3.4 Implementation” 段落并主动叫停,随即报出学习率、动量、权重衰减等关键训练配置。在连续画面流中识别目标并主动叫停,展现了实际交互中的主动协作能力。

流畅的交互节奏,在干扰中判断何时开口

轮次判断不再交给外部 VAD 规则,而由 SeedRealtime 基于多模态信息持续决策:该接话时不迟疑,该沉默时不打断,在复杂环境中也能保持更自然的交流节奏。

大兴机场人流密集、环境嘈杂。同伴闲聊时随口提到“老李的航班”,模型并未被这句无关对话触发回复;当用户正式问起,即便航班信息已从画面移出,它仍能结合此前看到的大屏信息,回答实时到达时间,并联网提供行李转盘位置。

随后二人边走边聊往事,它持续观看眼前画面,扫到网约车指示牌时便自然接话,给出上车点的路线指引。嘈杂环境不再是必须过滤的干扰,闲谈里的关键信息也能被恰当留存、在需要时取用。

妈妈在一旁忙着别的事,让 SeedRealtime 陪女儿学习动物英文。背景里爸爸正在接电话、人声不断,模型却没有被这段无关对话带偏,始终跟着女孩手指的方向实时纠音、举例造句。模型该出声时不迟疑,受干扰时不跑偏。

总结与展望

SeedRealtime 的推出,标志着音视频交互迈出了关键一步。通过统一架构原生融合音频、视频与文本,模型得以在连续的多模态流中持续理解场景、判断节奏并作出回应。由此,“边看、边听、边说”真正成为日常可用的交互体验。

然而,现实环境中的音视频交流复杂而连续:背景嘈杂,人声会重叠,画面会变化,用户也会随时停顿、补充或打断。面对这些真实场景中的挑战,未来我们将在以下几个方面继续突破:

  • 更低的延迟与更自然的节奏:持续压缩“听到—理解—回应”的端到端时延,让打断、抢话、附和与停顿等真实对话中的微妙节奏被自然还原,不只是更快,而是更恰到好处。

  • 更主动的感知与决策:基于对画面与声音的持续理解,主动判断何时提醒、何时补充、何时递上用户正需要的信息,让模型不仅能“该说话时说话”,也能“该出手时出手”。

  • 更稳健的多人复杂场景:在嘈杂环境、多人同框与多方对话中,稳定识别“谁在说话、在看什么、该回应谁”,将能力带入更多真实生活与工作场景。

  • 从“能对话”到“能行动”:打通工具调用与现实世界的连接,让模型不仅能交流与观察,更能协助用户完成查询、预订与任务办理,把实时多模态理解转化为具体行动。

我们希望,AI 交互不再局限于清晰轮次中的问答,而是能在连续变化的真实场景中理解上下文、敏锐把握时机,并在合适的时候提供帮助。