☀️
联系客服

字节跳动SeedRealtime发布:音视频全双工大模型,豆包App已上线

字节跳动Seed团队8月5日正式发布了Seedance家族的新成员——SeedRealtime,一个原生音视频全双工大模型。和之前做视频生成的Seedance不同,SeedRealtime解决的是”实时交互”问题:让AI能同时看画面、听声音、跟你说话。

SeedRealtime音视频全双工大模型

目前SeedRealtime已在豆包App全量上线,用户在对话框里选”打电话”就能进入视频通话界面体验。

为什么需要全双工

之前的音视频AI交互基本靠”级联系统”——语音识别、视觉理解、语音合成三个模块串联。问题是延迟层层叠加,信息每经过一次传递就损耗一点,体验上更像”一问一答”的半双工,没法真正实时对话。

SeedRealtime把声音、画面、时序和表达统一到同一个端到端模型里。不是先听完、再看完、最后作答,而是在连续的音视频流上让感知、理解、决策与表达同步进行。

官方的端到端人工评测显示,相比级联模型,SeedRealtime的对话节奏问题减少了一半,打断、迟滞和误触发等现象也显著减少。

三个核心能力

音视频联合理解:能结合当前场景消解同音词和模糊语音,持续理解画面变化。比如多人聚餐时,能根据外形特征把名字和人对上,在后续交谈中始终把声音和身份对应。

主动交互:不用等用户先开口。察觉画面状态变化时(比如关键目标出现),模型能主动提醒。在博物馆等移动场景中,能持续关注用户目标,适时主动讲解。

流畅的交互节奏:实时感知用户的对话状态和交流节奏,在适当时机自然接话、停顿与回应。在车站、机场等嘈杂环境中,能屏蔽无关干扰,分辨旁人闲聊与背景噪声,不因干扰误触发。

接下来要突破什么

Seed团队列出了几个方向:持续压缩端到端时延让打断、抢话、附和等微妙节奏被自然还原;更主动地判断何时提醒、何时补充;在嘈杂多人场景中稳定识别谁在说话、该回应谁;以及从”能对话”走向”能行动”——打通工具调用,让模型不仅能交流观察,还能协助查询、预订和任务办理。

现实环境中的音视频交流复杂而连续:背景嘈杂,人声重叠,画面随时变化,用户也会随时停顿补充。SeedRealtime的发布意味着AI交互开始走出清晰轮次的问答模式,向连续变化的真实场景迈进。