字节跳动SeedRealtime发布:音视频全双工大模型,豆包App已上线

打开豆包App,在对话框里点开通话入口,就能跟一个看得见画面、听得到声音、还张口说话的 AI 视频通话。支撑这体验的,是字节跳动 Seed 团队 8 月 5 日放出的 Seedance 家族新成员 SeedRealtime,一个原生音视频全双工大模型。Seedance 专心做视频生成,SeedRealtime 负责实时交互,两边各守一摊。

SeedRealtime音视频全双工大模型

眼下它已在豆包App全量上线,任何用户都能直接上手体验。

为什么非要全双工

从前的音视频 AI 交互是级联系统拼出来的,语音识别、视觉理解、语音合成三个模块连成一条链。链路一长,延迟层层堆高,信息每过一环都要打折,落到用户手里的体验更像半双工的一问一答,话音落下等它想,它答完再轮到你,谈不上实时对话。

SeedRealtime 不这么干。声音、画面、时序和表达,被它装进同一个端到端模型里,不用先听完、再看完、最后作答,感知、理解、决策与表达都在连续的音视频流上同步推进。端到端人工评测给了量化说法:拿级联模型作对照,SeedRealtime 的对话节奏毛病少了一半,打断、迟滞与误触发也明显收敛。

三项核心能力拆开看

音视频联合理解这块,它能借助当前场景化解同音词和含混语音,画面的变化也跟得住。官方拿多人聚餐举过例:凭外形特征,它把名字和人对上了号,接下来整场交谈里,谁的声音对谁的身份,始终不乱。

主动交互也有看点。你不开口,它也未必沉默:画面一有动静,比如关键目标冒出来,它会主动出声提醒。逛博物馆这种边走边聊的场合,它一路锁着你的目标,挑准节点插话讲解。

交互节奏是第三项。你的对话状态、交流的快慢,它都实时感知,接话、停顿、回应踩在恰当的时机上。换到车站、机场这类嘈杂地方,它屏蔽无关干扰,旁人闲聊和背景噪声分得清清楚楚,不会被误触发牵着走。

下一座要翻的山

待翻的山,Seed 团队自己也列了清单:端到端时延接着往下压,把打断、抢话、附和这类微妙节奏还原得自然些。提醒和补充的时机,判断得再主动些。人多嘴杂的场合,谁在说话、该回应谁,认得再稳些。再往远走一步,从能对话到能行动,把工具调用打通,让模型不只会说会看,还能替你查询、预订、办事。

现实中的音视频交流又复杂又连续:背景吵,人声叠,画面随时在变,人还随时会停顿、补一句。AI 交互正在从一问一答的规整轮次里迈出来,朝连续变化的真实场景贴近。AI视频产品下一轮体验分化,多半就出在这个环节上,对话做得像不像人,直接决定用户留在谁家。