☀️
联系客服

Vidu S1实时交互模型发布:AI视频竞争进入第二阶段

AI视频大模型的竞争正在从画质、时长转向”实时交互”这个新维度。7月,生数科技在2026全球数字经济大会上发布了Vidu S1实时交互模型,打响了这一方向的第一枪。

Vidu S1实时交互模型

S1的核心能力

Vidu S1的定位不是”生成更好的视频”,而是”让用户能实时控制视频生成”。它的核心能力包括:

  • 语音实时控制:用语音指令实时调整视频生成方向,边说边生成。
  • 无限长实时生成:理论上可以持续生成不限时长的视频内容。
  • 540P + 25FPS实时交互:在保证流畅度的前提下实现实时画质输出。
  • 自定义初始图像与音色:用户可以指定起始画面和声音风格。

技术思路

值得注意的是,S1的研发团队由清华大学朱军教授的00后博士生张金涛带队,完成全链路研发。团队没有靠堆GPU来实现实时交互,而是通过全栈工程优化——从模型架构到推理链路再到工程调度,每个环节都做了针对性优化。

这个思路和业界主流的”扩大模型+增加算力”路线不同,更强调系统级的效率提升。如果这条路走通,意味着实时AI视频交互的门槛可能比预期更低。

Vidu S1的发布标志着AI视频模型竞争进入第二阶段:第一阶段比的是谁生成的视频更好看、更长;第二阶段比的是谁能实时响应用户意图,让视频生成变成一个交互过程而非等待过程。