AI 视频大模型的第一阶段竞争,拼的是谁生成得更好看、更长,如今这段差距正在被抹平。第二阶段换了题目:谁能实时响应人的意图。答案出现在 7 月的 2026 全球数字经济大会上,生数科技发布 Vidu S1 实时交互模型,主打的就是这个。

从等结果,到边聊边生成
Vidu S1 的核心变化在交互:人能在生成过程中实时插手,画面按指令走,不再只是提交任务等结果。撑住这个定位的是四项核心能力。语音实时控制,你话音在说,画面跟着变方向。无限长实时生成,理论上不限时长,一直产下去都行。540P 加 25FPS 的实时交互,流畅度不打折的前提下给到实时画质。自定义初始图像与音色,开头画面长什么样、声音走什么风格,全由用户说了算。
这些能力叠在一块儿,视频生成就从提交任务再苦等渲染,变成一个能边聊边改的交互过程。体验上的落差,差不多是发消息和打电话的差别。
没靠堆GPU,靠的是全栈抠细节
更值得琢磨的是 S1 背后的路线。这支团队由清华大学朱军教授门下的 00 后博士生张金涛带队,完成全链路研发。他们没走扩大模型加堆算力的主流路子,而是做了全栈工程优化:模型架构、推理链路和工程调度,一处一处单独抠。
这条路跟业界主流不一样,含义很实在:一旦跑通,实时 AI 视频交互的门槛可能比所有人预想的都低,不需要天文数字的算力也能落地。
第二阶段的哨声响了
Vidu S1 划了一条线:第一阶段比画质和时长,第二阶段比实时响应。当各家生成的结果质量逐渐趋同,过程体验就成了新的差异化战场。能不能像导演一样即时指挥画面,比模型多几个参数更让用户在意。AI 视频这个品类的产品形态,可能就从这儿开始变。