2026-09-17 17:23
AI123

生数科技发布实时视频生成与编辑模型Vidu S2

生数科技于2026年9月17日正式发布Vidu S2实时视频生成与编辑模型。该模型包含S2-Avatar实时交互模型和S2-Editing实时编辑模型两部分,面向实时数字人互动和视频流实时编辑场景。

S2-Avatar支持720p高清输出,增强了动作指令遵循与人物表演能力,可在直播过程中输入参考图,根据指令完成持品互动、换服装和换背景等操作。S2-Editing则面向正在流动的视频画面,支持实时修改风格、服装、人物主体与背景,为直播、虚拟演绎和互动内容提供即时视觉编辑能力。

为应对长时间流式生成中的画面崩溃与漂移问题,生数独创了SRF(Self-Replay Forcing)训练技术。该技术让模型在训练中直面自身的生成历史并修正误差,以降低长时间生成过程中的指令漂移率。

Vidu S2采用Backbone-Refiner两阶段架构:主干网络以低延迟负责骨架运动、物理规律和镜头语言的实时推流,精炼网络以异步流水线方式完成720p高清细节重构与材质纹理修复。临时加入的参考图则交由基于视觉语言模型的VLM Agent进行协调,解析当前画面的运动相位和空间状态,完成特征对齐。

公开信息显示,Vidu S2的API平台已开放,技术报告已发布至arXiv。Vidu S系列围绕交互式视频生成展开,面向实时对话、AI情感陪伴、虚拟IP、互动游戏及直播等场景。

来源
  1. 2026-09-17 17:07 | 爱范儿:我用 Vidu S2 找来了「乔布斯」,跟他聊了聊 iPhone Duo
    阅读原文

    最近, APPSO 观看了国内首场 AI 艺人线下演唱会,效果非常惊艳,但略有遗憾的是,主角 Yuri 尤栗和观众互动的方式是在大屏幕上打字,要是她能像真人歌手观众那样和观众实时互动,让我们点歌,和我们玩一些小游戏,那该多有趣啊。 现在,这样能实时生成和编辑的视频已经出现了。 当大部分视频生成模型还在「卷时长、卷清晰度、算完再看」的离线生成赛道厮杀时,生数科技刚刚发布的 Vidu S2 已经把战场直接拉到了「边看边改」的实时操控领域。 Vidu S2 的能力分为两部分, S2-Avatar 和 S2-Editing: S2-Avatar,实时交互模型。面向实时数字人互动,支持 720p 高清...

其他新闻

查看全部