生数科技正式发布Vidu S2模型并全量开放。该版本实现实时视频“边播边改”,支持换装、换人、换背景及风格迁移,交互数字人分辨率提升至720P并支持复杂动作与参考图控制,同时首次探索了实时空间视频生成。
生数科技正式发布新一代视频大模型 Vidu S2,并在发布当天全量开放体验。距离上一代模型发布仅过去 69 天,Vidu S2 将 AI 视频从离线生成和简单对话,推进到了高分辨率实时互动、流式视频编辑以及空间视频探索的新阶段。
本次更新主要由两大核心模型及一项前沿功能组成:

Vidu S2-Editing 的核心突破在于流式视频的实时修改。在实际测试中,模型对运动画面的处理展现出较高的一致性:
这种实时编辑能力为直播互动、虚拟制片和短视频创作提供了全新可能,观众的即时指令可直接干预画面呈现。
上一代 Vidu S1 实现了以语音实时驱动数字人交互,而 Vidu S2-Avatar 则在动作幅度和控制精度上进行了升级。实测对比显示,S1 主要局限于小幅度面部表情和肢体动作,而 S2 可以流畅执行转圈、跺脚等复合动作指令。

输出画质从 540P 提高到 720P,面部纹理与衣物细节显著丰富。此外,用户在对话过程中可随时上传新的参考图片,数字人能够识别图片内容并按指令拿取物品或更换对应服饰,大幅拓展了多模态互动的应用边界。

在空间计算方面,Vidu S2 支持将常规二维画面实时计算并输出为双目立体视频,适配 Apple Vision Pro 等头显设备。团队表示,目前正持续攻克高帧率和低延迟挑战,未来计划从固定视角进一步迈向全景空间视频生成。
从技术层面来看,实时交互视频要求模型的生成速度跑赢播放速度,这要求重构整条生成与推理链路。Vidu S2 的核心技术架构包含以下几个关键点:


目前,用户已可通过官方体验入口试用 Vidu S2,开发者可通过开放平台接口接入模型能力,相关理论成果已在 arXiv 技术报告中公开。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断