前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/09.16 · 00:00/4 MIN/编译自 林, 方舟/1 阅读

生数科技发布Vidu S2:支持实时视频编辑与空间视频

生数科技正式发布Vidu S2模型并全量开放。该版本实现实时视频“边播边改”,支持换装、换人、换背景及风格迁移,交互数字人分辨率提升至720P并支持复杂动作与参考图控制,同时首次探索了实时空间视频生成。

生数科技正式发布新一代视频大模型 Vidu S2,并在发布当天全量开放体验。距离上一代模型发布仅过去 69 天,Vidu S2 将 AI 视频从离线生成和简单对话,推进到了高分辨率实时互动、流式视频编辑以及空间视频探索的新阶段。

本次更新主要由两大核心模型及一项前沿功能组成:

  • Vidu S2-Editing:面向正在播放的视频流,提供实时换装、换角色、换背景和风格渲染能力,实现类似“视频版修图”的即时修改效果。
  • Vidu S2-Avatar:将实时数字人交互分辨率提升至 720P,不仅能听懂语音指令执行跳舞、转圈等大幅度肢体动作,还能在互动过程中实时接收参考图,按指令换装或拿取指定道具。
  • 实时空间视频:将生成或编辑的视频实时转化为适配 VR 头显的双目立体画面,探索具备纵深感的沉浸式虚实交互。

Vidu S2 发布界面

实时视频编辑:边播边改的流式处理

Vidu S2-Editing 的核心突破在于流式视频的实时修改。在实际测试中,模型对运动画面的处理展现出较高的一致性:

  1. 实时人物换装:在保留人物原有动作和身形的前提下瞬间切换服装款式,褶皱形变与配饰遮挡过渡自然。
  2. 实时背景替换:在前景人物跳舞等快速运动场景下,边缘抠像与环境融合依然保持连贯。
  3. 主体角色替换:将镜头中的真人替换为其他虚拟角色或物品,透视与场景遮挡保持稳定。
  4. 风格实时渲染:在不同艺术画风之间即时切换,视频整体的光影与纹理迁移稳定,未出现明显的闪烁现象。

这种实时编辑能力为直播互动、虚拟制片和短视频创作提供了全新可能,观众的即时指令可直接干预画面呈现。

数字人升级:720P 画质与多模态指令交互

上一代 Vidu S1 实现了以语音实时驱动数字人交互,而 Vidu S2-Avatar 则在动作幅度和控制精度上进行了升级。实测对比显示,S1 主要局限于小幅度面部表情和肢体动作,而 S2 可以流畅执行转圈、跺脚等复合动作指令。

两代模型对比

输出画质从 540P 提高到 720P,面部纹理与衣物细节显著丰富。此外,用户在对话过程中可随时上传新的参考图片,数字人能够识别图片内容并按指令拿取物品或更换对应服饰,大幅拓展了多模态互动的应用边界。

空间视频交互

在空间计算方面,Vidu S2 支持将常规二维画面实时计算并输出为双目立体视频,适配 Apple Vision Pro 等头显设备。团队表示,目前正持续攻克高帧率和低延迟挑战,未来计划从固定视角进一步迈向全景空间视频生成。

底层架构与技术实现

从技术层面来看,实时交互视频要求模型的生成速度跑赢播放速度,这要求重构整条生成与推理链路。Vidu S2 的核心技术架构包含以下几个关键点:

动作标注逻辑

  • 因果回放训练(Self-Replay Forcing):流式生成中误差容易随时间累积。团队在 Hybrid Forcing 基础上引入自回放机制,先连续生成视频,再分块加噪进行因果回放训练,让后续片段的反馈指导较早片段,增强模型纠偏能力。
  • Backbone-Refiner 两阶段流水线:基础模型(Backbone)在低分辨率下优先确定主体运动与语义结构,精炼模型(Refiner)负责补充高频细节。两者通过异步流水线并行计算,确保在 720P 分辨率下持续稳定输出。
  • 时间戳对齐的位置编码:重新设计位置编码机制,将中途注入的参考图精确映射到指定时间戳,保证动态换装时的光照与物理连续性。
  • VLM Agent 动态调度:内置基于视觉语言模型的智能体充当“现场导演”,持续解析已生成的视频状态,判断上一条动作是否完成,从而在最优时机规划后续生成逻辑。
  • 强化学习对齐:双向预训练阶段采用 DPO 优化音画同步与动作自然度;流式生成阶段则引入 Streaming NFT 算法,针对因果模型的长轨迹进行奖励优化,提升复杂交互场景下的指令遵循度。

强化学习流程

目前,用户已可通过官方体验入口试用 Vidu S2,开发者可通过开放平台接口接入模型能力,相关理论成果已在 arXiv 技术报告中公开。

标签:视频生成多模态

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
TOP1

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
TOP2

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

3

AI竞争的终局不是做大模型,而是争夺基建与权力

9小时前
AI竞争的终局不是做大模型,而是争夺基建与权力
4

AI在狂飙,但人类习惯走得很慢

9小时前
AI在狂飙,但人类习惯走得很慢
5

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

9小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
6

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

9小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
7

打造开源AI音视频编辑器:彻底搞定音画漂移痛点

9小时前
打造开源AI音视频编辑器:彻底搞定音画漂移痛点
8

OpenAI拟以1.2万亿美元估值融资,IPO推迟至2027年

17小时前
OpenAI拟以1.2万亿美元估值融资,IPO推迟至2027年
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断