爱诗科技上线新一代实时世界模型PixVerse R2。该模型通过统一因果自回归架构与实时加速两层设计,打破了世界模型在模型容量与毫秒级延迟之间的权衡难题,为互动娱乐与具身智能提供了全新数字底座。
实时生成的世界模型正在快速演进,但在迈向实时生成的过程中,行业长期面临一个两难困境:模型能力越强,实时性越难维持。
与大语言模型(LLM)相比,实时世界模型难以依托单一的扩展路径实现能力持续跃升。针对这一技术瓶颈,爱诗科技给出了全新工程解法——新一代实时世界模型 PixVerse R2 正式上线。

基于统一且可持续扩展的世界模型框架,PixVerse R2 实现了长程时空状态一致性,支持文字、图像、音频与控制动作的协同输入与即时反馈,做到了音画同步与实时可控。

世界模型在能力增长路径上难以完全复制大语言模型的成功,核心在于两道工程难题。
第一道门槛是多模态信息的统一表征难题。语言具有离散、序列化的先天优势,海量文本可切分为边界清晰的 Token,训练任务高度收敛为“预测下一个 Token”,算力与数据能够稳定转化为模型能力。但图像与视频属于连续、高维且高度冗余的数据形态,不仅信息结构复杂,还需抽取物理法则与状态变化。视觉领域长期缺乏类似语言 Token 的紧凑、统一表征体系。

第二道门槛是模型容量与单帧计算预算的冲突。维持平滑的实时生成,留给模型的每帧计算窗口通常只有数十毫秒。然而,理解复杂物理规律和长程时空演变又需要庞大的参数规模和重度计算。此前 Google DeepMind 发布的 Genie 2 虽然大幅增强了场景与物理交互,但要兼顾实时性,往往不得不依赖大幅度模型蒸馏并牺牲画质。

要让通用能力与实时性并存,首先需要将视觉、动作、音频和控制指令收敛至统一的建模体系。
PixVerse R2 提出了涵盖模型、数据、任务、控制信号与时间尺度的五维协同扩展框架:

在这套因果建模框架下,任意维度的资源增加都能反哺其他维度,使模型能够持续沉淀交互经验,提升长程一致性与跨场景泛化能力。
在实际体验中,用户可通过方向键即时调整视角,并通过 Prompt 实时改变环境天气、角色动作与剧情走向,系统几乎没有可感知的卡顿和操作延迟。
PixVerse R2 实现能力与速度并存的关键,在于打破了“在固定毫秒预算内裁剪模型”的传统思路,采用两层解耦架构:

这套解耦架构的技术外溢效应正延伸至游戏渲染、虚拟人交互和具身智能等场景。剧情与场景不再是预先烘焙的固定资源,而是成为根据输入实时演进的动态系统。创作者的角色也从绘制单一帧画面,转向定义世界的物理规则与运行机制。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断