前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.23 · 14:08/4 MIN/编译自 梦瑶/0 阅读

爱诗科技发布PixVerse R2:兼顾通用与实时的世界模型

爱诗科技上线新一代实时世界模型PixVerse R2。该模型通过统一因果自回归架构与实时加速两层设计,打破了世界模型在模型容量与毫秒级延迟之间的权衡难题,为互动娱乐与具身智能提供了全新数字底座。

实时生成的世界模型正在快速演进,但在迈向实时生成的过程中,行业长期面临一个两难困境:模型能力越强,实时性越难维持。

与大语言模型(LLM)相比,实时世界模型难以依托单一的扩展路径实现能力持续跃升。针对这一技术瓶颈,爱诗科技给出了全新工程解法——新一代实时世界模型 PixVerse R2 正式上线。

爱诗科技实时世界模型PixVerse R2

基于统一且可持续扩展的世界模型框架,PixVerse R2 实现了长程时空状态一致性,支持文字、图像、音频与控制动作的协同输入与即时反馈,做到了音画同步与实时可控。

PixVerse R2在社交平台引发广泛关注

实时世界模型面临的两道工程墙

世界模型在能力增长路径上难以完全复制大语言模型的成功,核心在于两道工程难题。

第一道门槛是多模态信息的统一表征难题。语言具有离散、序列化的先天优势,海量文本可切分为边界清晰的 Token,训练任务高度收敛为“预测下一个 Token”,算力与数据能够稳定转化为模型能力。但图像与视频属于连续、高维且高度冗余的数据形态,不仅信息结构复杂,还需抽取物理法则与状态变化。视觉领域长期缺乏类似语言 Token 的紧凑、统一表征体系。

语言与多模态视觉信号的表征差异

第二道门槛是模型容量与单帧计算预算的冲突。维持平滑的实时生成,留给模型的每帧计算窗口通常只有数十毫秒。然而,理解复杂物理规律和长程时空演变又需要庞大的参数规模和重度计算。此前 Google DeepMind 发布的 Genie 2 虽然大幅增强了场景与物理交互,但要兼顾实时性,往往不得不依赖大幅度模型蒸馏并牺牲画质。

Google DeepMind Genie 2 的计算折中分析

构建多维协同的扩展坐标系

要让通用能力与实时性并存,首先需要将视觉、动作、音频和控制指令收敛至统一的建模体系。

PixVerse R2 提出了涵盖模型、数据、任务、控制信号与时间尺度的五维协同扩展框架:

  • 模型规模决定整体表征容量;
  • 数据多样性拓宽物理场景分布;
  • 任务泛化增强跨场景迁移能力;
  • 控制信号提升交互粒度;
  • 时间尺度决定复杂动态过程的记忆跨度。

五维协同扩展的世界模型框架

在这套因果建模框架下,任意维度的资源增加都能反哺其他维度,使模型能够持续沉淀交互经验,提升长程一致性与跨场景泛化能力。

在实际体验中,用户可通过方向键即时调整视角,并通过 Prompt 实时改变环境天气、角色动作与剧情走向,系统几乎没有可感知的卡顿和操作延迟。

查看探险与互动场景演示

两层解耦架构:先拉满能力,再做实时加速

PixVerse R2 实现能力与速度并存的关键,在于打破了“在固定毫秒预算内裁剪模型”的传统思路,采用两层解耦架构:

Omni Causal AR 与 Real-Time Acceleration 两层架构

  1. Omni Causal AR(统一因果自回归层):主攻能力上限。通过动态 Chunk 适配多尺度时间轴,结合 Hybrid Teacher/Diffusion Forcing、多时间尺度记忆机制与 Error Bank,解决长程交互中的误差累积、角色漂移和画面崩坏,夯实物理建模与时空一致性。
  2. Real-Time Acceleration(实时加速层):主攻运行效率。将持续预训练的高能力模型作为 Teacher 底座,将因果推演能力通过专用蒸馏管道压缩进实时计算预算内,实现毫秒级端到端推演。

迈向全动态的数字世界底座

这套解耦架构的技术外溢效应正延伸至游戏渲染、虚拟人交互和具身智能等场景。剧情与场景不再是预先烘焙的固定资源,而是成为根据输入实时演进的动态系统。创作者的角色也从绘制单一帧画面,转向定义世界的物理规则与运行机制。

标签:PixVerse世界模型具身智能

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Transformers 直接跑 GGUF:Python 追平 llama.cpp
置顶

Transformers 直接跑 GGUF:Python 追平 llama.cpp

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍
置顶

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上
置顶

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上

//

24小时热榜

Expedia 接入 Meta Muse 智能体:可直接预订行程
TOP1

Expedia 接入 Meta Muse 智能体:可直接预订行程

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流
TOP2

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流

3

OpenAI公布第三方AI安全评估的四大重点与七项原则

11小时前
OpenAI公布第三方AI安全评估的四大重点与七项原则
4

OpenAI升级GPT-6提示词缓存:最高立减90%成本

11小时前
OpenAI升级GPT-6提示词缓存:最高立减90%成本
5

安全公司 Trail of Bits:SAML 是设计上的失败,该退役了

18小时前
安全公司 Trail of Bits:SAML 是设计上的失败,该退役了
6

工程师用 gzip 做语言模型:靠压缩长度打分生成文本

18小时前
工程师用 gzip 做语言模型:靠压缩长度打分生成文本
7

OpenAI 发布 GPT-6 Sol 与 Luna:性能比肩旗舰,API 降价 50%

11小时前
OpenAI 发布 GPT-6 Sol 与 Luna:性能比肩旗舰,API 降价 50%
8

OpenAI 发布 Astra for Law:法律专属 AI 基础平台

18小时前
OpenAI 发布 Astra for Law:法律专属 AI 基础平台
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断