国内大模型竞争正从文本对话转向空间交互。字节跳动主打实时空间视频与消费级终端闭环,京东则依托供应链数据与算力集群深耕物理AI产业闭环。两条路径折射出中国科技巨头对下一代空间计算入口的截然不同理解。
当大语言模型的参数竞赛步入收益递减期,下一代计算入口的争夺,正从“文本对话”加速转向“空间交互”。
近期,两家国内巨头在世界模型领域的落子引发广泛关注:字节跳动基于 Seedance 研发实时空间视频生成模型,由创始人张一鸣跨部门协调模型、算力与硬件资源;京东则在 JDD 大会上发布 JoyAI-EchoWM 世界模型,并规划建设 10 万卡国产 GPU 集群。
两件事相隔数日,看似同台竞技,切入路径却大相径庭,折射出中国科技公司对空间计算入口的不同解题思路。
理解这场较量,首先需要厘清概念:世界模型并非单纯的“AI 视频生成升级版”。
传统视频生成属于“输入指令、输出片段”的内容工具,而世界模型是“输入行为、输出连贯物理规律与空间反馈”的实时交互系统。其核心不仅在于生成画面,更在于理解物理规律、预测环境演变,并响应用户的连续操作。
技术指标直观体现了这一差异。字节跳动研发的实时空间视频生成模型,目标端到端延迟约为 50 毫秒,帧率约 20 帧/秒。人类感知的交互延迟阈值在 50 至 100 毫秒之间,达到 50 毫秒意味着用户几乎感受不到时差,虚拟空间具备了“可交互的在场感”。
这也是传统 VR 产业长期面临的瓶颈。以往 VR 依赖昂贵庞大的本地算力或复杂的预渲染,而云端实时生成的世界模型,将重度渲染与计算转移到服务器,终端仅保留动作捕捉与显示,有望将空间计算推向云服务时代。

从技术储备看,字节跳动已拥有 Seedance 的视频生成能力、Depth Anything 3 的空间深度重建以及 Seed3D 的三维资产生成技术,逐步搭起由“生成像素”到“构建空间”的底座。但在全球范围内,相较于海外巨头偏向通用物理模拟的探索,中国企业的动作从一开始就紧贴着具体业务与商业场景。
字节跳动的世界模型路径带着鲜明的内容消费基因。其整体链条清晰:以 Seedance 生成能力为底座,向上延伸出空间交互能力,再通过抖音的内容生态与 Pico 硬件完成落地。

这套打法的第一支点是庞大的 C 端消费场景,包括互动直播、互动短剧与沉浸式娱乐。传统视频消费是“隔着屏幕观看”,而空间交互则让用户“置身画面其中”,实时操作可动态重构剧情走向与场景视角。
第二支点是硬件载体 Pico。在硬件参数内卷见顶的背景下,世界模型扮演了“无限内容引擎”的角色,大幅降低高品质三维内容的制作门槛,并在云端协同下减轻头显本体的性能与功耗负担。
然而,这一路径的边界同样清晰:字节的优势集中在内容分发与娱乐交互,相对欠缺实体产业与物理工业环境的深层积淀。其世界模型聚焦于虚拟视听体验的跃升,而非物理实体任务的执行。
与偏向虚拟体验的字节截然不同,京东的世界模型直接锚定真实物理世界。
在京东的规划中,世界模型的终极价值并非娱乐,而是构建精准的物理仿真环境,让 AI 与具身机器人在进驻真实场景前,先在虚拟沙盒中完成海量学习、策略测试与错误校准,实现“虚拟仿真、物理执行”。
这一战略依托三大支撑:
京东路线的优势在于产业壁垒深厚,但挑战在于缺乏 C 端大规模流量入口,产业场景定制化程度高、落地与变现周期相对较长。
字节向左,押注内容交互与消费级体验;京东向右,押注物理仿真与产业级具身智能。两者的技术演进没有绝对优劣,而是源于各自核心基因的自然延伸。
早前的大语言模型比拼多集中在算法指标与参数规模,而世界模型的竞争已经演变为综合生态战:算力架构、垂直数据、业务场景与终端硬件,缺一不可。随着人机交互逐步从二维屏幕走向三维空间,这一场围绕下一代计算入口的布局才刚刚拉开序幕。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断