前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.17 · 00:00/4 MIN/编译自 新博弈/2 阅读

世界模型入口之争:字节向左,京东向右

国内大模型竞争正从文本对话转向空间交互。字节跳动主打实时空间视频与消费级终端闭环,京东则依托供应链数据与算力集群深耕物理AI产业闭环。两条路径折射出中国科技巨头对下一代空间计算入口的截然不同理解。

当大语言模型的参数竞赛步入收益递减期,下一代计算入口的争夺,正从“文本对话”加速转向“空间交互”。

近期,两家国内巨头在世界模型领域的落子引发广泛关注:字节跳动基于 Seedance 研发实时空间视频生成模型,由创始人张一鸣跨部门协调模型、算力与硬件资源;京东则在 JDD 大会上发布 JoyAI-EchoWM 世界模型,并规划建设 10 万卡国产 GPU 集群。

两件事相隔数日,看似同台竞技,切入路径却大相径庭,折射出中国科技公司对空间计算入口的不同解题思路。

世界模型:空间计算的新入口

理解这场较量,首先需要厘清概念:世界模型并非单纯的“AI 视频生成升级版”。

传统视频生成属于“输入指令、输出片段”的内容工具,而世界模型是“输入行为、输出连贯物理规律与空间反馈”的实时交互系统。其核心不仅在于生成画面,更在于理解物理规律、预测环境演变,并响应用户的连续操作。

技术指标直观体现了这一差异。字节跳动研发的实时空间视频生成模型,目标端到端延迟约为 50 毫秒,帧率约 20 帧/秒。人类感知的交互延迟阈值在 50 至 100 毫秒之间,达到 50 毫秒意味着用户几乎感受不到时差,虚拟空间具备了“可交互的在场感”。

这也是传统 VR 产业长期面临的瓶颈。以往 VR 依赖昂贵庞大的本地算力或复杂的预渲染,而云端实时生成的世界模型,将重度渲染与计算转移到服务器,终端仅保留动作捕捉与显示,有望将空间计算推向云服务时代。

世界模型架构探索

从技术储备看,字节跳动已拥有 Seedance 的视频生成能力、Depth Anything 3 的空间深度重建以及 Seed3D 的三维资产生成技术,逐步搭起由“生成像素”到“构建空间”的底座。但在全球范围内,相较于海外巨头偏向通用物理模拟的探索,中国企业的动作从一开始就紧贴着具体业务与商业场景。

字节跳动:锚定 C 端的内容体验闭环

字节跳动的世界模型路径带着鲜明的内容消费基因。其整体链条清晰:以 Seedance 生成能力为底座,向上延伸出空间交互能力,再通过抖音的内容生态与 Pico 硬件完成落地。

Pico 头显与空间计算演进

这套打法的第一支点是庞大的 C 端消费场景,包括互动直播、互动短剧与沉浸式娱乐。传统视频消费是“隔着屏幕观看”,而空间交互则让用户“置身画面其中”,实时操作可动态重构剧情走向与场景视角。

第二支点是硬件载体 Pico。在硬件参数内卷见顶的背景下,世界模型扮演了“无限内容引擎”的角色,大幅降低高品质三维内容的制作门槛,并在云端协同下减轻头显本体的性能与功耗负担。

然而,这一路径的边界同样清晰:字节的优势集中在内容分发与娱乐交互,相对欠缺实体产业与物理工业环境的深层积淀。其世界模型聚焦于虚拟视听体验的跃升,而非物理实体任务的执行。

京东:深耕物理世界的产业闭环

与偏向虚拟体验的字节截然不同,京东的世界模型直接锚定真实物理世界。

在京东的规划中,世界模型的终极价值并非娱乐,而是构建精准的物理仿真环境,让 AI 与具身机器人在进驻真实场景前,先在虚拟沙盒中完成海量学习、策略测试与错误校准,实现“虚拟仿真、物理执行”。

这一战略依托三大支撑:

  1. 一手真实场景数据:具身智能依赖大量第一视角作业数据。京东基于分拣机器人、干线无人车与配送终端的日常运转,构建了千万小时级的人类操作与作业数据集,并开源了包含 346 项真实任务的 EgoLive 数据集。
  2. 大规模定制化算力:规划建设的 10 万卡国产 GPU 集群,专为高可靠性、低延迟的物理仿真与多机协同调度设计,以满足工业和物流场景对“零失误”的严苛要求。
  3. 垂类业务落地:在评测中取得优异成绩的 JoyAI-EchoWM,直接对接物流路径规划、具身机械臂拣选、工业三维设计建模等具体业务,担当机器人的“虚拟训练场”。

京东路线的优势在于产业壁垒深厚,但挑战在于缺乏 C 端大规模流量入口,产业场景定制化程度高、落地与变现周期相对较长。

总结:生态闭环的长期角逐

字节向左,押注内容交互与消费级体验;京东向右,押注物理仿真与产业级具身智能。两者的技术演进没有绝对优劣,而是源于各自核心基因的自然延伸。

早前的大语言模型比拼多集中在算法指标与参数规模,而世界模型的竞争已经演变为综合生态战:算力架构、垂直数据、业务场景与终端硬件,缺一不可。随着人机交互逐步从二维屏幕走向三维空间,这一场围绕下一代计算入口的布局才刚刚拉开序幕。

标签:世界模型具身智能空间计算字节跳动

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍
置顶

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍

//

24小时热榜

OpenAI发布Astra for Law:面向法律行业的GPT-6模型
TOP1

OpenAI发布Astra for Law:面向法律行业的GPT-6模型

英王查尔斯召集AI巨头闭门会谈
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

英王查尔斯召集AI巨头闭门会谈

3

Gemini对决GPT-6:差价超90%,开发者该选谁?

4小时前
Gemini对决GPT-6:差价超90%,开发者该选谁?
4

模式的终局:算法如何驯化了我们的创作

4小时前
模式的终局:算法如何驯化了我们的创作
5

vivo AgentOS技术预览版亮相:6000多项原子技能开放调用

12小时前
vivo AgentOS技术预览版亮相:6000多项原子技能开放调用
6

Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求

12小时前
Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求
7

Bend:用证明拦截AI代码错误,同时支持CPU与GPU

12小时前
Bend:用证明拦截AI代码错误,同时支持CPU与GPU
8

意识变形记:当救世主自愿沦为恶魔

4小时前
意识变形记:当救世主自愿沦为恶魔
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断