在云栖大会上,阿里全面展示了涵盖语言、图像、视频、音频及世界模型的全模态矩阵,参数规模剑指十万亿。导演陆川借此在5天内还原明代历史现场。阿里指出,未来三年将诞生原生全模态统一模型,彻底打破各模态边界。
不用搭景,也不用等演员,导演陆川团队仅用 5 天时间,就用 AI 复原了 400 年前明代大爆炸的历史现场。按照传统影视工业流程,这往往需要耗费数月与千万级预算。通过四轮提示词迭代与真实物理校验,阿里视频生成模型对复杂烟尘与碎片的还原准确率达到 95% 以上。

这不仅是单点素材的生成,AI 正深入影视创作的完整链条。在云栖大会上,阿里集中展示了其多模态技术的完整底牌,展现出将多模态能力沉淀为工业生产力的清晰路径。
文字与基础认知层面,通义千问 Qwen3.8 系列持续推进,包括具备自训练机制的 Qwen3.8-Max 与整合跨模态思考分区的 Qwen3.8-Omni;下一代 Qwen4 已投入训练,未来参数规模直接瞄准 5 万亿至 10 万亿。

在生成与物理世界感知层面,阿里同步推出了图像生成模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1、世界模型 HappyOyster 2.0 Preview、语音交互家族 Qwen-Audio-3.1,以及计划于 11 月上线的下一代视频模型。配合端侧智能体 Qwen Intelligence,形成了覆盖图、文、音、视频与物理环境感知的立体网络。

现实任务天然具有混合模态的特征。无论是广告制作还是电影摄制,输入与输出往往同时交织着语言、画面与音效。大语言模型如同机器的大脑,而多模态模型则正在演变为感知世界、创造内容并与物理环境互动的枢纽。
从技术展示走向工业流水线,多模态模型正面临三层现实检验:
演员王珞丹在分享创作体验时提到,当前 AI 创作仍充斥着“抽卡”的随机性,模型很难在长周期中稳定维持人物性格与情绪状态。各模态各自为战的拼接方式,经常导致任务上下文的丢失。

为此,阿里提出了从拼装走向“原生全模态统一模型”的演进方向。阿里巴巴 ATH 事业群副总裁郑波预测,三年之内将出现原生的全模态统一生成模型,从底层共享同一个任务上下文与世界常识。
在这一路径下,阿里的视频生成技术正转向“Agentic Video”理念,让模型主动理解长剧本的叙事意图,自主进行分镜、调度角色与维持设定一致性,推动 AI 真正从单镜头生成迈向端到端完成复杂工程。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断