前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.22 · 23:59/4 MIN/编译自 田, 晏林/0 阅读

阿里发布全模态模型矩阵:从单模态生成走向原生统一

在云栖大会上,阿里全面展示了涵盖语言、图像、视频、音频及世界模型的全模态矩阵,参数规模剑指十万亿。导演陆川借此在5天内还原明代历史现场。阿里指出,未来三年将诞生原生全模态统一模型,彻底打破各模态边界。

不用搭景,也不用等演员,导演陆川团队仅用 5 天时间,就用 AI 复原了 400 年前明代大爆炸的历史现场。按照传统影视工业流程,这往往需要耗费数月与千万级预算。通过四轮提示词迭代与真实物理校验,阿里视频生成模型对复杂烟尘与碎片的还原准确率达到 95% 以上。

明代爆炸场景复原效果

这不仅是单点素材的生成,AI 正深入影视创作的完整链条。在云栖大会上,阿里集中展示了其多模态技术的完整底牌,展现出将多模态能力沉淀为工业生产力的清晰路径。

全模态拼图全面展开

文字与基础认知层面,通义千问 Qwen3.8 系列持续推进,包括具备自训练机制的 Qwen3.8-Max 与整合跨模态思考分区的 Qwen3.8-Omni;下一代 Qwen4 已投入训练,未来参数规模直接瞄准 5 万亿至 10 万亿。

阿里大模型演进路线

在生成与物理世界感知层面,阿里同步推出了图像生成模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1、世界模型 HappyOyster 2.0 Preview、语音交互家族 Qwen-Audio-3.1,以及计划于 11 月上线的下一代视频模型。配合端侧智能体 Qwen Intelligence,形成了覆盖图、文、音、视频与物理环境感知的立体网络。

阿里全模态架构生态

现实任务天然具有混合模态的特征。无论是广告制作还是电影摄制,输入与输出往往同时交织着语言、画面与音效。大语言模型如同机器的大脑,而多模态模型则正在演变为感知世界、创造内容并与物理环境互动的枢纽。

深入工作流的真实考验

从技术展示走向工业流水线,多模态模型正面临三层现实检验:

  1. 工业级内容交付:视频模型 Wan 3.0 已支持单次 30 秒生成与结构化输入,在保持商品外观、人物面部与口播不形变的前提下,满足商业广告的苛刻交付标准。
  2. 专业级意图理解:在影视与音乐创作中,模型需要吃透专业史料与导演意图。太合音乐与阿里展开合作,探索版权机制与 AI 音乐共创;小旭音乐工作室则通过将音乐、视频与大语言模型串联成工作流,实现 6 人团队运营十余个 AI 歌手 IP。
  3. 进入终端与物理世界:端到端全双工语音模型 Qwen-Audio-3.1-Realtime 正式嵌入办公软件与随身硬件,实现边听边想边说;世界模型 HappyOyster 2.0 则着重攻克环境时序一致性与物理交互规律。

迈向原生全模态与连续叙事

演员王珞丹在分享创作体验时提到,当前 AI 创作仍充斥着“抽卡”的随机性,模型很难在长周期中稳定维持人物性格与情绪状态。各模态各自为战的拼接方式,经常导致任务上下文的丢失。

原生全模态统一模型展望

为此,阿里提出了从拼装走向“原生全模态统一模型”的演进方向。阿里巴巴 ATH 事业群副总裁郑波预测,三年之内将出现原生的全模态统一生成模型,从底层共享同一个任务上下文与世界常识。

在这一路径下,阿里的视频生成技术正转向“Agentic Video”理念,让模型主动理解长剧本的叙事意图,自主进行分镜、调度角色与维持设定一致性,推动 AI 真正从单镜头生成迈向端到端完成复杂工程。

标签:阿里巴巴多模态通义千问视频生成Qwen

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍
置顶

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上
置顶

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
置顶

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

//

24小时热榜

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流
TOP1

NVIDIA 发布 Isaac ROS 5.0:引入智能体工作流

字节跳动获296亿美元银团贷款,重金押注AI军备竞赛
TOP2

字节跳动获296亿美元银团贷款,重金押注AI军备竞赛

3

OpenAI公布第三方AI安全评估的四大重点与七项原则

2小时前
OpenAI公布第三方AI安全评估的四大重点与七项原则
4

OpenAI升级GPT-6提示词缓存:最高立减90%成本

2小时前
OpenAI升级GPT-6提示词缓存:最高立减90%成本
5

虎鲸文娱发布鲸锐AI:打造全链路影视制作系统

16小时前
虎鲸文娱发布鲸锐AI:打造全链路影视制作系统
6

15999元折叠屏:中国精密制造的“升舱”时刻

18小时前
15999元折叠屏:中国精密制造的“升舱”时刻
7

爆火的FDE,为什么救不了中国企业的AI落地?

22小时前
爆火的FDE,为什么救不了中国企业的AI落地?
8

Expedia 接入 Meta Muse 智能体:可直接预订行程

1小时前
Expedia 接入 Meta Muse 智能体:可直接预订行程
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断