新加坡国立大学Show Lab提出下一代多模态架构Show-o与Show-2,在单一Transformer中打通自回归预测与离散掩码扩散,解决图文理解与生成的割裂难题,并成功落地具身智能机器人决策。
多模态模型的“理解”与“生成”能否在同一网络底座中原生融合?以往主流方案往往依赖多模型拼接(如大语言模型外挂独立扩散模块),并未真正打通底层架构。
在 ECCV 现场,新加坡国立大学(NUS)Show Lab 负责人寿政教授展示了团队的突破性成果——Show-o 系列模型。该架构不仅打破了文本离散性与视觉连续性的冲突,更将统一多模态大模型推向了物理世界的具身机器人决策。

视觉与语言交叉任务长期分为两条路线:视频理解(视频转文本或问答)与视频生成(文本生成动态画面)。过去业界习惯为两者构建专属模型,但在通用人工智能(AGI)演进中,单一统一底座已成必然趋势。

更关键的是,多模态 AI 正在从单纯的“语言-视觉交互”进入“体验时代”。模型不能仅停留在静态图文关联,而是需要融入“动作”维度,在真实或虚拟环境中采取行动,并通过实时物理反馈实现“在做中学”。
此前行业探索主要受困于两套范式的取舍:

Show-o 给出的解法是:在单个 Transformer 架构内,将处理文本的自回归(Autoregressive)机制与处理视觉的离散掩码扩散(Discrete Mask Diffusion)机制结合。
这种设计兼顾了自回归的多模态建模能力与扩散模型的高效采样,支持任意顺序和组合的多模态输入输出。

为了从静态图像走向动态视频,团队进一步演进出 Show-2,重点攻坚了三项工程与算法挑战:

统一架构最终被注入实体机器人系统。在固定双臂系统与轮式移动底盘的实验环境中,操作员通过遥操作采集高精度的“状态-动作轨迹”数据,用于训练视觉-语言-动作模型(VLA)。

团队在此基础上构建了世界动作模型(World Action Model, WAM),实现“既能预测机器人下一步动作,又能同步预演该动作所引发的环境像素变化”。
面对物理落地的延迟难题,系统采取云端结合架构:云端前沿大模型负责长序列全局规划,端侧自研的轻量骨干网通过特征蒸馏提供毫秒级低延迟控制,成功保障了自动化双臂协作等复杂任务的平稳执行。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断