智象未来正式发布原生全模态视频生成模型 HiDream-O1-Video-1.0。该模型主打物理规律导向与音画一体化直出,在 Artificial Analysis 评测中位列全球第四,同时公司宣布完成新一轮 C+ 轮融资。
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(简称 HD-V1)。
该模型采用自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出 5 至 20 秒的 1080p 高保真视频,在物理规律理解、自主规划叙事以及音画一体化生成等维度均有突破。

在独立 AI 基准测试平台 Artificial Analysis 的图生视频排行榜(含音频)中,HD-V1 位列全球第四;在盲测评测平台 Arena.ai 的图生视频榜单中取得第八名。


智象未来 CTO 姚霆表示,视频生成的代际演进不仅在于像素和时长,更在于模型能否理解创作者意图与物理世界的规律。HD-V1 从底层面向文本、视频与音频的统一表征,推动生成系统从单纯画面连贯走向深度语义与动作自洽。
针对碎片化提示词易导致的镜头跳跃与主体漂移,HD-V1 前置了多模态意图理解模块。该模块会将自然语言输入转换为结构化的专业导演规划,覆盖镜头时长、分镜运镜、焦段、角色动作以及音效台词设计,保障生成链路不跑偏。
同时,模型将重力、碰撞反馈、惯性延展与空间光影衰减等物理规律纳入叙事逻辑:



在穿针引线的精细动作测试中,传统模型易出现红线异常缩短或针凭空出现的幻觉,而 HD-V1 则模拟了双手用力时线体的形变、微捻线头时的张力延展,以及指甲和金属的高保真纹理。

为了保障长镜头中的人物一致性与逻辑连贯,智象采用了「先规划、后联合生成、再以多模态 Reward 对齐」的技术方案。模型先在全局层面确定叙事与角色状态,再约束生成细节,最后引入多模态奖励信号对齐连贯性。
在生成时长控制上,HD-V1 放弃了机械填充固定秒数的机制,改由内容本身的动作逻辑决定节奏。例如抛接苹果的动作,模型能根据物理完成周期自主收束画面,避免无效慢放或画面静止等待。



针对行业普遍采用的先出视频、后配音轨导致的音画错位问题,HD-V1 在原生全模态架构内对文本、视频、音频信号联合建模。镜头运动牵引声音空间感,动作碰撞实时触发物理拟音,人物开口与发音气口同频。



在乒乓球弹跳测试中,弹落节奏与撞击桌面的声效高低、频次形成因果对应。其后训练阶段结合了扩散强化学习(Diffusion Reinforcement Learning)与人工认知对齐模型,以提升视听综合质感。
伴随 HD-V1 的推出,智象未来基于统一底座构建的模型家族正式形成闭环:包括图像模型 HiDream-O1-Image、交互式世界模型 HiDream-O1-World 以及具身世界模型 HiDream-O1-Embodied。

智象创始人梅涛表示,公司旨在建立一个底座同源演进的原生全模态体系,使图像、视频、交互与具身动作持续循环。
此外,智象未来宣布完成 C+ 轮融资,投资方包括新微资本、交子资本与工银资本,资金将主要用于算力基建拓展与多模态世界模型的落地推进。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断