评测人员用一张破碎陶罐截图,要求MiniMax H3反向生成破裂全过程。测试显示,H3能还原完整事件链,但写实度和物理细节不及Seedance 2.0 Fast。开放权重让H3成为本地部署的研究起点,闭源商业模型则展现工程优化优势。
MiniMax 开放 H3 权重,为视频生成行业释放了一个明确信号。过去,高质量视频生成能力大多封闭在闭源平台;H3 的开放,让开发者和研究者可以在本地部署模型,围绕参考图、文本控制和音画协同做更细的实验。

为了检验 H3 的极限,评测人员设计了一道“柯南式”推理题:将《名侦探柯南》中一张破碎陶罐的结果截图交给模型,要求它反向生成陶罐从完整到碎裂的全过程——猫何时闯入、台座为何晃动、陶罐如何坠落、碎片为何四散。

基于此,测试任务被改造成一次图文生成视频实测:输入破碎陶罐的参考图,用分镜描述补充高窗、猫、台座、坠落、撞击和碎片散落等细节。

测试在搭载 RTX A6000 的服务器上进行,通过 ComfyUI 部署 H3 权重。输入是一张带有字幕和水印的破碎陶罐截图,文本指令要求模型忽略画面中的文字,只提取陶罐颜色、材质、破损形态和地面布局作为参考。参考截图取自《名侦探柯南》第1178话《失去的宝物之谜》。

H3 生成的视频基本遵循“猫闯入—陶罐失衡—坠落碎裂”的叙事。视频先交代工作室场景,完整陶罐、低矮台座、高窗等元素为后续动作建立空间关系;随后猫进入室内,陶罐经历倾斜、坠落、破裂,最终收束到地面大块陶片。碎片保留棕褐色材质、浅色断面和低饱和动画风格,与参考图保持一致。

能完成这类任务,源于 H3 的原生多模态架构。它将文本、图像、视频和音频置于同一框架,支持参考图到视频/音频工作流:参考图提供终局信息,文本指令提供过程信息,模型需要在一条时间线上对齐两者,生成视觉和听觉上合理的状态变化路径。H3 还采用音画联合生成,让动作、碰撞声与画面同步。

视频生成的核心难点是时序一致性。H3 依靠视频时序建模,在潜空间中预测连续画面,让陶罐在多帧之间保持主体特征,同时完成从完整、晃动、倾斜到破碎的变化。
随后,评测人员将同一任务交给 Seedance 2.0 Fast。效率方面,Seedance 2.0 Fast 生成一段 10 秒视频仅用 3 分 23 秒,按当前计费约 6 元;H3 本地生成用时 54 分 4 秒,成本集中在电力和硬件折旧。

写实与物理方面,Seedance 2.0 Fast 明显更占优势:镜头衔接更连续,低饱和画面和强光比更像真实摄影机拍到的现场;陶罐从受力、翻落到碎片滑散,过程完整,重量感真实。H3 则更像动画叙事,猫是否真正撞到陶罐不够清楚,关键接触瞬间没有明确呈现,声音开头不准确,猫从高窗离开的指令也被忽略。
总结来看,Seedance 2.0 Fast 在物理仿真任务中整体胜出,但 H3 展现了一个重要能力:根据结果图和过程文本,反向组织出完整事件链。两者代表不同路线——本地开源部署是可研究的起点,闭源商业模型则依赖工程优化提供即时的高质量结果。H3 的价值不在物理仿真,而在于它是开放权重视频模型的一道分水岭;要真正达到可靠的物理事故复原,模型仍需解决动作因果、受力逻辑和音画同步等问题。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断