RunningHub开源MiniMax H3加速方案H3 Lightning,在保持BF16满血精度下将视频生成速度提升12倍,针对消费级与工作站无NVLink环境优化,显著降低本地部署与生产落地门槛。
MiniMax开源视频模型H3后,社区涌现了大量工作流与衍生玩法,但长等待时间依然困扰着创作者。生成一段5秒视频往往需要数分钟,限制了试错与创作节奏。针对这一痛点,一站式AIGC创作平台RunningHub开源了加速方案——H3 Lightning,将生成耗时直接压缩了约92%。

在4张RTX 6000D测试环境下,生成一段5秒、1344×768分辨率的视频,原生BF16 50步方案需要348.8秒(近6分钟),而经RunningHub H3 Lightning加速后仅需28.7秒,实现了约12倍提速,且全程保持BF16数值精度,未通过降精度妥协画质。
目前,该方案已在GitHub上开源,面向全体开发者开箱即用。

在8张RTX 6000D配置下,H3 Lightning生成15秒、768×1344分辨率视频时,纯文生视频约需48秒,双参考图图生视频约需73秒,成功将15秒长视频生成带入「1分钟级」区间。

实测生成沙漠越野摩托的高动态场景,包含复杂运镜与腾空甩尾,耗时约30秒,物理运动逻辑与落地震颤连贯。而在吉卜力风格的多镜头15秒图生视频测试中,角色特征一致性良好,镜头切换自然,二次修改场景与天气的耗时缩短至50秒左右,大幅降低了影视与短视频创作者的创意试错成本。
不降精度、不依赖超级算力集群,H3 Lightning的加速收益主要源于推理链路上的三层工程优化:

torch.compile进行编译期算子融合与调度优化,进一步将耗时从43秒降至28.7秒。
整套方案集成在SGLang多模态推理引擎中统一调度。H3 Lightning避开了只依赖数据中心集群的路线,专门面向中小工作室与个人开发者的硬件配置进行了落地适配。
在AI视频模型加速背后,RunningHub母公司海马云拥有十余年GPU虚拟化、大规模边缘调度与云渲染积累,支撑着超过2000万月活用户的算力服务。面对生成式AI时代,海马云将GPU工程能力扩展到了大模型推理加速。

从早期开源全套ComfyUI节点、支撑电商视频生成与漫剧工作流,再到如今推出开源推理加速方案,生态贡献者正在填补开源模型权重与规模化生产力之间的关键工程空白。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断