“H3 不是物理仿真最强的模型,但它是开放权重视频模型的一道分水岭。 ”
作者丨吴海明
编辑丨李娜 岑峰
MiniMax 选择开放 H3 权重,对视频生成行业来说是一个值得关注的信号。过去,高质量视频生成能力大多集中在闭源平台中,开发者和内容团队更多是在 API 或网页产品里调用模型;而 H3 的开放,让一部分高阶视频生成能力进入本地环境,使研究者可以测试模型边界,开发者可以接入自己的工作流,内容团队也能围绕特定风格和场景做更细的实验。
还记得《名侦探柯南》吗?每次案件发生后,现场看起来往往都很简单:一个人倒下了,一件东西碎了,一个密室出现了,核心考验是从现场不起眼的细节里还原完整的案发细节。
这次,我们把一道柯南式推理题交给了 MiniMax H3。
在《失窃宝物之谜》的故事线里,一只误闯进工作室的猫导致了陶罐破碎,那么猫是怎么进来的?它有没有蹭到窗框?台座为什么会晃?陶罐是被直接撞碎,还是先倾斜、滑落、坠地,再因撞击裂开?现场的碎片、痕迹和动线,能不能串成一条完整因果链?
基于这个背景,我们把任务改造成一次图文生成视频实测:给 H3 一张破碎陶罐的参考图,再用分镜描述补充高窗、猫、台座、坠落、撞击和碎片散落等细节,让它生成一段陶罐为什么会碎的过程视频。
由于 MiniMax H3 已经开放模型权重,我们选择在本地完成部署和推理。接下来,我们会先看它在实战中能做到什么:能不能还原完整因果链,能不能保持陶罐前后一致,能不能让猫的动作、台座晃动、陶罐坠落和最终碎片位置彼此对得上。
随后,我们再拆解 H3 生成这类视频背后的技术逻辑,并把同一任务交给 Seedance 2.0 Fast 做对比,看看开放权重模型和闭源商业模型,在效率、写实质感和物理细节上到底有什么差异?
所以,本文真正探讨的问题也就更具体了:当一个开放权重的通用多模态模型,开始具备把结果还原成过程的能力,AI 视频生成会发生什么变化?它能否真正支撑案发复原、事故推演、故事板预演这类对因果链要求更高的任务?接下来,我们用实测说话。
01
MiniMax H3 实战:还原陶罐破碎全过程
在本次测试中,我们在一台搭载英伟达 RTX A6000 GPU 的服务器上部署 MiniMax H3,考虑到后续需要通过节点式工作流接入参考图、分镜指令和视频生成参数,我们选择了更适合视觉生成实验的 ComfyUI 作为部署框架。
具体流程并不复杂,我们先从魔塔社区下载适用于 ComfyUI 的 MiniMax H3 模型权重,并将相关文件放入 ComfyUI 对应的模型目录;随后,安装 ComfyUI 运行环境,完成 Python 依赖、CUDA 加速组件和必要节点的配置。环境准备完成后,启动 ComfyUI 服务,并在浏览器中进入可视化工作流界面。
ComfyUI 部署 H3 的可视化工作流界面
模型启动后,将《名侦探柯南》中“案发结果”的破碎陶罐截图作为参考图输入。图中陶罐已经裂成几块,主体是棕褐色陶土材质,断裂处呈明显浅色边缘,碎片散落在灰色地面上,同时保留了动画风格的线条、阴影和室内低饱和色彩。接下来,我们要求 H3 根据这张结果图反向生成陶罐破碎前后的过程,明确要求模型忽略画面中的字幕、水印和平台标识,只提取陶罐碎片的颜色、材质、破损形态、地面透视和最终布局作为参考。
选取自《名侦探柯南》 #1178 失去的宝物之谜 的破碎陶罐截图,附带有字幕、水印和平台标识
生成结果中,H3 基本遵循了小猫闯入房间打破陶罐的叙事方向,视频开头先给出完整陶罐所在的室内空间,随后通过猫进入、靠近台座,把画面从静态陈设推进到事件发生。后续镜头中,陶罐经历了失衡、坠落和破裂,最终画面收束到地面上的大块陶片。
H3 先给出一个完整陶罐所在的室内空间,再通过猫的进入和靠近,导致陶罐出现失衡、坠落和破裂的连续变化,碎裂后画面逐渐收束到地面上的大块陶片。碎片的棕褐色材质、浅色断面以及动画风格的低饱和质感,与参考图保持了较高的一致性
这段视频完成度最高的地方是 H3 按照指令里的分镜逻辑,把破碎陶罐还原成了一段有前因后果的事件。视频开头先交代陶艺工作室环境,完整陶罐、低矮台座、高窗等关键元素陆续出现,给后面的“猫从窗户进入”建立空间关系。随后,猫进入室内并靠近陶罐,画面过渡到台座晃动和陶罐失衡,基本建立起“外力介入—陶罐坠落”的因果链。
最终结果的控制也比较稳定,陶罐破碎后,画面中保留了参考图里的几个核心视觉特征:棕褐色陶土材质、浅色断裂边缘、大块弧形碎片,以及低饱和动画风格。表明了 H3 并非机械复制原图,而是抓住了参考图中真正有用的结构信息,并将其融入到视频结尾。此外,视频中的动作节奏也较完整:陶罐不是突然碎裂,而是经历了靠近、晃动、倾斜、坠落、破碎几个阶段。虽然猫与陶罐接触的瞬间还不算完全严丝合缝,但整体叙事已经足够清楚,能够让观众理解陶罐破碎的原因。
02
H3 为什么能生成“案发复原”视频?
H3 能完成这类由结果生成过程的视频任务,关键在于它是一个原生多模态生成模型,能将文本、图像、视频和音频放在同一框架中处理,使参考图、分镜描述和声音指令能够共同参与生成。
不同于传统的先生成视频、再后期配音方式,H3 采用音画联合生成,在生成画面的同时,也生成对应的声音。因此,画面中的动作变化、物体碰撞和环境声可以在同一时间轴上对齐,减少声画错位的问题,能够生成带有窗框摩擦、猫爪落地、陶瓷碎裂等声音细节。
在图像控制上,H3 支持 reference-to-video/audio 工作流(H3 的核心能力术语),参考图可以作为主体、风格、材质或最终状态的约束。在本次任务中,破碎陶罐截图提供的是终局信息,陶土颜色、白色断裂边缘、碎片形态和地面布局,同时,文本指令提供过程信息,猫进入、撞击陶罐、陶罐坠落并碎裂。模型则要把图像中的终局状态和文本中的过程描述对齐到一条时间线上,H3 并不是在做真实物理推演,而是在多模态条件约束下,生成一条视觉和听觉上合理的状态变化路径。
从技术上看,视频生成的难点在于时序一致性,H3 的核心任务是让陶罐在多帧之间保持同一主体特征,同时完成从完整、晃动、倾斜、坠落到破碎的连续变化;依靠视频时序建模能力,在潜空间中预测连续画面。
因此,H3 能生成这段视频的核心技术是三项能力:一是多模态统一建模,能够同时理解文本、图像、视频和音频;二是参考图条件控制,能够从结果图中提取关键视觉约束;三是音画联合的时序生成,能够让动作、画面和声音同步展开。
03
对比 Seedance 2.0 Fast,
物理仿真成为分水岭
上述测试表明, H3 能根据一张破碎陶罐的结果参考图和过程文本,反向生成猫闯入、撞击陶罐并导致其坠地碎裂的完整事件链,不过,该结果整体仍偏向动画化表达,距离真实物理场景中的事故复现还有一定差距。基于此,本章进一步转向物理仿真维度,使用同一张结果参考图和同一套分镜指令,对 Seedance 2.0 Fast 与 MiniMax H3 进行同题测试,重点观察两款模型在生成效率、写实质感、动作连续性和破碎物理上的表现差异。
MiniMax H3 | Seedance 2.0 Fast | |
视频 | 见视频1 | 见视频2 |
抽卡次数 | / | 1次 |
单价 | / | 0.60元/秒 |
费用 | / | 6.00元 |
时间 | 54分钟4秒 | 3分钟23秒 |
重抽 | 0 | 0 |
视频1
视频2
从生成效率看,两段视频均为一次生成完成,没有进行重抽。闭源模型 2.0 Fast 的速度优势非常明显,仅用 3 分钟 23 秒 就完成了一段 10 秒视频;相比之下,H3 本地生成同类视频耗时 54 分钟 4 秒,这一差距并不能简单等同于模型本身性能差异,H3 的耗时很可能受到本地 GPU 设备较老、推理环境和工程优化不足等因素影响。从成本看,两者也代表了不同路线,2.0 Fast 按当前 0.60 元 / 秒 计费,一段 10 秒视频需 6 元;而开源权重的 H3 不按调用秒数付费,主要成本来自本地运行所需的电力消耗、硬件折旧和时间等待。一个是云端闭源服务的即时付费模式,另一个则是本地开源部署的长期持有成本。
从视频结果看,2.0 Fast 的完成度更高,镜头衔接更加连续,场景信息也更丰富,能够较清楚地交代从工坊环境、猫进入、靠近陶罐,到陶罐被撞倒、坠地碎裂、碎片停稳的完整过程。尤其是在关键动作节点上,2.0 Fast 能让观众看到事件是如何一步步发生的,而不是仅依靠结果画面来暗示过程。相比之下,H3 虽然同样完成了猫导致陶罐破碎的整体叙事,但关键细节的可见性不足,猫是否真正撞上陶罐并不十分确定,画面能够建立猫与陶罐处于同一事故现场的关系,但猫爪、身体与陶罐发生直接接触的瞬间并没有被清楚呈现,导致陶罐倒下的因果链略显模糊。对于物理仿真视频来说,这类关键接触点如果看不清,会直接削弱事故复现的可信度。
在写实质感上,2.0 Fast 更接近要求的实拍真实风格,画面低饱和、光比更强,室内空间、窗光、尘埃和陶罐材质都更接近真实摄影中的视觉效果。H3 则延续了前述测试中的特点,整体仍带有一定动画化和生成感,虽然可以讲清事件,但在像真实摄像机拍到的事故现场这一点上不如 2.0 Fast 稳定。
物理表现是本轮测试最关键的差异,2.0 Fast 中陶罐从被碰撞到失衡、翻落、坠地、碎片滑散和停稳,过程更完整,也更容易被观看者理解,陶罐的重量感、坠落方向和碎片运动都有较强的视觉说服力。相比之下,H3 更像是在用镜头叙事完成陶罐碎了这一事件,而不是充分展示陶罐如何在真实受力条件下破碎。
从细节上看,两个模型都存在一定的违和感。在 2.0 Fast 生成的视频中猫的动作略显刻意,像是为了完成撞倒陶罐这一任务而故意推倒陶罐,缺少真实猫咪行动中的随机性和自然惯性,这使得它的物理链条虽然更完整,但在动物行为的自然度上仍有一定违和感。H3 的不足则体现在声音和收尾细节上,首先是视频开头的声音并不准确,听感上并不像猫咪脚步声或爪子摩擦窗框的声音,而更像与画面动作不完全匹配的音效。然后,指令中要求猫在事故后从高窗逃离,但 H3 对这一细节呈现不足,结尾更多停留在破碎陶罐本身,缺少猫离开现场的明确镜头。
综合来看,2.0 Fast 在本轮物理仿真测试中更占优势,镜头连续、过程清楚、写实质感更强,尤其能把陶罐从受力到破碎的关键物理节点交代出来。H3 则展示了从结果图和过程文本组织完整事件的能力,并且具备原生音画生成的潜力,但在写实风格、关键接触细节和复杂物理交互上仍有提升空间。
04
结论:开放权重与闭源商业,
两条路线的实测比拼
在上述测试中,揭示了开源模型与闭源商业模型在使用路径上的差异,前者强调可部署、可研究和可控性,后者则更依赖平台化工程优化,追求即时可用的高质量结果。
从模型权重看,H3 将高质量视频生成能力部分开放给社区,使用户能够在本地部署和测试模型,探索参考图驱动、文本控制和原生音画生成等能力。需要注意的是,H3 并不是完整意义上的全栈开源,官方提到,由于系统复杂度较高,部分模块尚未开源,并提供 API 用于验证完整能力。因此,本地开源权重版本与官方宣传效果之间可能存在差距;如果希望获得更接近官方演示的生成质量和效率,仍可能需要依赖官方 API。
从测试效果看,Seedance 2.0 Fast 在本轮物理仿真任务中整体更占优势,生成速度更快,画面更写实,镜头连续性更好,对陶罐从受力、坠落到破碎的物理过程交代得更清楚。H3 反映了开放权重模型已经具备根据结果参考图和过程文本反向生成事件视频的能力,而在本地部署条件下,仍存在生成耗时较长、风格偏动画化、关键接触动作不够明确、音画细节不够准确等问题。
因此,H3 的意义更多在于开放探索:为本地化、多模态视听生成和结果反推过程提供了一个可研究的起点;而 Seedance 2.0 Fast 则更体现闭源商业模型在工程优化、写实质感和物理仿真稳定性上的成熟优势。当前阶段,视频模型已经能够把“结果图”扩展为“过程视频”,但要真正达到可靠的物理事故复原,模型还需要进一步解决动作因果、受力逻辑、碎片运动和音画同步问题。
▼
推荐阅读
▼
我们用Qwen 3.8-Max做了一个AI大模型宇宙:效果竟然胜过GPT5.6!
2026-08-07
我们用 Kimi K3 搓了一颗火影螺旋丸,只花 129 元就顶一个前端团队?
2026-07-29
精彩评论