AndyX:“换成更快的 checkpoint、Attention 或缓存以后,同一个 Seed 生成的画面为什么变了?变了又是否等于变差?”这是视频生成加速里最容易被一句“快了多少”掩盖的问题。于是我把 MiniMax H3 放到 Azure H100 NVL 上,用 T2V、I2V、R2V 三类任务跑完 F0–F7 八种组合。本文先谈质量,再谈速度;尽量让第一次接触本地视频生成的读者也能看懂,同时把工程边界讲清楚。

测试平台Azure Australia East · 1× NVIDIA H100 NVL
测试规模144/144 技术通过 · 96 正式 + 48 预热
输出规格1344×768 · 24 fps · AAC 32 kHz 立体声
MiniMax H3 在 Azure H100 上进行多模态视频生成质量与加速评测的原创插画
MiniMax H3 × Azure H100:这次关注的不只是“快”,而是加速后的视频是否仍然值得用。

先给结论:没有一个开关适合所有任务

如果只记住四件事,可以记这四条:

  1. Cache-DiT 是最稳定的加速因素:六个任务格的主效应都为正,跨任务 Sampler 配对几何主效应约为 1.43×
  2. F3 是 T2V 专用快档:5.167 秒和 10.125 秒 T2V 的 Sampler 分别达到 2.005×1.990×,但不能把这个结果外推到 I2V、R2V。
  3. F6 是更均衡的通用档:保留 Full checkpoint,叠加 SageAttention 与 Cache-DiT;质量诊断接近 F0,尤其适合 10 秒 I2V 和长 R2V。
  4. F7 在整批工作量里最快:Wall 加速 1.732×,但 R2V 的时序诊断风险相对最高,必须看真实视频抽样,不能只看汇总数字。

我的默认建议:通用任务先从 F4 或 F6 开始;明确只做 T2V 时再试 F3;F7 留给愿意为 R2V 增加视觉抽检的人。工程优化不是“一律全开”。

新手先懂三个缩写:T2V、I2V、R2V

模式 输入是什么 最应该看什么
T2V 文字生成视频 提示词是否落实、主体是否稳定、动作是否完整
I2V 首帧图片生成视频 首帧是否保持,以及后续身份、手部、动作是否自然
R2V 参考视频约束下的风格重构 主体连续、动作顺序、镜头时序、目标风格和音视频完整性

R2V 不是逐像素复制参考视频。它更像“保留运动和节奏,再让模型按目标风格重画”。因此,背景几何不完全一致,并不能单独证明结果不好。

为什么同一个 Seed,画面还是会分叉?

Seed 可以把初始随机噪声固定住,却不能保证后续每一步计算完全相同。

扩散式视频生成会经历多轮去噪。把 Full checkpoint 换成 Pruned checkpoint、把 SDPA 换成 SageAttention,或让 Cache-DiT 复用部分计算,都会改变某些中间数值与执行路径。微小差异会在连续去噪中累积,最后让构图、动作、纹理甚至细节走向另一条生成轨迹。

这和传统视频编码不同:这里不是把同一段成片“压缩一下”,而是在改变生成成片的过程

正确理解:同 Seed 结果像素不同,不自动等于质量更差;反过来,某个相似度数字很高,也不能证明两段视频的观感、语义和动作完全一致。

MiniMax H3 F0 基线的同 Seed T2V 接触表
F0 基线:先观察主体持续性、面部与手部、服装背景跳变,再看动作顺序。
MiniMax H3 F3 加速配置的同 Seed T2V 接触表
F3 T2V 快档:10 秒 Wall 388.71 秒、Sampler 365.86 秒;速度接近 2×,但仍需要视觉检查。

SSIM、PSNR、锐度和时序指标,到底能证明什么?

它们都是诊断仪表,不是“观感等价证书”。

指标 适合发现什么 不能单独证明什么
SSIM 结构是否接近,特别适合检查 I2V 首帧保持 美学、语义、身份和后续动作是否一样好
PSNR 像素误差,数值越高通常越接近参考 画面是否更好看、故事是否正确
Sharpness gradient 整体是否变软 更高就一定更好;噪点和过度锐化也会抬高它
Temporal MAD 相邻帧变化强度,帮助发现过静或异常抖动 动作自然或内容正确
Temporal correlation / MAE R2V 与参考视频的运动、亮度时序是否同步 风格重构的整体审美质量

本次全部 I2V 的 Global SSIM 为 0.9965–0.9974,首帧 PSNR 为 35.01–36.50 dB。这说明首帧保持整体很接近,但不能据此跳过对人脸、手部、身份连续性与动作完整性的人工检查。

F3 的全局锐度诊断相对 F0 下降约 4.64%,它提示我们重点看真实画面,但不能据此直接判定 F3 的视觉质量最差。F7 的 R2V 时序相关变化为 -0.0727、时序 MAE 变化为 +0.0660,这也是为什么它虽然快,R2V 仍需要视觉门。

MiniMax H3 F0 到 F7 的速度与锐度诊断图
速度—锐度诊断图:纵轴不是感知质量评分,异常点只负责提醒“去看样本”。

F0–F7:八个档位其实只是三个开关

三项因素分别是 checkpoint(Full / Pruned)、Attention 路径(SDPA / SageAttention)和 Cache-DiT(关 / 开)。三项开关形成 2×2×2,也就是八种配置。

配置 Checkpoint Attention Cache-DiT 新手理解
F0 Full SDPA 最保守的基线
F1 Pruned SDPA 只换轻量 checkpoint
F2 Full Sage 只换 Attention 计算路径
F3 Pruned Sage T2V 专用快档
F4 Full SDPA 保守通用,稳定吃到缓存收益
F5 Pruned SDPA 速度高,但保留 Pruned 变量
F6 Full Sage 质量—速度平衡的通用档
F7 Pruned Sage 全开、总体最快,R2V 必须抽检

质量优先:这批样本告诉了我们什么

SageAttention:F2 与 F0 的 I2V 首帧 SSIM、R2V 时序相关和 MAE 几乎重合。在这套环境里,它更像低风险的计算内核优化,但仍不意味着所有设备、版本和提示词都必然得到相同结果。

Cache-DiT:F4 与 F6 的质量诊断接近基线,并在长 I2V、R2V 中提供最稳定的收益。它是这轮矩阵里最值得优先尝试的单项因素。

Pruned checkpoint:没有出现普遍崩坏或统一变糊,但更容易改变生成轨迹。在 R2V 中,它的平均时序相关性略低、MAE 略高,因此适合拿来做明确的 T2V 快档,不适合未经验证就当成所有模式的默认值。

MiniMax H3 F0 的 I2V 同 Seed 接触表
F0 I2V 基线:10 秒 Wall 801.68 秒、Sampler 781.14 秒。
MiniMax H3 F6 的 I2V 同 Seed 接触表
F6 I2V:10 秒 Wall 479.71 秒、Sampler 459.48 秒,约为 1.67× / 1.70×,首帧 SSIM 差异接近零。

速度怎么读:Wall 与 Sampler 不要混在一起

Sampler time 更接近模型去噪计算本身;Wall time 则是用户从提交到完成的实际等待,还包括加载、解码、缓存等开销。

另一个常见误区是把 1.5× 理解为“省了一半时间”。正确计算是基线时间 ÷ 当前时间;1.5× 相当于当前用时约为原来的三分之二,也就是快约 33%。

工作负载 本次推荐 Wall 加速 Sampler 加速 解释
T2V 5.167s F3 1.895× 2.005× 短 T2V 的最高计算加速
T2V 10.125s F3 1.926× 1.990× 长 T2V 同样接近 2×
I2V 5.167s F4 / F5 约 1.04× 约 1.04× 收益小,不必激进优化
I2V 10.125s F6 1.673× 1.702× 最快且质量诊断接近 F0
R2V 5.167s F4 1.707× 1.663× 避免 Pruned 变量
R2V 10.125s F7 1.909× 1.884× 最快,但正式样本波动约 8.4%,需补测与抽检

还要注意,10.125 秒不是 5.167 秒成本的简单两倍。帧数约增加 1.96×,多数配置的 Wall 时间却增加 2.78–4.89×;长视频的 Attention 与内存行为是非线性的。

完整测试范围:不是只挑了几条最快结果

  • 144/144 条核心运行通过技术检查。
  • 96 条正式结果,另有 48 条 warm-up。
  • 覆盖 T2V / I2V / R2V、5.167s / 10.125s、F0–F7。
  • 每格为 1 次 warm-up + 2 个正式 Seed。
  • 统一输出为 H.264、1344×768、24 fps,并带 AAC 32 kHz stereo。
  • 统一 20 steps、res_multistep Sampler、simple Scheduler。

所有保留视频均可完整解码;自动检查未发现黑帧或整段冻结。这里的 96 条正式样本适合做方案筛选和容量估算,但不足以支撑普适统计结论。要形成发布级、跨素材结论,仍应扩大提示词、参考素材与重复次数。

可复现环境:每个版本都要锁住

组件 本次环境
Azure 区域 / VM Australia East · Standard_NC40ads_H100_v5
GPU 1× NVIDIA H100 NVL,94 GB 标称 / 95,830 MiB 运行时
CPU / 内存 40 vCPU AMD EPYC Genoa · 320 GiB RAM
操作系统 Ubuntu 24.04.4 LTS · x86_64
NVIDIA / CUDA Driver 580.159.03 · CUDA Runtime 13.0
Python / PyTorch Python 3.12.12 · PyTorch 2.10.0+cu130
ComfyUI 0.30.0 · commit 2eb609766a749e3104485979615e062e401bab97
Comfy-Kitchen 0.2.26 · CUDA backend active
SageAttention 2.2.0 · revision d1a57a546c3d395b1ffcbeecc66d81db76f3b4b5
Cache-DiT revision 1d92bbd86ec59aa6223fe2368849b7413a1acb93
MiniMax H3 revision bfc8ed0353f5a9733be73e6b2c98ec0948195b86

Cache-DiT 固定为 F8 / B0 / threshold 0.12 / warmup 3;Sage 路径为 sageattn_qk_int8_pv_fp16_cuda,PV 使用 FP32 累加。复现实验时,除了软件版本,还要同时固定输入、Seed、帧数、采样器和计时边界。

最后怎么选:一张新手决策表

你的目标 从哪里开始 上线前要看什么
优先稳妥、通用 F4 做常规素材抽检
兼顾质量与速度 F6 按人物、产品、风格等素材类型抽检
明确只做 T2V F3 确认场景锐度、主体稳定和动作完整性
追求整批最快 F7 给 R2V 设置强制视觉抽检,并补足重复样本

这轮实验最有价值的结论,不是“MiniMax H3 一定能快多少”,而是:质量与速度必须按任务一起看。Cache-DiT 值得优先尝试,F3 有清晰的 T2V 专长,F6 更适合当日常平衡档,而 F7 的速度需要用更严格的 R2V 视觉检查来交换。

把自动指标当仪表盘,把真实视频当最终答案,才是面对生成式视频时更可靠的评测方式。


范围声明:本文结论仅对应上述固定软硬件、模型版本、参数与样本矩阵,不代表所有设备、素材或版本。文中不作普适 2×、权重精度等价、确定显存节省或视觉观感等价的承诺。

参考资料

  1. MiniMax H3 固定版本
  2. ComfyUI 固定提交MiniMax H3 工作流文档
  3. Azure NC family VM sizes
  4. SageAttention 固定版本
  5. ComfyUI-CacheDiT 固定版本