MiniMax-H3 FL2VA:ComfyUI 生产栈 vs 原生 Python(diffusers)

统一规格:1344×768,124 帧(5s@24fps),lightx2v turbo v1.0 768p LoRA,4 次去噪评估,seed 4242, 同一段 prompt(未经 GPT 改写),同一台 8×5090 机器。两栈 RNG 语义不同,画面细节必然不同, 应比较的是质量档次与语义还原,不是逐帧一致。原生栈 = 官方 diffusers 权重 + lightx2v 原生版 LoRA(非 ComfyUI 转换版)+ 我们移植的官方 rank-8 剪枝配方 + torchao 量化 + sage attention + torch.compile, 纯 Python,无 ComfyUI 依赖。文本编码均按"热服务"口径(ComfyUI=节点缓存命中,原生=embedding 缓存命中)。

速度与显存(热跑稳态,同规格)

配置s/评估采样(s)VAE解码(s)端到端热(s) 峰值显存(GiB)说明
ComfyUI 生产栈(int8_convrot+sage,GPU2-5)6.425.912.542.7–43.3对照标杆:/api/status 各阶段计时,prompt 缓存命中口径
原生·fp8 常驻+compile+fp16VAE (pfp8r) ★6.425.916.340.3–45.7 (均42.8)29.4与生产打平;推荐部署形态,常驻单进程
原生·int8dq+compile(三相搬运) (pint8)6.325.333.561.826.3采样与fp8同速;未配常驻+fp16VAE,还有约19s可省
原生·fp8+compile(三相搬运) (pfp8)6.425.533.589.524.0每案首步27.8s=cpu↔gpu搬运税,常驻版已消除
原生·fp8 无compile (pfp8nc)9.9–12.9~4433.575–7629.0compile消融:不compile采样慢1.6–2×,显存反而更高
原生·nvfp4+compile (pnvfp4)56.316.2显存最省(-10GiB);历史结论画质劣于int8/fp8,请肉眼复核
原生·pruned bf16+offload (pbf16)14.1~5628.069.5–70.519.9剪枝质量对照:只剪枝不量化
原生·全量 bf16+offload (bf16)15.8~6328.090.5–11020.9无剪枝无量化基线(最忠实还原)
原生·不剪枝 fp8 (qfp8)OOMOOM失败>31.4不剪枝的fp8变换器装不进32G单卡 → 剪枝是单卡常驻的前提

雪林狐狸(晨光跟拍) fox_snow

ComfyUI 生产栈
int8_convrot + lx2v turbo4 + sage(生产 GPU2-5)
原生·fp8 常驻+compile
prune+fp8+sage+compile,常驻(推荐)
原生·int8dq+compile
prune+int8dq+sage+compile,三相
原生·pruned bf16
剪枝质量对照(offload)
原生·全量 bf16
无剪枝无量化基线(offload)
原生·nvfp4
显存最省档,画质请重点审

雨夜霓虹街(伞下行人) night_street

ComfyUI 生产栈
int8_convrot + lx2v turbo4 + sage(生产 GPU2-5)
原生·fp8 常驻+compile
prune+fp8+sage+compile,常驻(推荐)
原生·int8dq+compile
prune+int8dq+sage+compile,三相
原生·pruned bf16
剪枝质量对照(offload)
原生·全量 bf16
无剪枝无量化基线(offload)
原生·nvfp4
显存最省档,画质请重点审

火山崖巨浪(航拍环绕) ocean_cliff

ComfyUI 生产栈
int8_convrot + lx2v turbo4 + sage(生产 GPU2-5)
原生·fp8 常驻+compile
prune+fp8+sage+compile,常驻(推荐)
原生·int8dq+compile
prune+int8dq+sage+compile,三相
原生·pruned bf16
剪枝质量对照(offload)
原生·全量 bf16
无剪枝无量化基线(offload)
原生·nvfp4
显存最省档,画质请重点审
生成时间:2026-08-17 · 由原生管线评估任务自动构建 · 原始数据 stats.jsonl / 各 /tmp/native_*.log