原生 diffusers 管线评估 — 实时进度页

更新:2026-08-17 23:05 · 画质终审:用户已裁定 nvfp4 略糊,fp8=int8=生产肉眼无差,选型定 fp8;W4A8 等 mslk 依赖批准 · 主对比页(124帧基准+画质):index · 本页跟踪进行中的六线实验,每批结果落地即更新

📌 当前定型结论(2026-08-17 终审后)

①量化选型:fp8(W8A8)定案 —— 用户终审:fp8=int8=ComfyUI 生产肉眼无差;nvfp4 略糊降级为容量应急档;W4A8(int4权重+int8激活)已测判死:画质干净但 11.1s/评估+峰值30G 被 fp8 双杀(int4-g128 吃不到 Blackwell FP4 核;真 fp4×fp8 需等 torchao 放出 MX 混合精度)。
②三种生产模式全部对齐:T2V(42.8s=生产43s)、I2V(55s vs 52s,首帧还原一致)、FLF2V(57s vs 48s,首测即通)。
③8step 已修复打平(alpha 烙入;热态 66-72s vs 生产 65-68s);LoRA 4/8 运行时热切可行(0.4s 零重编译)。
④15s 打平(fp8-offload 205s / nvfp4 211.9s vs 生产 215.6s);并发零劣化(4实例,~655条5s/小时/机8卡外推)。
⑤剩余主线:显存纪律移植(进行中,目标 1080p 15s + ref2va 余量)。生产形态建议:fp8+compile+常驻,8卡独立管线起步,显存吃紧再演进 DiT/VAE 分卡+独立 Qwen。

各线状态

实验线位置状态关键结果
124帧 基准矩阵(7配置)viggle 0/1/6/7完成fp8常驻 42.8s = 生产 43s;见 主页
I2V First-Frame 对比viggle GPU7完成e2e 55s vs 生产 52s;首帧还原度两栈几乎相同(~29dB);缩放语义核实一致
15s(362帧 768p)速度viggle GPU0/1完成fp8-offload 205s ≈ nvfp4 212s ≈ 生产 215.6s(±5%打平);fp8常驻在362帧下确定性OOM
nvfp4 容量探边viggle GPU6完成768p 上限 498帧(20.8s);1080p 上限 243帧(10.1s);OOM 全在去噪段,解码补救无效
int8dq 常驻档补测viggle GPU1完成·可用45-51s/条,峰值27.6G(需去噪期逐出VAE);略逊 fp8 常驻的 42.8s
W4A16(nvfp4权重only)已取消用户裁定不测(速度必回落 bf16 档,定位鸡肋)
1080p(1920×1088)15s fp8-offloadviggle GPU0OOM 判死连 offload 都装不下(去噪激活自身超卡)→ 1080p 15s 单段在 32G 上不可行,需分段或去噪期分块
LoRA 运行时切换(hotswap)viggle GPU0/1完成·可行热切 0.33-0.4s 零重编译,峰值 28.9G;无需双份权重分池;详见下节
8step v1.0 LoRAviggle GPU0已修复·解锁根因=文件 alpha=8/rank=128 元数据被清洗丢弃→16×超强度=噪声;烙入缩放后画面正常,71.6s/条(8评估,fp8常驻)
4实例并发压测(4step fp8常驻)Minimax_5090 GPU4-7完成并发劣化 0%(43.6s vs 单实例45.0s),吞吐严格4×,8卡外推≈655条5s视频/小时/机;前提=embed缓存/独立文本编码
W4A8(int4+int8)Minimax GPU4已测·判死11.1s/评估(fp8=6.4)、峰值30.0G(fp8=29.4),画质干净但被 fp8 全面碾压;真fp4×fp8等torchao MX混合精度
90分钟 soak · fp8常驻档viggle GPU0通过·生产就绪45/45 零失败,elapsed/峰值/池/宿主内存四曲线全平直(41.6±1.2s,峰值恒29.2-29.4G)→ 可 24×7;建议上线前补一次 8-24h 长跑终验
soak · 15s offload 档viggle GPU7发现严重回归今日「显存移植」agent 重写驱动 offload 分支时引入显存分配器风暴,会拖停全机 GPU(两次受控实验证实;同配置旧版驱动 3/3 通过)→ 已勒令实现 agent 先修复/回滚再继续 1080p 主线
量化成品序列化Minimax GPU5完成18.9G 成品直载,ready 41s→19s;与现场量化 640 张量逐位一致;driver 加 --quantized-ckpt
ref2va 原生化开题Minimax GPU6/7完成·跑通换人成立:fp8+offload 227s/条@768p124f,峰值24-25.5G;序列~80k行→常驻OOM差654MB=显存移植的直接受益者;denoise 126s与ComfyUI全程同量级
激活显存剖析viggle GPU6完成·突破1080p×362f(15s)合成forward实测PASS@30.08G:patch-pack(位级,−4.4G)+按头分块(位级,−2.9G)+FF分块(量化噪声级);速度零损失;768p上限预估提至~750f
显存移植(树内整合+端到端)viggle GPU1+多卡进行中主目标已明确:fp8+权重流式+三件套 @1080p 362f(=ComfyUI 机制的直接对标,画质即用户终审过的 fp8 档;fp8 per-row 尺度下 FF 分块天然位级);nvfp4 版仅作参考

15s(362帧 1344×768)速度对比 — 三家 ±5% 内打平

配置稳态 s/评估采样(s)VAE解码(s)存盘(s)e2e 均值(s)峰值(GiB)
ComfyUI 生产(int8+turbo4)~36.5144-15136.5-38.5~30215.6
原生 fp8 + group-offload36.5-37147-16548-534-7205.021.3
原生 nvfp4 三相(免补救)~34(快8%)146-16953-544-5211.925.0
要点:①fp8 常驻模式在 362 帧确定性 OOM(19G 权重+激活>32G;decode-evict/vae-tile 均无效,OOM 在去噪段)——124帧的 42.8s 常驻优势到 15s 档不存在;②生产采样最快但被 ~30s 存盘拖累,原生封装只要 5-7s;③原生管线原有 15.0s 时长上限,已加 --max-duration 放行 362 帧(=15.08s)。
fox_snow
原生 fp8-offload
原生 nvfp4
night_street
原生 fp8-offload
原生 nvfp4
ocean_cliff
原生 fp8-offload
原生 nvfp4
(生产 15s 对照片未回传站点,需要的话可补挂)

I2V(首帧条件)对比 — 语义对齐验证通过

fox_snow e2enight_street e2eocean_cliff e2e首帧还原度(PSNR)
ComfyUI 生产(4步)51.9s52.0s52.8s29.1-29.7 dB
原生 fp8 常驻(4评估)56.7s55.3s54.4s28.8-29.3 dB
两栈首帧还原度差 <0.5dB(都是 VAE 往返+H.264 的有损底)→ 首帧条件语义一致;输入图均为 1344×768(=输出分辨率,符合生产对齐要求),原生 ResizeStep 的缩放行为经代码核实与生产节点逐像素一致。原生差距全在文本编码(此实验禁用了 embedding 缓存)。
fox_snow
生产 ComfyUI
原生 diffusers
night_street
生产 ComfyUI
原生 diffusers
ocean_cliff
生产 ComfyUI
原生 diffusers

容量探边(完成,nvfp4 免补救=加满补救,边界一样)

画布帧数上限时长耗时峰值vs ComfyUI int8 当年
1344×768498 帧(515 OOM)20.8s385s30.0G923帧 → 我们是其 54%
1920×1088243 帧(260 OOM)10.1s364s29.7G396帧 → 我们是其 61%
机理:①所有 OOM 都在去噪段(transformer 激活),--decode-evict/--vae-tile 只降解码期显存,对容量完全无效(逐组实测); ②峰值近似线性 peak ≈ 11.2G + 6.2e-4×token,1080p 每帧 token 是 768p 的 2 倍所以帧容量减半; ③768p 15s(362帧)在预算内直接跑 ✓;1080p 15s 单段做不到 ✗(需分段或去噪期分块 offload); ④与 ComfyUI 的容量差距来自它的去噪期分块 offload/smart memory,不是量化位宽——1080p 15s fp8-offload 探针(GPU0)正在验证 offload 能否解锁。
容量样片 · 768p 498帧(20.8s) nvfp4

LoRA 运行时切换(完成)— ComfyUI bypass 的对等物成立

形态:量化纯底模(base_pruned+fp8)+ hotswap 单 adapter 槽 + transformer 常驻。实测:挂 peft adapter 于 torchao 量化层可行(输出正常 turbo 画质); 热切换 0.33-0.4s、零重编译(diffusers enable_lora_hotswap);峰值 28.6-28.9G。两个硬约束:①双 adapter 常驻(set_adapter 0.01s 切换)在 32G 卡 OOM,须 hotswap 单槽; ②量化+peft+compile 后 transformer 不可搬去 CPU(三相/evict 不可用)→ 运行时换 LoRA 就必须常驻。 PSNR 说明:切换版 vs 融合版 11.9dB 看似不等价,但对照组"融合 vs 融合(同权重同 seed 跨进程)"也只有 16dB——管线跨进程本身不可复现(fp8 动态 scale/autotune), 同进程复现上限 36.8dB,逐帧目检两者同语义同画质 → 功能级等价。生产含义:若只上 4step(现状),融合版最简;若要 4/8 步运行时切换,用 hotswap 形态(等 8step 配方调通)。

8step A/B(修复后 vs 生产 8步档)

fox e2enight e2eocean e2e采样(s)
ComfyUI 生产 8步66.2s67.5s64.7s49.4-51.6
原生 8评估(fp8常驻,alpha已修)71.6s149.3s*66.5s~54
*night 的 149s 含该 prompt 首次文本编码(缓存未命中);热态 66-72s vs 生产 65-68s,打平。
fox_snow
生产 8步
原生 8评估(修复后)
night_street
生产 8步
原生 8评估
ocean_cliff
生产 8步
原生 8评估

FLF2V(首+尾帧双图)对比 — 原生首测即通

fox e2enight e2eocean e2e采样(s)
ComfyUI 生产(4步,双图)48.9s48.7s47.8s29.6-30.5
原生 fl2va(4评估,image+last_image)57.4s58.7s55.1s~26+双图VAE编码
原生慢的 ~8s 主要是文本编码未走缓存(FLF 语境禁用);峰值 29.9G。
fox_snow
生产 FLF2V
原生 FLF2V
night_street
生产 FLF2V
原生 FLF2V
ocean_cliff
生产 FLF2V
原生 FLF2V

8step 修复样片 + int8 常驻 + 更多 seed 素材

8step 修复后 · fox(8评估,71.6s)
int8dq 常驻 · fox(45-51s)
nvfp4 · fox(Minimax机,画质评审)
fp8 · fox · seed2222(画质评审)

ref2va 原生化(开题即跑通)

官方 transformer_ref(62G 补下)+ ref2v turbo v0.1 LoRA(alpha=8/128 烙入——8step 同款坑已预防)→ 剪枝 38G(曲线残差 4.259e-05=官方基线同量级)→ fp8+sage+compile+offload。 768×1344×124帧热跑 227s/条(全热理论 ≈178s),denoise 稳态 31.5s/步×4=126s 与当年 ComfyUI 全程 125s 同量级;打包序列 ~80k 行(fl2va 的 2.2 倍),fp8 常驻差 654MB OOM → 显存移植落地后 ref2va 直接受益。样片:换人干净、背景/机位/动作全保留。
ref2va 样片 · 跳舞西装男→牛角巨汉
ref2va 样片 · 滑冰(难case,快速旋转有残留)

已确认的工程事实(累计)

① diffusers steps=N 是 N−1 次评估,对齐 ComfyUI 要 +1;② 剪枝是 32G 单卡装下 fp8/int8 的前提(不剪枝 fp8 OOM); ③ 量化必须配 compile,否则慢 1.6-2×;④ VAE 空间 tiling 是发布默认(两栈都开着,不存在"额外 tiled 代价"); ⑤ LoRA 在量化前融合→无 bypass 问题;lightx2v 文件 key 带内嵌 adapter 名,直载会静默失效(已修); ⑥ fp8 常驻是 5s 档冠军(42.8s),但 15s 档装不下,15s 起 nvfp4 三相/fp8-offload 更合适; ⑦ int8dq 常驻在 124 帧也差 ~1G 装不下(激活量化缓冲比 fp8 胖),正在验证去噪期逐出 VAE 的补救。