原生 diffusers 管线评估 — 实时进度页
📌 当前定型结论(2026-08-17 终审后)
①量化选型:fp8(W8A8)定案 —— 用户终审:fp8=int8=ComfyUI 生产肉眼无差;nvfp4 略糊降级为容量应急档;W4A8(int4权重+int8激活)已测判死:画质干净但 11.1s/评估+峰值30G 被 fp8 双杀(int4-g128 吃不到 Blackwell FP4 核;真 fp4×fp8 需等 torchao 放出 MX 混合精度)。
②三种生产模式全部对齐:T2V(42.8s=生产43s)、I2V(55s vs 52s,首帧还原一致)、FLF2V(57s vs 48s,首测即通)。
③8step 已修复打平(alpha 烙入;热态 66-72s vs 生产 65-68s);LoRA 4/8 运行时热切可行(0.4s 零重编译)。
④15s 打平(fp8-offload 205s / nvfp4 211.9s vs 生产 215.6s);并发零劣化(4实例,~655条5s/小时/机8卡外推)。
⑤剩余主线:显存纪律移植(进行中,目标 1080p 15s + ref2va 余量)。生产形态建议:fp8+compile+常驻,8卡独立管线起步,显存吃紧再演进 DiT/VAE 分卡+独立 Qwen。
各线状态
| 实验线 | 位置 | 状态 | 关键结果 |
| 124帧 基准矩阵(7配置) | viggle 0/1/6/7 | 完成 | fp8常驻 42.8s = 生产 43s;见 主页 |
| I2V First-Frame 对比 | viggle GPU7 | 完成 | e2e 55s vs 生产 52s;首帧还原度两栈几乎相同(~29dB);缩放语义核实一致 |
| 15s(362帧 768p)速度 | viggle GPU0/1 | 完成 | fp8-offload 205s ≈ nvfp4 212s ≈ 生产 215.6s(±5%打平);fp8常驻在362帧下确定性OOM |
| nvfp4 容量探边 | viggle GPU6 | 完成 | 768p 上限 498帧(20.8s);1080p 上限 243帧(10.1s);OOM 全在去噪段,解码补救无效 |
| int8dq 常驻档补测 | viggle GPU1 | 完成·可用 | 45-51s/条,峰值27.6G(需去噪期逐出VAE);略逊 fp8 常驻的 42.8s |
| W4A16(nvfp4权重only) | — | 已取消 | 用户裁定不测(速度必回落 bf16 档,定位鸡肋) |
| 1080p(1920×1088)15s fp8-offload | viggle GPU0 | OOM 判死 | 连 offload 都装不下(去噪激活自身超卡)→ 1080p 15s 单段在 32G 上不可行,需分段或去噪期分块 |
| LoRA 运行时切换(hotswap) | viggle GPU0/1 | 完成·可行 | 热切 0.33-0.4s 零重编译,峰值 28.9G;无需双份权重分池;详见下节 |
| 8step v1.0 LoRA | viggle GPU0 | 已修复·解锁 | 根因=文件 alpha=8/rank=128 元数据被清洗丢弃→16×超强度=噪声;烙入缩放后画面正常,71.6s/条(8评估,fp8常驻) |
| 4实例并发压测(4step fp8常驻) | Minimax_5090 GPU4-7 | 完成 | 并发劣化 0%(43.6s vs 单实例45.0s),吞吐严格4×,8卡外推≈655条5s视频/小时/机;前提=embed缓存/独立文本编码 |
| W4A8(int4+int8) | Minimax GPU4 | 已测·判死 | 11.1s/评估(fp8=6.4)、峰值30.0G(fp8=29.4),画质干净但被 fp8 全面碾压;真fp4×fp8等torchao MX混合精度 |
| 90分钟 soak · fp8常驻档 | viggle GPU0 | 通过·生产就绪 | 45/45 零失败,elapsed/峰值/池/宿主内存四曲线全平直(41.6±1.2s,峰值恒29.2-29.4G)→ 可 24×7;建议上线前补一次 8-24h 长跑终验 |
| soak · 15s offload 档 | viggle GPU7 | 发现严重回归 | 今日「显存移植」agent 重写驱动 offload 分支时引入显存分配器风暴,会拖停全机 GPU(两次受控实验证实;同配置旧版驱动 3/3 通过)→ 已勒令实现 agent 先修复/回滚再继续 1080p 主线 |
| 量化成品序列化 | Minimax GPU5 | 完成 | 18.9G 成品直载,ready 41s→19s;与现场量化 640 张量逐位一致;driver 加 --quantized-ckpt |
| ref2va 原生化开题 | Minimax GPU6/7 | 完成·跑通 | 换人成立:fp8+offload 227s/条@768p124f,峰值24-25.5G;序列~80k行→常驻OOM差654MB=显存移植的直接受益者;denoise 126s与ComfyUI全程同量级 |
| 激活显存剖析 | viggle GPU6 | 完成·突破 | 1080p×362f(15s)合成forward实测PASS@30.08G:patch-pack(位级,−4.4G)+按头分块(位级,−2.9G)+FF分块(量化噪声级);速度零损失;768p上限预估提至~750f |
| 显存移植(树内整合+端到端) | viggle GPU1+多卡 | 进行中 | 主目标已明确:fp8+权重流式+三件套 @1080p 362f(=ComfyUI 机制的直接对标,画质即用户终审过的 fp8 档;fp8 per-row 尺度下 FF 分块天然位级);nvfp4 版仅作参考 |
15s(362帧 1344×768)速度对比 — 三家 ±5% 内打平
| 配置 | 稳态 s/评估 | 采样(s) | VAE解码(s) | 存盘(s) | e2e 均值(s) | 峰值(GiB) |
| ComfyUI 生产(int8+turbo4) | ~36.5 | 144-151 | 36.5-38.5 | ~30 | 215.6 | — |
| 原生 fp8 + group-offload | 36.5-37 | 147-165 | 48-53 | 4-7 | 205.0 | 21.3 |
| 原生 nvfp4 三相(免补救) | ~34(快8%) | 146-169 | 53-54 | 4-5 | 211.9 | 25.0 |
要点:①fp8 常驻模式在 362 帧确定性 OOM(19G 权重+激活>32G;decode-evict/vae-tile 均无效,OOM 在去噪段)——124帧的 42.8s 常驻优势到 15s 档不存在;②生产采样最快但被 ~30s 存盘拖累,原生封装只要 5-7s;③原生管线原有 15.0s 时长上限,已加 --max-duration 放行 362 帧(=15.08s)。
(生产 15s 对照片未回传站点,需要的话可补挂)
I2V(首帧条件)对比 — 语义对齐验证通过
| 栈 | fox_snow e2e | night_street e2e | ocean_cliff e2e | 首帧还原度(PSNR) |
| ComfyUI 生产(4步) | 51.9s | 52.0s | 52.8s | 29.1-29.7 dB |
| 原生 fp8 常驻(4评估) | 56.7s | 55.3s | 54.4s | 28.8-29.3 dB |
两栈首帧还原度差 <0.5dB(都是 VAE 往返+H.264 的有损底)→ 首帧条件语义一致;输入图均为 1344×768(=输出分辨率,符合生产对齐要求),原生 ResizeStep 的缩放行为经代码核实与生产节点逐像素一致。原生差距全在文本编码(此实验禁用了 embedding 缓存)。
容量探边(完成,nvfp4 免补救=加满补救,边界一样)
| 画布 | 帧数上限 | 时长 | 耗时 | 峰值 | vs ComfyUI int8 当年 |
| 1344×768 | 498 帧(515 OOM) | 20.8s | 385s | 30.0G | 923帧 → 我们是其 54% |
| 1920×1088 | 243 帧(260 OOM) | 10.1s | 364s | 29.7G | 396帧 → 我们是其 61% |
机理:①所有 OOM 都在去噪段(transformer 激活),--decode-evict/--vae-tile 只降解码期显存,对容量完全无效(逐组实测);
②峰值近似线性 peak ≈ 11.2G + 6.2e-4×token,1080p 每帧 token 是 768p 的 2 倍所以帧容量减半;
③768p 15s(362帧)在预算内直接跑 ✓;1080p 15s 单段做不到 ✗(需分段或去噪期分块 offload);
④与 ComfyUI 的容量差距来自它的去噪期分块 offload/smart memory,不是量化位宽——1080p 15s fp8-offload 探针(GPU0)正在验证 offload 能否解锁。
容量样片 · 768p 498帧(20.8s) nvfp4
LoRA 运行时切换(完成)— ComfyUI bypass 的对等物成立
形态:量化纯底模(base_pruned+fp8)+ hotswap 单 adapter 槽 + transformer 常驻。实测:挂 peft adapter 于 torchao 量化层可行(输出正常 turbo 画质);
热切换 0.33-0.4s、零重编译(diffusers enable_lora_hotswap);峰值 28.6-28.9G。两个硬约束:①双 adapter 常驻(set_adapter 0.01s 切换)在 32G 卡 OOM,须 hotswap 单槽;
②量化+peft+compile 后 transformer 不可搬去 CPU(三相/evict 不可用)→ 运行时换 LoRA 就必须常驻。
PSNR 说明:切换版 vs 融合版 11.9dB 看似不等价,但对照组"融合 vs 融合(同权重同 seed 跨进程)"也只有 16dB——管线跨进程本身不可复现(fp8 动态 scale/autotune),
同进程复现上限 36.8dB,逐帧目检两者同语义同画质 → 功能级等价。生产含义:若只上 4step(现状),融合版最简;若要 4/8 步运行时切换,用 hotswap 形态(等 8step 配方调通)。
8step A/B(修复后 vs 生产 8步档)
| 栈 | fox e2e | night e2e | ocean e2e | 采样(s) |
| ComfyUI 生产 8步 | 66.2s | 67.5s | 64.7s | 49.4-51.6 |
| 原生 8评估(fp8常驻,alpha已修) | 71.6s | 149.3s* | 66.5s | ~54 |
*night 的 149s 含该 prompt 首次文本编码(缓存未命中);热态 66-72s vs 生产 65-68s,打平。
FLF2V(首+尾帧双图)对比 — 原生首测即通
| 栈 | fox e2e | night e2e | ocean e2e | 采样(s) |
| ComfyUI 生产(4步,双图) | 48.9s | 48.7s | 47.8s | 29.6-30.5 |
| 原生 fl2va(4评估,image+last_image) | 57.4s | 58.7s | 55.1s | ~26+双图VAE编码 |
原生慢的 ~8s 主要是文本编码未走缓存(FLF 语境禁用);峰值 29.9G。
8step 修复样片 + int8 常驻 + 更多 seed 素材
8step 修复后 · fox(8评估,71.6s)
nvfp4 · fox(Minimax机,画质评审)
fp8 · fox · seed2222(画质评审)
ref2va 原生化(开题即跑通)
官方 transformer_ref(62G 补下)+ ref2v turbo v0.1 LoRA(alpha=8/128 烙入——8step 同款坑已预防)→ 剪枝 38G(曲线残差 4.259e-05=官方基线同量级)→ fp8+sage+compile+offload。
768×1344×124帧热跑 227s/条(全热理论 ≈178s),denoise 稳态 31.5s/步×4=126s 与当年 ComfyUI 全程 125s 同量级;打包序列 ~80k 行(fl2va 的 2.2 倍),fp8 常驻差 654MB OOM → 显存移植落地后 ref2va 直接受益。样片:换人干净、背景/机位/动作全保留。
ref2va 样片 · 跳舞西装男→牛角巨汉
ref2va 样片 · 滑冰(难case,快速旋转有残留)
已确认的工程事实(累计)
① diffusers steps=N 是 N−1 次评估,对齐 ComfyUI 要 +1;② 剪枝是 32G 单卡装下 fp8/int8 的前提(不剪枝 fp8 OOM);
③ 量化必须配 compile,否则慢 1.6-2×;④ VAE 空间 tiling 是发布默认(两栈都开着,不存在"额外 tiled 代价");
⑤ LoRA 在量化前融合→无 bypass 问题;lightx2v 文件 key 带内嵌 adapter 名,直载会静默失效(已修);
⑥ fp8 常驻是 5s 档冠军(42.8s),但 15s 档装不下,15s 起 nvfp4 三相/fp8-offload 更合适;
⑦ int8dq 常驻在 124 帧也差 ~1G 装不下(激活量化缓冲比 fp8 胖),正在验证去噪期逐出 VAE 的补救。