模型比較

同一個 prompt · 影片:LTX-2.5 / H3 / Wan · 圖片:FLUX.2 / Qwen / HiDream · 本機 ComfyUI
佇列 —
⚙️ workflow 設定(首次使用:每個模型各設定一次)

最簡單:ComfyUI 開啟該模型的官方 Template(Workflow → Browse Templates)→ 按一次 Run → 回到這裡按下方 🎯 從 ComfyUI 擷取,即可自動抓取並辨識模型(會順手中斷該次生成)。 每個模型(LTX-2.5 / Wan 2.2 / MiniMax H3)各做一次。

或用檔案:ComfyUI 開啟 Enable Dev modeSave (API Format) 匯出 JSON,拖到下方卡片。

描述你想生成的畫面。建議包含:主體(人物/物體)、動作場景光線風格。英文效果較佳。點 🎲 Random 可自動組合豐富的提示詞。
相同 Seed + Prompt = 相同結果,方便跨模型公平比較
📋 模型規格與使用說明

LTX-2.5 影片

參數量22B
精度FP8
VRAM 用量~22 GB
HD 速度~144s / 5s 影片
優化FP8 權重
授權Apache 2.0

MiniMax H3 影片

參數量~20B
精度NVFP4 混合
VRAM 用量~19 GB
HD 速度~298s / 5s 影片
優化NVFP4 + Sol-Attn + FBC + TeaCache
授權MiniMax 開放
⚠️ 2K 以上解析度不建議 — Sol-Attn 在高 token 數下可能產生網格偽影,全量 attention 則 OOM。

Wan 2.2 影片

參數量14B
精度FP8
VRAM 用量~14 GB
HD 速度待測
優化FP8 權重
授權Apache 2.0

FLUX.2 Dev 圖片

參數量32B
精度NVFP4 混合
VRAM 用量~23 GB
步數10
文字編碼器Mistral 3 Small
最大解析度4MP (2048×2048)
授權Apache 2.0

Qwen-Image 2512 圖片

參數量20B
精度FP8
VRAM 用量~20 GB
步數30 (CFG=1)
文字編碼器Qwen2.5-VL 7B
最佳解析度1024² ~ 1664×928
授權Apache 2.0

HiDream-I1 Dev 圖片

參數量17B
精度FP8
VRAM 用量~16 GB
步數20 (LCM, CFG=1)
文字編碼器CLIP×2 + T5 + LLaMA 8B
訓練解析度1024×1024
授權MIT

📐 解析度建議

  • 影片:HD (1376×768) 為最佳性價比;FHD (1920×1080) 品質更好但耗時加倍;2K 僅建議 LTX 使用
  • 圖片:1024×1024 為通用安全值;FLUX.2 支援最高 2048×2048;Qwen 最佳比例為 1328×1328 或 1664×928

💡 使用技巧

  • 首次使用需先在上方「workflow 設定」匯入各模型的 ComfyUI workflow
  • 🎲 Random 會自動生成含角色、場景、光線、攝影風格的豐富提示詞
  • 同一個 Seed + 相同 Prompt 可在不同模型間做公平比較
  • 點擊生成的圖片可在新分頁開啟原圖檢視
  • 輸出右下角顯示生成耗時與當前 VRAM 使用量
  • 一次只跑一個模型可降低記憶體壓力,避免 OOM

🖥️ 硬體環境

  • GPU:NVIDIA GB10 (Blackwell) — 128GB 統一記憶體
  • CUDA:13.0 · Driver 580.173
  • ComfyUI:最新版 + ComfyUI-Manager · 綁定 localhost:8188
  • 量化格式:NVFP4(Blackwell 原生)· FP8 · INT8 按模型選用