Auto-formation · Image génération

Z-Image Turbo
dans ComfyUI

Lumina2 DiT + Qwen3 + Flux1 VAE Niveau avancé — pipeline VFX 6 phases · Auto-rythmé Sources : Banodoco Hivemind, communauté ZIT (juin 2026)

"While I prefer ZImage for pure T2I, it's better than Qwen Edit in most ways. Just the VAE advantage is pretty big."

— Lumifel, #z-image, 2026-06-21
Phase 1
01 Comprendre Z-Image Turbo 30 min · lecture
1
Ce qu'est Z-Image Turbo
Z-Image Turbo (abrégé ZIT par la communauté) est un modèle de génération d'image text-to-image open source développé par Tongyi / Alibaba. C'est le modèle T2I le mieux coté par la communauté open source depuis sa sortie début 2026, avant que Alibaba ne pivote vers une offre full-service fermée.

Il a été salué comme "le meilleur release depuis ZImage" — formule qui revient à chaque nouveau modèle de référence chez Banodoco, preuve de son statut de référence.
Alibaba a depuis fermé ses modèles. Z-Image-Edit et Z-Image-Omni avaient été annoncés officiellement sur leur page de release ("We are publicly releasing two specialized models…") — ils n'ont jamais été livrés. Ne les attendez pas. Les poids actuels sont définitifs.
2
Architecture : trois composants
ZIT repose sur une architecture Lumina2 DiT (Diffusion Transformer) avec deux pièces distinctes chargées séparément dans ComfyUI :
Lumina2 DiT
(PixelDiTTE)
Le diffusion transformer — lit le bruit, prédit le débruitage. C'est le cerveau du modèle. ~5 GB VRAM
Qwen3 Text Encoder
(ZImageTEModel)
Encode le prompt texte. Basé sur Qwen3 — d'où la réponse supérieure aux prompts structurés JSON/Markdown. ~2.8 GB VRAM
Flux1 VAE
(ae.safetensors)
Encode/décode le latent. ZIT réutilise le VAE de Flux1 — avantage reconnu sur tous les modèles concurrents. ~160 MB VRAM
💡
Si vous utilisez déjà Flux1, vous avez déjà le VAE. Vous pouvez le réutiliser sans re-télécharger.
3
Les variantes du modèle
La communauté distingue plusieurs variantes — comprendre lesquelles utiliser évite les confusions :
Z-Image Baserecommandé training Modèle non-distillé. Paramètres idéaux : Euler Beta, 30 étapes, CFG 2.0. Meilleur pour entraîner des LoRAs (base plus stable).
Z-Image Turbo (ZIT)production Version distillée. 9–15 étapes, sampler res2s ou RES_2S. Rapide, résultats excellents. Variante BF16 préférable à mxfp8 pour la qualité.
Z-Image-L2Pexpérimental Fine-tune intégrant la recherche L2P (Layout-to-Plan, NJU-PCAlabs). Euler Beta, 30 étapes, CFG 2.0. Version INT8 disponible sur Civitai. Rendu parfois smeary selon les utilisateurs.
Z-Image-Editjamais sorti Annoncé par Alibaba pour l'édition d'images. Vraisemblablement abandonné (inférieur à Klein selon spéculations) — ne l'attendez pas.
4
Points forts — et ce qu'il fait moins bien
Connaître les forces réelles permet de positionner ZIT dans un pipeline VFX plutôt que de l'utiliser comme outil générique.
Points forts
  • Portraiture & anatomie humaine — naturellement supérieur à Flux1 et Ideogram sur les personnages
  • Textiles & textures fines — haute fréquence spatiale, lace, tissu, peau
  • Esthétique cinéma — éclairage naturel, ambiance cohérente
  • VAE Flux1 — rendu couleur supérieur
  • T2I pur — meilleur modèle open source de sa génération
Limitations
  • Aucun outil d'édition natif (Z-Image-Edit non sorti)
  • Quotes dans le prompt (' ou ") peuvent déclencher du texte dans l'image sur certains seeds
  • Composition verrouillée dès les 2 premiers steps sur les modèles distillés
  • ControlNet fonctionne mais charge lourdement le GPU (3D + CUDA simultanés)
  • Communauté en déclin — canal actif mais moins dynamique qu'en 2025
Phase 2
02 Setup ComfyUI — Modèles & organisation 45 min · pratique
1
Télécharger les composants depuis Comfy-Org Hub
La source officielle la plus simple est le hub Comfy-Org sur HuggingFace. Les fichiers sont pré-découpés en split_files/ pour faciliter la gestion :
# Hugging Face — dépôt officiel Comfy-Org Diffusion modelComfy-Org/z_image_turbo # Choisir BF16 si ≥ 16 GB VRAM disponible # Choisir mxfp8 si VRAM limitée (perte de qualité légère) Text encoderComfy-Org/z_image_turbo/split_files/text_encoders/ # qwen3_4b.safetensors (pleine précision) # ou qwen3_4b_q4_gguf.gguf (version quantisée, ±2 GB VRAM) VAEComfy-Org/z_image_turbo/split_files/vae/ae.safetensors # Si déjà présent depuis Flux1 : même fichier, inutile de re-télécharger
Si le décodage VAE prend 5+ minutes : re-téléchargez ae.safetensors — le fichier peut être corrompu lors du téléchargement initial.
2
Organisation des dossiers ComfyUI
Placer chaque composant dans le bon sous-dossier de ComfyUI — le type de loader en dépend :
# Structure cible dans ComfyUI/models/ diffusion_models/ z_image_turbo_bf16.safetensors # ou mxfp8 text_encoders/ qwen3_4b.safetensors # TE principal vae/ ae.safetensors # Flux1 VAE (partagé) loras/ [vos LoRAs ZIT ici]
3
Sage Attention — accélération obligatoire
Sage Attention réduit significativement le temps de génération sur les architectures Transformer. C'est le premier réglage à activer sur ZIT.

Installez via ComfyUI Manager ou manuellement, puis vérifiez dans les logs ComfyUI que sage_attn est détecté au démarrage.
💡
Résultat mesuré par la communauté : avec Sage Attention activé sur un RTX 3060 12GB, ZIT → PID 4K s'exécute en 27 secondes au lieu de 60–120s.
4
Quantization INT8 — option VRAM réduite
Si votre VRAM est limitée (8–12 GB), la quantization INT8 via ComfyUI-INT8_ConvRot permet de faire tourner ZIT sans décharger les modèles. Remplacez simplement le loader de modèle dans votre workflow existant.
Résultats mesurés sur RTX 3060 12 GB : 9 étapes en 14 secondes avec le loader INT8. La qualité reste bonne mais légèrement en-deçà du BF16 natif.
Phase 3
03 Premier workflow T2I — paramètres & prompting 1h · pratique
1
Structure du workflow de base
ZIT s'intègre dans ComfyUI comme n'importe quel modèle DiT. Le workflow minimal :
Load Diffusion Model Load TE (Qwen3) Load VAE CLIP Text Encode KSampler VAE Decode Save Image
Kijai a partagé un workflow ZIT de base dans le canal #z-image de Banodoco. Il sert de point de départ pour la communauté — cherchez "Kijai wf" dans les archives.
2
Paramètres recommandés par la communauté
Deux configurations dominantes selon le modèle utilisé :
Paramètre Z-Image Turbo (ZIT) Z-Image Base / L2P
Steps 9–15 (10–12 typique) 30
Sampler res2s (custom sampler) Euler Beta
CFG non applicable (distillé) 2.0
Résolution 768×1024 ou 896×1152 Idem
Précision BF16 (mxfp8 si VRAM critique) BF16
Résolution et multiple de 16 : toutes les résolutions doivent être divisibles par 16. Une largeur de 1365 px provoque un blur concentré sur le bord droit lors de l'upscale PID. Utilisez 1344, pas 1365.
3
Prompting structuré — la découverte clé de la communauté
L'encodeur Qwen3 est nativement entraîné sur du contenu structuré (code, JSON, Markdown). La communauté a découvert que les prompts structurés donnent une composition significativement meilleure que le texte libre.

Deux formats fonctionnent :
FORMAT JSON (recommandé)
{ "render_type": "A high-fidelity cinematic photograph.", "subject": "A female VFX artist, mid-30s.", "face": "Focused expression, minimal makeup, natural skin texture.", "hair": "Dark hair pulled back, a few loose strands.", "outfit": "Dark linen jacket over a white shirt.", "environment": "Industrial studio, concrete walls, blue hour light.", "lighting": "Soft directional key light from the left, deep shadows.", "mood_and_style": "Cinematic, editorial, high-contrast." }
FORMAT CLÉS-VALEURS (alternative)
render_type: A high-fidelity cinematic photograph., subject: A female VFX artist, mid-30s., face: Focused expression, minimal makeup., environment: Industrial studio, concrete walls, blue hour light., lighting: Soft directional key light, deep shadows., mood_and_style: Cinematic, editorial.
💡
Évitez les quotes (' ou ") dans les valeurs — sur certains seeds, elles déclenchent du texte visible dans l'image. Utilisez des virgules simples pour séparer.
Sur les modèles distillés (ZIT) : la composition est verrouillée dès les 2 premiers steps. Un prompt incomplet ou mal structuré ne peut pas être rattrapé par les étapes suivantes. Soignez le prompt avant de lancer.
4
Image to Image (I2I) — pipeline de raffinage
ZIT excelle en raffineur pour les sorties d'autres modèles. La technique clé pour l'I2I :
Technique "caption grounding" : pour l'I2I, générez d'abord une caption complète de votre image de référence (via LLM ou vision model), et utilisez-la comme prompt. Le modèle "sait" que tout ce qui est dans le prompt est déjà dans l'image — il n'invente rien de nouveau, il reproduit fidèlement. C'est la méthode recommandée par shotgun messiah (power user ZIT).
Paramètre de denoise recommandé pour I2I : 0.13 (raffinage subtil) à 0.3 (changements visibles).
Phase 4
04 Maîtrise des LoRAs — stack, merge, entraînement 1h30 · pratique
1
Multi-LoRA : oui, avec précautions
Une idée reçue circule (surtout des utilisateurs absents quelques mois) : "ZIT n'accepte qu'une seule LoRA". C'est dépassé. La communauté empile régulièrement 5 à 8 LoRAs sans problème.

La logique derrière la limite initiale : chaque LoRA ajoute son propre bruit. Empiler deux LoRAs double le bruit — mais ZIT gère bien cela, et il existe des techniques pour le réduire.
💡
Équilibrez les poids — ne mettez pas toutes les LoRAs à 1.0. Commencez à 0.7–0.8 et ajustez. Si une LoRA domine, baissez-la plutôt que de baisser les autres.
2
LoRA Optimizer — outil communautaire de référence
Lumifel (power user actif dans #z-image) a développé un node ComfyUI qui automatise la normalisation et le merge de LoRAs. C'est l'outil le plus utilisé dans la communauté pour gérer plusieurs LoRAs sans bruit excessif.
GitHub : github.com/ethanfel/ComfyUI-LoRA-Optimizer — version 1.7+ disponible (plusieurs fois plus rapide que les versions initiales, beaucoup moins gourmand en mémoire).
Usage : définissez toutes vos LoRAs à strength 1.0 dans le node, et laissez l'optimizer normaliser automatiquement. Vous pouvez ensuite ajuster individuellement.
3
Répartition des LoRAs entre Ksamplers
Technique avancée pour réduire les conflits entre LoRAs : certaines LoRAs ciblent les blocks early (composition, structure) et d'autres les blocks tardifs (couleur, texture). En les séparant sur deux KSamplers en séquence :
KSampler 1 (steps 1→6)
  • LoRAs de structure / pose
  • Blocks early du DiT
  • Forment la composition
KSampler 2 (steps 7→15)
  • LoRAs de style / texture
  • Blocks tardifs du DiT
  • Raffinent les détails
💡
Utilisez le realtime LoRA node pour désactiver/activer des blocks à la volée et identifier quels blocks chaque LoRA utilise réellement — puis désactivez les blocks non nécessaires.
4
LoRA en valeur négative — effet inverse
Une LoRA peut être appliquée en poids négatif pour obtenir l'effet inverse de son intention de training. Exemple mesuré : la LoRA "Dark Atmospheric" à -1.25 produit des chromatics chauds et une ambiance lumineuse. À +0.8, l'effet attendu est sombre.

Plages typiques pour l'inversion : -0.75 (subtil) à -1.25 (marqué). Au-delà, des artefacts "crustés" apparaissent.
5
Fine-tunes communautaires recommandés
Les fine-tunes les plus utilisés en juin 2026, selon les benchmarks informels du canal :
MoodyProMixZitV12DPOrecommandé Meilleur pour l'adhérence au prompt selon les tests communautaires (gagne sur Long Hair + détails). Version "newest V12" préférée par patientx.
MoodyRealMixZitV6R1DPO Rendu réaliste, skin tone naturel. Bonne option pour la photoréalisme portrait.
MoodyProMixZitV7 Version antérieure, bon équilibre — à essayer si V12 est trop saturé.
Juggernaut-Z-Image-Fast
RunDiffusion/HuggingFace
Fine-tune de RunDiffusion. ~1 min/image sur 4090 à défaut, ~45s en fp8 (légère perte qualité). Optimisé pour la vitesse.
Z-Image-Fun-Distill (UDCAI)
UDCAI/HuggingFace
LoRA de distillation 8 étapes pour le modèle base — permet d'utiliser ZImage Base à vitesse turbo. Safetensors ComfyUI direct.
6
Entraîner sa propre LoRA
Points clés issus des échanges communautaires dans #z-image et #training :
Base ou Turbo pour l'entraînement ?
  • Les deux fonctionnent — entraîner directement sur Turbo est possible
  • La base est plus stable (pas de distillation noise)
  • Les LoRAs entraînées sur la base fonctionnent généralement sur Turbo
  • Le sampler d'entraînement influence la compatibilité
Captioning — règle d'or ZIT
  • Captionner exhaustivement la pose, mais pas l'apparence du corps si c'est ce qu'on enseigne
  • Plus le reste de l'image est bien décrit, mieux le modèle apprend ce qui est omis
  • Résolution dataset : 1024px recommandé
  • LoRA à strength 2.0 sur base = normal si sous-entraîné
Phase 5
05 Pipeline d'upscale 4K avec PID (PixelDiT) 1h · pratique
1
PID — la pièce manquante du pipeline ZIT
PID (PixelDiT, par Nvidia) est un modèle de super-résolution qui opère directement dans l'espace pixel — contrairement à la plupart des upscalers qui travaillent en latent. Il produit une image 4K en un seul passage depuis une entrée 768x1024.

Kijai a confirmé que ZIT et Flux1 fonctionnent particulièrement bien avec PID, et a partagé le premier workflow ZIT→PID de référence dans #z-image.
ZIT génération 768×1024 ou 896×1152 PID upscale 4K output 27s total (3060 + Sage)
2
Télécharger les modèles PID
PID utilise le VAE de Flux1 (même fichier que ZIT) — pas de latent channel mismatch si vous venez de ZIT. Attention : ZIT + Flux2 PID est incompatible (latent 16 vs 128).
pid_flux1_1024_to_4096
_4step_bf16.safetensors
Version principale. Qualité maximale. Source : Comfy-Org/PixelDiT sur HuggingFace. ~1.3 GB VRAM
pid_flux1_1024_to_4096
_4step_mxfp8
Version quantisée. Plus rapide, légère perte de qualité. Utilisez INT8 si mxfp8 trop agressif. ~0.7 GB VRAM
PID est encore en draft PR dans ComfyUI. Installation via : git fetch origin pull/14103/head:pr-14103 puis checkout. Suivez les instructions de mise à jour ComfyUI pour l'aligner avec ce PR.
3
Paramètres PID — réglages fins de la communauté
Les paramètres optimaux ont été affinés par mdkb sur plusieurs sessions de test en I2I :
Paramètre PIDValeur recommandéeNote
degrade_sigma 0.1 Default 0.35 — baisser améliore la cohérence du visage en I2I
sigma first step (manual) 0.97 Default 0.99 — réduire équilibre le crispening avec le "feel" ZIT
skip last sigma activé Recommandé par Kijai — meilleur output zimage
Steps PID 4 Modèle 4-step — ne pas augmenter
Sampler PID lcm lcm > euler > euler ancestral > er_sde pour la netteté
Résolution : PID est sensible aux résolutions non divisibles par 16. Une largeur de 1365 px provoque un blur sur le bord droit. Utilisez toujours des multiples de 16 (1344, 1360, 1376…). Portrait 768×1024 fonctionne parfaitement.
4
Workflow complet ZIT + PID (I2I)
Pipeline de référence pour upscaler une image ZIT existante en 4K via I2I :
Image source ZIT I2I Sampler (9 steps) VAE Encode PID Sampler (4 steps, lcm) PixelspaceConversion VAE 4K Output
Temps total mesuré : 14s ZIT (9 steps, INT8, 3060) + 38s PID = 52s au total. Avec BF16 + Sage Attention : ~27s pour PID seul depuis une image déjà générée.
Phase 6
06 Intégration pipeline VFX — usages professionnels 1h · réflexion + pratique
1
ZIT comme raffineur d'autres modèles
Le cas d'usage le plus adopté par les utilisateurs avancés : ne pas générer avec ZIT en T2I direct, mais l'utiliser comme étape de raffinage sur les sorties d'autres générateurs — Hi-Dream, Qwen Image, Ideogram, et même des frames LTX.
"Like Qwen [Image], a slight ZImage pass will sharpen everything" — Lumifel, #nsfw, 2026-06-23. Denoise faible (0.13–0.2) pour raffiner sans reconstruire.
Qwen Image / Hi-Dream ZIT I2I (denoise 0.13) Résultat affiné PID 4K
2
Pipeline texture / concept art pour VFX
ZIT est particulièrement fort pour générer des textures procédurales et des éléments de concept art destinés à être retravaillés. Le workflow recommandé pour un contexte ArtFX :
Génération d'assets textures
  • Générer en 768×1024 ou 1024×1024 avec LoRA texture
  • PID pour upscale 4K (détails haute fréquence préservés)
  • Export en EXR ou PNG 16bit via Save Image node
  • Intégration dans Mari, Substance, ou Clarisse
Concept art / moodboard
  • Prompt JSON pour contrôler composition et ambiance précisément
  • Plusieurs seeds pour variations de même brief
  • ZIT + LoRA style comme "direction artistique"
  • Refiner Qwen Image pour versions éditées
3
ControlNet pour la composition guidée
ControlNet fonctionne avec ZIT mais charge lourdement le GPU — le segment 3D et CUDA tournent simultanément à ~100%. Recommandations :
💡
FlashAttention peut aider à réduire la charge GPU lors de l'utilisation de ControlNet avec ZIT. À activer avant de lancer un workflow ControlNet lourd.
Cas d'usage VFX valides : générer des personnages dans une pose spécifique via OpenPose, ou guider la composition via depth map. Pas de ControlNet pour la cohérence personnage — utilisez LoRA à la place.
4
ZIT dans un pipeline vidéo LTX
La combinaison ZIT + LTX est utilisée activement par plusieurs members de Banodoco pour des productions courtes. Les deux rôles possibles :
ZIT → LTX (I2V)
  • Générer le keyframe de départ avec ZIT (haute qualité)
  • Passer en I2V dans LTX 2.3
  • ZIT donne une meilleure image de départ que LTX natif T2I
  • Résolution : générer en 768×512 ou 896×512 pour LTX
LTX → ZIT (frame refiner)
  • Exporter frames depuis LTX
  • Passer chaque frame dans ZIT I2I (denoise 0.1–0.15)
  • Améliore la netteté et le rendu peau
  • Re-encoder pour la vidéo finale
devnullblackcat (Banodoco) publie régulièrement des productions combinant LTX + ZIT + Qwen Image Edit. Bonne source d'inspiration pour les pipelines complexes.
5
Ressources et liens clés
Récapitulatif de toutes les ressources mentionnées dans ce guide :
Modèles officiels huggingface.co/Comfy-Org/z_image_turbo — hub principal, split files BF16 / mxfp8
LoRA Optimizer (Lumifel) github.com/ethanfel/ComfyUI-LoRA-Optimizer — gestion et merge de LoRAs
PID (PixelDiT, Nvidia) huggingface.co/nvidia/PiD — super-résolution pixel-space 1-pass
Modèles PID Flux1 (Comfy-Org) huggingface.co/Comfy-Org/PixelDiT — pid_flux1_1024_to_4096_4step_bf16.safetensors
INT8 ConvRot (ComfyUI) huggingface.co/bertbobson/ComfyUI-INT8_ConvRot — quantization INT8 pour VRAM réduite
Juggernaut-Z-Image-Fast huggingface.co/RunDiffusion/Juggernaut-Z-Image-Fast — fine-tune RunDiffusion optimisé vitesse
Z-Image-Fun-Distill (UDCAI) huggingface.co/UDCAI/Z-Image-Fun-Distill-ComfyUI — LoRA distill 8-steps pour base
Z-Image-L2P INT8 (tsolful) huggingface.co/tsolful/Z-Image-L2P-INT8 — fine-tune L2P quantisé