AutoFormation ComfyUI

Vidéo IA
WAN & VACE

WAN 2.1 · WAN 2.2 · VACE · SCAIL-2 · Bernini RTX 5090 · 6 phases · Comprendre, pas juste faire fonctionner Sources : corpus Banodoco · Kijai · Ablejones · 2026

WAN (Wan Video) est la famille de modèles vidéo ouverts la plus utilisée de la communauté. Contrairement à LTX, c'est un écosystème modulaire : un socle (2.1 ou 2.2) sur lequel se branchent des modules spécialisés — VACE pour le masking, SCAIL-2 pour le pose transfer, Bernini pour l'édition.

— Plan de formation — RTX 5090 optimisé
Panorama de l'écosystème

Avant de commencer, voici la carte mentale de WAN. Chaque "module" ci-dessous fait l'objet d'une phase dédiée.

Modèle / Outil Rôle Basé sur Cas d'usage
WAN 2.1 T2V 14B Texte → Vidéo WAN 2.1 T2V général, base de tout l'écosystème. Toujours recommandé par Kijai.
WAN 2.2 I2V A14B Image → Vidéo WAN 2.2 Animer une image fixe. Version animé 14B, plus expressif.
WAN 2.2 5B T2V / I2V léger WAN 2.2 720p natif, tokenizer différent (taew2.2). Plus rapide, moins expressif.
LightX2V LoRA Accélération WAN 2.1 ou 2.2 4 steps au lieu de 20+. Attention : pas de scènes sombres (biais training).
VACE Inpainting vidéo WAN 2.1 Édition masquée : remplacer une zone, modifier un personnage, stitching long.
WanAnimate Long vidéo WAN 2.2 Extension temporelle par glissement de fenêtre. Plus rapide que context windows.
SCAIL-2 Pose transfer WAN 2.1 14B Squelette/pose video → animer un personnage. Motion rivaling Kling (NativeLooping).
Bernini Édition vidéo WAN 2.2 finetune Édition par instruction (≠ masque). Meilleur I2V que WAN 2.2 base selon Kijai.
ONE-SHOT-14B Multi-ref character WAN 2.1 T2V + VACE Cohérence de personnage multi-angles. Branche VACE + cross-attention mesh 3D.
Nœud ComfyUI central : tout passe par ComfyUI-WanVideoWrapper (Kijai). C'est l'équivalent du ComfyUI-LTXVideo pour LTX — un wrapper unifié qui gère tous les modes ci-dessus.
Plan de formation — 6 phases
Phase 0 Installation & premier rendu Prérequis : ComfyUI déjà installé
Si tu as déjà fait la Phase 0 du guide LTX, ComfyUI portable est en place et comfy-kitchen/comfy-aimdo sont à jour. Tu peux sauter à l'étape 2.
1
Installer ComfyUI portable (si pas encore fait)
Télécharge la version Windows portable depuis github.com/comfyanonymous/ComfyUI/releases. Extrais dans un chemin sans espace ni accent (ex. C:\ComfyUI). Lance run_nvidia_gpu.bat.
Même installation que pour LTX — les deux modèles cohabitent dans le même ComfyUI. Les fichiers WAN vont dans ComfyUI\models\diffusion_models\, les text encoders dans ComfyUI\models\text_encoders\.
2
Mettre à jour comfy-kitchen et comfy-aimdo
Dans le terminal, depuis le dossier ComfyUI :
$ python_embeded\python.exe -m pip install --upgrade comfy-kitchen comfy-aimdo
# Attendu :
Successfully installed comfy-kitchen-0.2.10 comfy-aimdo-0.4.9
comfy-kitchen < 0.2.9 divise la vitesse des LoRAs par 2 (bug confirmé communauté, juin 2026). comfy-aimdo active DynamicVRAM pour la RTX 5090 (Blackwell). Ces deux packages s'appliquent aussi bien à LTX qu'à WAN.
3
Installer ComfyUI-WanVideoWrapper
Via ComfyUI Manager → Install Custom Nodes → chercher "WanVideoWrapper". Ou manuellement via le lien git : github.com/kijai/ComfyUI-WanVideoWrapper
C'est le nœud central de Kijai qui permet d'utiliser tous les modes WAN (T2V, I2V, VACE, SCAIL-2, Bernini) depuis ComfyUI. Un seul nœud pour tout l'écosystème.
4
Télécharger les modèles de base
Pour commencer, tu as besoin du modèle principal + le text encoder T5. Place-les dans les bons dossiers :
# Modèle principal WAN 2.1 T2V (recommandé pour débuter)
Dossier : ComfyUI\models\diffusion_models\
wan2.1_t2v_14B_bf16.safetensors
# Text encoder (partagé avec LTX si déjà installé)
Dossier : ComfyUI\models\text_encoders\
umt5-xxl-enc-bf16.safetensors
# VAE WAN (partagé entre 2.1 et 2.2)
Dossier : ComfyUI\models\vae\
wan_2.1_vae.safetensors
Tout est sur HuggingFace : Comfy-Org/Wan_2.1_ComfyUI_repackaged — repackagé par la communauté, nommage cohérent avec ComfyUI.
5
Lancer et vérifier
Lance ComfyUI sans flags spéciaux. Le terminal doit afficher :
DynamicVRAM support detected and enabled
# Si tu vois ça → comfy-aimdo fonctionne, la 5090 gère le VRAM automatiquement
Checklist avant de passer à la phase 1
ComfyUI démarre sans erreur
Le nœud WanVideoWrapper apparaît dans la liste des nœuds
"DynamicVRAM support detected and enabled" visible dans le terminal
Le fichier wan2.1_t2v_14B_bf16.safetensors est dans diffusion_models/
Ne pas utiliser --lowvram ni --use-sage-attention sur une RTX 5090 — ces flags sont contre-productifs avec DynamicVRAM et peuvent ralentir les générations.
Phase 1 Architecture WAN — comprendre 2.1 vs 2.2 Théorie + premier T2V

Avant de lancer quoi que ce soit, comprendre pourquoi il existe deux versions (et pourquoi 2.1 reste souvent préféré) évite de nombreuses confusions.

WAN 2.1
14B params
T2V + I2V. Base de VACE, SCAIL-2, ONE-SHOT. Kijai : "fonctionne mieux malgré les nouvelles versions".
WAN 2.2
14B + 5B
Meilleure cohérence de mouvement. Le 5B natif 720p, tokenizer taew2.2 différent. CLIP vision inutile sur 2.2.
Résolution
÷16 requis
Largeur et hauteur multiples de 16. 720p = 1280×720 ✓. 14B optimisé autour de 720p / 480p.
Frames
libres
Pas de contrainte 8n+1 comme LTX. En pratique : 81 frames = sweet spot (seuil de dérive contextuelle).
  • T2V (Text-to-Video) : le mode de base. Pas d'image d'entrée — le modèle génère tout depuis le prompt. Idéal pour explorer le style et le mouvement du modèle.
  • I2V (Image-to-Video) : tu fournis une image de départ et WAN l'anime. WAN 2.2 I2V A14B est spécialisé pour ça. Très utilisé pour animer des illustrations ou concept arts.
  • Qu'est-ce que "A14B" ? Le suffixe A signifie "Animé/Anime" — entraîné avec un dataset orienté animation, pas seulement vidéo réaliste. Résultats plus stylisés.
  • LightX2V LoRA : accélérateur universel — passe de ~20 steps à 4 steps. Compatible WAN 2.1 et 2.2. Kijai préfère encore la version 2.1 même sur les modèles 2.2. Attention : le LoRA ne peut pas produire de scènes sombres (filtré du training set par erreur).
  • CLIP vision : ne fait rien sur WAN 2.2. Si tu vois des workflows qui l'utilisent avec 2.2, c'est un vestige de 2.1 — ne pas connecter.
Exercice Phase 1 : génère un T2V simple avec WAN 2.1 14B, ~81 frames, 480×832. Teste avec et sans LightX2V LoRA pour mesurer la différence de vitesse et de qualité. Si une scène sombre te donne un résultat trop lumineux, c'est normal — c'est la limitation LightX2V.
Phase 2 Workflows de base — T2V, I2V, long vidéo Pratique guidée
  • Workflow T2V minimal : dans WanVideoWrapper, sélectionne le modèle 2.1 14B, connecte le text encoder umt5-xxl, le VAE, et un sampler basique. 20 steps, CFG 6.0 pour commencer.
  • Workflow I2V : change le mode sur "I2V" dans WanVideoWrapper, connecte ton image de référence via le nœud LoadImage. Le modèle utilise l'image comme frame 0. Avec WAN 2.2 I2V A14B, le résultat est meilleur qu'avec 2.1 sur les images d'illustration.
  • Prompting WAN : plus verbeux que SD — décris le mouvement explicitement ("slowly turning head", "camera dolly left"). WAN répond bien aux instructions de mouvement caméra.
  • WanAnimate (extension temporelle) : pour dépasser ~81 frames sans context windows. Chaque fenêtre démarre là où la précédente s'est arrêtée. Plus rapide que les context windows mais la cohérence se dégrade progressivement sur très long.
  • Context windows : tiling temporel — découpe la génération en fenêtres qui se chevauchent. 50% plus lent qu'une extension classique (test Ablejones : 346s vs 226s pour 281 frames), mais maintient la cohérence sur des vidéos longues. Gère mal le mouvement caméra.
  • NativeLooping (Kijai) : ComfyUI-NativeLooping_testing — crée des boucles vidéo seamless internes au modèle. La communauté a obtenu des résultats "rivalisant avec Kling" avec SCAIL-2 + NativeLooping.
Règle de base : si tu fais <161 frames → extension/WanAnimate. Si tu veux maintenir la cohérence sur >161 frames → context windows (accepte le coût en temps). Si tu veux une boucle seamless → NativeLooping.
Wan 2.2 est plus sensible aux frame indices. Si tu passes d'un workflow 2.1 à 2.2, vérifie les paramètres de frame start/end — les deux modèles ne les interprètent pas de la même façon.
Phase 3 VACE — inpainting & masking vidéo Module essentiel pour l'édition

VACE est un module spécialisé de WAN 2.1 entraîné à comprendre les masques. Contrairement à Bernini (qui suit des instructions texte), VACE opère via des masques spatiaux — tu dessines la zone à modifier et VACE régénère seulement cette zone en cohérence avec le reste.

  • Cas d'usage VACE : remplacer un personnage dans une vidéo, modifier un vêtement, supprimer un élément, stitcher plusieurs générations pour une vidéo longue.
  • VACE vs Bernini : VACE = masque spatial précis, contrôle pixel. Bernini = instruction ("rends cette vidéo lego"), contrôle éditorial. Pour modifier une zone précise → VACE. Pour changer le style global → Bernini.
  • WanVaceAdvanced (drozbay) : github.com/drozbay/ComfyUI-WanVaceAdvanced — nœuds avancés spécialisés VACE avec gestion context windows intégrée. Recommandé pour les workflows complexes.
  • VACE + context windows : la combinaison standard pour la vidéo longue. Le champ cond_retain_index_list (voir ci-dessous) est particulièrement important ici.
Piège critique — cond_retain_index_list :
Ce champ prend des indices latents, pas des numéros de frames. Le latent 0 = ton image d'entrée, le latent 1 ≈ frame 4, le latent 2 ≈ frame 8, etc. (divise le numéro de frame par 4 pour obtenir l'indice latent). Le maximum est environ 16, pas 81.

Erreur commune : entrer "0,81" en pensant utiliser la première et la dernière frame. En réalité 81 est hors plage → erreur obscure dans la console. La bonne valeur pour "dernière frame d'une génération 81 frames" serait environ "0,16" (voire "0,20" — expérimente).
Exercice Phase 3 : prend une vidéo existante (ou génère-en une avec WAN T2V), masque un élément au centre, et laisse VACE le régénérer avec un prompt différent. Compare la cohérence de la bordure masque/contexte avec différentes tailles de masque.
Phase 4 SCAIL-2 — pose transfer & animation de personnage Squelette → Personnage

SCAIL-2 est un module entraîné sur WAN 2.1 14B qui transfère une pose/squelette vidéo sur un personnage cible. Tu fournis une "pose video" (squelette OpenPose ou similaire) et une image de référence du personnage — SCAIL-2 génère le personnage qui effectue ce mouvement.

Résolution optimale
468 × 832
Fonctionne correctement à cette résolution. Se casse à 576×1024 — le fond disparaît en replacement mode.
Frames max fiables
81 frames
Au-delà, le mouvement dérive significativement du driver. Pour le compositing, rester à 81 frames max.
Coût vs WAN 2.2
1.5×
Embed la pose video dans la séquence (pose demi-résolution). Bernini fait pareil mais pleine résolution = 2×.
Modèle RTX 5090
nvfp4-mxfp8
Mix quantifié optimisé par Kijai spécialement pour Blackwell. Voir lien ci-dessous.
  • Ordre des références (multiref) : l'image de référence principale doit aller en dernier dans le batch. C'est une règle contre-intuitive, confirmée par Kijai (malgré un commentaire de code contradictoire — suivre la règle verbale).
  • Un seul angle de référence : avec plusieurs angles dans le batch, des éléments de la scène peuvent disparaître (mur, fond). Commence avec une seule image de référence par génération.
  • DPO LoRA + fond noir : pour le replacement mode (remplacer un personnage dans une scène), Kijai utilise le DPO LoRA combiné à un encode vision du personnage sur fond noir pur. Cette combinaison "fixe" les clips récalcitrants.
  • Model optimisé 5090 : wan2.1_14B_SCAIL_2_nvfp4_mxpf8_mix.safetensors — mix nvfp4/mxfp8 trouvé par Kijai par trial-and-error, optimal sur Blackwell.
  • NativeLooping + SCAIL-2 : la combinaison la plus impressionnante à date — boucles de danse seamless "rivalisant avec Kling". Ablejones a partagé un workflow JSON SCAIL-2 + looping dès la sortie.
  • Background ref image : ajouter une image du fond (arrière-plan seul) dans le context window aide à maintenir la stabilité du décor, notamment sur de longues générations (confirmé Kijai).
SCAIL-2 vs Bernini pour le pose transfer : tests côte à côte de Kijai montrent que SCAIL-2 donne un transfer de pose bien plus propre que Bernini, grâce aux modèles 3D driver. Bernini est meilleur pour l'I2V libre, SCAIL-2 est meilleur pour le motion transfer précis.
Phase 5 Bernini, WanAnimate & outils avancés Édition, long vidéo, haute résolution

Cette phase couvre les outils les plus récents et avancés de l'écosystème WAN. Résultats impressionnants, mais chaque outil a ses angles morts qu'il faut connaître.

  • Ce que c'est : finetune WAN 2.2 pour l'édition par instruction texte ("rends-le en style lego", "change la saison", "modifie le vêtement"). Différent de VACE : pas de masque spatial, le modèle interprète ton instruction sur toute la vidéo.
  • Settings optimaux (Kijai) : 6 steps, CFG 1.0, avec LightX2V LoRA — et la version Wan 2.1 du LightX2V fonctionne mieux que la version 2.2 sur Bernini, à cause d'un mismatch architectural dans l'entraînement.
  • Sweet spot : 241 frames + 4 images de référence → résultats "absolument parfaits" (Stef, test communauté). Pas de color shift, pas de dérive.
  • Coût : 245 frames Bernini ≈ 490 frames WAN 2.2 standard en termes de compute (pose video pleine résolution = 2× vs SCAIL-2 à 1.5×).
  • Meilleur que WAN 2.2 pour l'I2V : Kijai dit "miles better than Wan22" pour animer une image — génère à 6 steps ce que WAN 2.2 fait moins bien à 20.
  • Limitation : les prompts influencent beaucoup l'output. La correspondance colorimétrique entre plusieurs sources reste imparfaite. Pas de génération longue intégrée — les context windows ralentiront encore plus (déjà 2× plus lent que base).
  • Ce que c'est : module WAN 2.2 spécialisé pour étendre la vidéo au-delà de 81 frames. Glissement de fenêtre temporelle (extension, pas context windows).
  • Color match : s'active seulement en replacement mode — quand le fond ET le masque sont branchés. En mode image complète (sans masque), la sortie garde la lumière de l'entrée : tu dois préparer manuellement ombres et lumières.
  • Vitesse : plus rapide que les context windows sur la même longueur. La dérive s'accumule progressivement — acceptable pour des vidéos moyennement longues, problématique au-delà de ~240 frames.
  • MagoNodes (sxela) : ComfyUI-MagoNodes — sampler tiled multi-échelle pour WAN. Génère d'abord en basse résolution, puis en 2×2 tiles haute résolution. Permet des résolutions plus élevées que le token count natif. Pas encore de benchmarks communautaires solides.
  • Clownsampler + 1536px : BNP4535353 a produit des résultats photoréalistes confondants avec WAN 2.1 SCAIL-2 à 1536px en utilisant le clownsampler. La communauté a demandé si c'était du vrai footage. Les settings LoRA ont été partagés.
  • ONE-SHOT-14B : WAN 2.1 T2V + branche VACE + cross-attention mesh humain 3D. Support multi-images de référence pour la cohérence de personnage. Apache 2.0. En cours d'intégration dans WanVideoWrapper.
Stack recommandé 2026 pour l'animation de personnage (RTX 5090) :
SCAIL-2 (nvfp4-mxfp8 mix) + NativeLooping + LightX2V Wan 2.1 LoRA → 4 steps, boucles seamless, motion rival Kling.
Phase 6 Intégration dans un pipeline VFX Usage professionnel

L'objectif final : utiliser WAN non pas comme une démo isolée, mais comme une brique dans un pipeline de production — génération d'alternatives, de références de mouvement, de matière pour le compositing.

  • WAN → Compositing : les limites de cohérence (dérive après 81 frames, resolution caps de SCAIL-2) font de WAN un outil idéal pour des clips courts (~5s) qu'on assemble ensuite en comp. Ce n'est pas une contrainte — c'est le workflow attendu.
  • SCAIL-2 pour la préviz mouvement : utiliser une vidéo mocap ou de référence comme driver, appliquer sur un asset character art, utiliser le résultat comme préviz animatique. Pas besoin de perfection à cette étape.
  • VACE pour la retouche : générer en WAN T2V, identifier les zones à corriger, masquer et régénérer avec VACE. Boucle génération → retouche masquée → génération.
  • Prompts de mouvement caméra : WAN répond bien au vocabulaire cinématographique. "dolly in", "rack focus", "crane shot", "handheld camera movement" influencent réellement le résultat. Documenter les prompts qui fonctionnent pour ton style.
  • Sortie multi-takes : générer 3-4 variantes avec seeds différentes pour avoir du choix au montage. Sur 5090, une génération 81 frames en 4 steps avec LightX2V est suffisamment rapide pour ce workflow.
  • Ressources pour aller plus loin : wanx-troopers.github.io — knowledge base communautaire curatée par 42hub avec workflows, settings, comparaisons.
Exercice Phase 6 : prend un asset visuel de ton choix (illustration, concept art, rendu 3D), crée une animation 5s avec WAN I2V, identifie un élément à corriger, utilise VACE pour le corriger, exporte et intègre dans un projet After Effects ou Nuke simple.
🗺

Parallèle avec LTX

Tu travailles aussi sur LTX 2.3 ? Les deux modèles sont complémentaires : LTX 2.3 excelle en qualité brute et multimodal (audio+vidéo), WAN excelle en écosystème modulaire (VACE, SCAIL-2) et en versatilité. Voir guide LTX pour la Phase 0 commune (installation, comfy-kitchen, mxfp8).