WAN (Wan Video) est la famille de modèles vidéo ouverts la plus utilisée de la communauté. Contrairement à LTX, c'est un écosystème modulaire : un socle (2.1 ou 2.2) sur lequel se branchent des modules spécialisés — VACE pour le masking, SCAIL-2 pour le pose transfer, Bernini pour l'édition.
— Plan de formation — RTX 5090 optimiséAvant de commencer, voici la carte mentale de WAN. Chaque "module" ci-dessous fait l'objet d'une phase dédiée.
| Modèle / Outil | Rôle | Basé sur | Cas d'usage |
|---|---|---|---|
| WAN 2.1 T2V 14B | Texte → Vidéo | WAN 2.1 | T2V général, base de tout l'écosystème. Toujours recommandé par Kijai. |
| WAN 2.2 I2V A14B | Image → Vidéo | WAN 2.2 | Animer une image fixe. Version animé 14B, plus expressif. |
| WAN 2.2 5B | T2V / I2V léger | WAN 2.2 | 720p natif, tokenizer différent (taew2.2). Plus rapide, moins expressif. |
| LightX2V LoRA | Accélération | WAN 2.1 ou 2.2 | 4 steps au lieu de 20+. Attention : pas de scènes sombres (biais training). |
| VACE | Inpainting vidéo | WAN 2.1 | Édition masquée : remplacer une zone, modifier un personnage, stitching long. |
| WanAnimate | Long vidéo | WAN 2.2 | Extension temporelle par glissement de fenêtre. Plus rapide que context windows. |
| SCAIL-2 | Pose transfer | WAN 2.1 14B | Squelette/pose video → animer un personnage. Motion rivaling Kling (NativeLooping). |
| Bernini | Édition vidéo | WAN 2.2 finetune | Édition par instruction (≠ masque). Meilleur I2V que WAN 2.2 base selon Kijai. |
| ONE-SHOT-14B | Multi-ref character | WAN 2.1 T2V + VACE | Cohérence de personnage multi-angles. Branche VACE + cross-attention mesh 3D. |
C:\ComfyUI). Lance run_nvidia_gpu.bat.
ComfyUI\models\diffusion_models\, les text encoders dans ComfyUI\models\text_encoders\.
Avant de lancer quoi que ce soit, comprendre pourquoi il existe deux versions (et pourquoi 2.1 reste souvent préféré) évite de nombreuses confusions.
VACE est un module spécialisé de WAN 2.1 entraîné à comprendre les masques. Contrairement à Bernini (qui suit des instructions texte), VACE opère via des masques spatiaux — tu dessines la zone à modifier et VACE régénère seulement cette zone en cohérence avec le reste.
cond_retain_index_list (voir ci-dessous) est particulièrement important ici.cond_retain_index_list :SCAIL-2 est un module entraîné sur WAN 2.1 14B qui transfère une pose/squelette vidéo sur un personnage cible. Tu fournis une "pose video" (squelette OpenPose ou similaire) et une image de référence du personnage — SCAIL-2 génère le personnage qui effectue ce mouvement.
Cette phase couvre les outils les plus récents et avancés de l'écosystème WAN. Résultats impressionnants, mais chaque outil a ses angles morts qu'il faut connaître.
L'objectif final : utiliser WAN non pas comme une démo isolée, mais comme une brique dans un pipeline de production — génération d'alternatives, de références de mouvement, de matière pour le compositing.
Tu travailles aussi sur LTX 2.3 ? Les deux modèles sont complémentaires : LTX 2.3 excelle en qualité brute et multimodal (audio+vidéo), WAN excelle en écosystème modulaire (VACE, SCAIL-2) et en versatilité. Voir guide LTX pour la Phase 0 commune (installation, comfy-kitchen, mxfp8).