Valentin Dornel — Personnel

ComfyUI Vidéo
& LTX

RTX 5090 · Windows 11 Sources : corpus Banodoco — juin 2026 Objectif : comprendre, pas juste faire tourner

"mxfp8 which runs natively on 5090 is best of both worlds, best quality and speed."

— Kijai · #ltx_chatter · avril 2026
Phase 0
SETUP
Installer et calibrer ComfyUI pour la RTX 5090
5 étapes — avant de toucher au moindre workflow LTX
1–2h
📌 Contexte : ComfyUI est une interface en nœuds pour faire tourner des modèles d'IA localement. On installe d'abord ComfyUI, puis les extensions (custom nodes), puis on télécharge le modèle LTX. L'ordre compte.
1
Installer ComfyUI (version portable Windows)
Télécharge la version portable Windows de ComfyUI (fichier .7z ou .zip sur la page releases). Extrais dans un dossier sans espace dans le chemin — par ex. C:\ComfyUI ou D:\AI\ComfyUI.

Pour lancer : double-clic sur run_nvidia_gpu.bat. ComfyUI s'ouvre dans ton navigateur à http://127.0.0.1:8188.
Pourquoi la version portable ? Elle embarque son propre Python isolé — aucun risque de conflit avec d'autres installations Python sur ta machine. C'est le setup recommandé par la communauté pour Windows.
2
Installer ComfyUI Manager + mettre à jour les dépendances critiques
ComfyUI Manager est le gestionnaire d'extensions. Sans lui tu ne peux pas installer les nodes LTX.

Dans ComfyUI, va dans le menu en haut à droite → Manager. S'il n'est pas là, installe-le via ces instructions GitHub (clone dans ComfyUI/custom_nodes/).

Une fois dans Manager, clique "Update All" puis redémarre ComfyUI. Ensuite ouvre un terminal dans le dossier ComfyUI et mets à jour les deux paquets critiques :
python_embeded\python.exe -m pip install --upgrade comfy-kitchen comfy-aimdo
# Résultat attendu :
Successfully installed comfy-kitchen-0.2.10 comfy-aimdo-0.4.9
Pourquoi c'est critique ? Sans comfy-kitchen ≥ 0.2.9, les LoRAs LTX tournent à moitié de la vitesse — le bug a été identifié et confirmé par Jonathan (auteur de LTX Director) en juin 2026. Littéralement : "doubled the speed immediately" après la mise à jour. comfy-aimdo gère la VRAM dynamique sur les GPUs Blackwell (5090 = architecture Blackwell).
3
Installer le node ComfyUI-LTXVideo
Dans ComfyUI Manager → "Install Custom Nodes" → cherche "LTX Video" → installe ComfyUI-LTXVideo (par Lightricks, l'équipe qui fait le modèle). Redémarre ComfyUI.

Si tu ne le trouves pas dans Manager, utilise "Install via Git URL" et colle : https://github.com/Lightricks/ComfyUI-LTXVideo
C'est le node officiel Lightricks — il fournit tous les nodes spécifiques à LTX : le sampler, le VAE, le text encoder Gemma, etc. Sans lui, tu ne peux pas charger un workflow LTX.
4
Télécharger le bon modèle LTX — version mxfp8
Télécharge ce fichier depuis HuggingFace (Kijai) :

ltx-2.3-22b-distilled-1.1_transformer_only_mxfp8_block32.safetensors

Place-le dans : ComfyUI\models\diffusion_models\ (crée le dossier s'il n'existe pas).

Tu auras aussi besoin du VAE LTX et du text encoder Gemma — le node ComfyUI-LTXVideo te donnera des liens ou les télécharge automatiquement au premier lancement.
Pourquoi mxfp8 et pas bf16 ? mxfp8 (microscaling float 8-bit) est natif sur l'architecture Blackwell (RTX 5090). Qualité quasi-identique à bf16, mais 30–40% plus rapide. Kijai : "mxfp8 is just so much easier to do, and higher quality out of the box". La version distilled génère en ~8 steps au lieu de 50 — bien pour apprendre, les générations sont rapides.
5
Démarrer sans flags et vérifier que tout est bien détecté
Lance run_nvidia_gpu.bat et regarde le terminal. Tu dois voir ces lignes :
DynamicVRAM support detected and enabled
comfy-aimdo inited for GPU: NVIDIA GeForce RTX 5090
comfy-kitchen version: 0.2.10
comfy-aimdo version: 0.4.9
Set vram state to: NORMAL_VRAM
Pas de flags de démarrage nécessaires sur 5090 — la carte gère sa VRAM seule via DynamicVRAM. N'ajoute pas --use-sage-attention (inutile sur 5090), ni --lowvram (contre-productif). Si tu as des freezes lors de l'upscaling, c'est souvent un problème de RAM système, pas de VRAM.
Checklist de validation
DynamicVRAM detected apparaît dans le terminal
comfy-kitchen ≥ 0.2.10 et comfy-aimdo ≥ 0.4.9
Le node LTX Video Sampler apparaît dans le menu Add Node de ComfyUI
Le fichier ltx-2.3-22b-distilled-1.1_transformer_only_mxfp8_block32.safetensors est visible dans le model picker
⚠️ Piège classique : ne pas installer le "legacy ComfyUI Manager" — il casse le build en supprimant des fichiers importants. Utiliser uniquement le Manager intégré à ComfyUI ou l'installer depuis le repo GitHub officiel.
Phase 1
CONCEPTS
Comprendre LTX avant de toucher les nodes
La base architecturale — pourquoi LTX se comporte différemment de SD
2–3h
Ce que LTX est vraiment
LTX 2.3 est un transformer multimodal, pas un U-Net. Il traite vidéo et audio dans le même espace latent. La logique de conditioning est fondamentalement différente de Stable Diffusion — mini-cours visuel →
Le modèle fonctionne en latent space compressé — le VAE compresse les frames par blocs de 8, ce qui impose des contraintes précises sur les frame counts
Deux règles architecturales à mémoriser
8n + 1
Seuls les frame counts valides : 17, 25, 33, 41, 49, 57, 65, 73, 81… C'est une contrainte du VAE, pas un choix. Dépasser 81 frames sans context windows donne des résultats dégradés
÷ 32
Largeur et hauteur doivent être divisibles par 32. 720p ne marche pas — le modèle snap à 704 ou 736. En i2v standard l'auto-correction se fait, mais pas pour les inputs de contrôle (pose, depth)
À regarder en premier
Tutorial LTX Director par Jonathan — le créateur du node principal. Explique tout depuis zéro, sorti mai 2026. Point d'entrée recommandé par la communauté
Nvidia blog — ComfyUI tutorial RTX — bonnes bases ComfyUI pour GPU récent, sans aller dans le détail LTX
📖 Principe de prompting à comprendre dès le début : en I2V, "le prompt supporte les images, pas les images qui supportent le prompt" — le prompt décrit l'état de la scène, l'image guide la génération. À l'inverse de ce qu'on fait en image fixe.
Phase 2
PRATIQUE
T2V et I2V simples
Premières vidéos propres, comprendre les paramètres
3–4h
Workflow de départ recommandé
LTX Director v2 (Jonathan / WhatDreamsCost) — node all-in-one sorti le 20 juin 2026. Timeline éditeur intégré, I2V, T2V, audio, keyframes dans un seul node. C'est la porte d'entrée de la communauté en ce moment
Ce qu'il faut expérimenter
Seed hunting — trouver un seed qui donne la bonne direction, puis raffiner. Workflow dédié : LTX 2.3 Seed Hunter sur Civitai + son tutorial
Reddit tutorial LTX 2.3 complet : Video Reasoning + LoRA (r/comfyui) — couvre les bases jusqu'à l'utilisation de LoRAs
Prompts courts vs longs — LTX répond bien aux deux mais différemment. Les prompts longs décrivent l'état visuel complet du plan, pas les actions frame par frame
⚠️ Limite connue à éviter : frame count au-delà de 81 sans context windows → dégradation et drift. En V2V (video-to-video), rester à 81 frames max : au-delà, le modèle dérive vers les couleurs et personnages sources.
Phase 3
CONTRÔLE
Keyframes et contrôle du temps
FFLF + Prompt Relay — le vrai contrôle de la narration visuelle
4–6h
FFLF — First, (Middle,) Last Frame
Tu fournis des images à des timestamps précis, le modèle interpole. Utilisable pour des transitions propres entre états visuels — très puissant pour un workflow VFX
Frame counts pour MSR LoRA et autres approches multi-ref : 17 / 25 / 33 / 41 — les plus hauts donnent une meilleure cohérence de référence. frame_idx = 0 pour les scènes multi-sujets (MSR = Multi-Subject Reference — LoRA communautaire de cohérence personnage via plusieurs images de référence ; ces frame counts spécifiques permettent au modèle d'encoder les refs dans les premières frames)
Prompt Relay — segmentation temporelle
Segmente ton prompt par plage de frames pour contrôler exactement ce qui se passe et quand. Intégré nativement dans LTX Director v2
Règle critique : Prompt Relay est pour les changements forts et précis, pas pour chaque variation subtile. Commencer avec 2 segments max pour 5 images. Trop de segments = résultats moins bons, pas meilleurs
Les images frames guident plus que le texte une fois en mode I2V. Garder cette hiérarchie en tête pour savoir quoi ajuster quand ça ne donne pas le résultat voulu
💡 Les context windows d'Ablejones permettent d'aller au-delà des 81 frames natives sans dégradation. À explorer après avoir bien digéré la Phase 2 — c'est la prochaine étape naturelle pour les vidéos longues.
Phase 4
IC-LORA
IC-LoRAs — contrôle avancé
Adaptateurs qui ajoutent des capacités au modèle de base
4–6h
Qu'est-ce qu'un IC-LoRA ?
Un IC-LoRA n'est pas un LoRA de style — c'est un adaptateur qui ajoute une nouvelle capacité de conditioning au modèle (contrôle caméra, cohérence personnage, inpainting…). Les inputs passent dans un node "IC-LoRA Guide" dédié, pas dans le sampler standard
Trois grandes familles : cohérence personnage (garder l'identité d'un sujet d'un plan à l'autre), contrôle caméra / mouvement (caméra fixe, trajectoires), édition (inpainting, outpainting). Chacune a sa propre logique de setup
Cohérence personnage
IC-LoRA Ingredients (Lightricks, officiel) — une seule ref sheet suffit. Simple à mettre en place : pas de frame count spécifique, pas d'encodage multi-image à préparer. Point d'entrée recommandé
MSR LoRA (Multi-Subject Reference, communautaire) — encode plusieurs images du même personnage (angles, expressions, tenues variés) dans les premières frames. Setup plus exigeant : frame counts 17 / 25 / 33 / 41, frame_idx = 0 pour scènes multi-sujets. En échange : cohérence plus robuste sur les plans longs ou changements de pose importants
Quand choisir quoi : Ingredients pour démarrer vite sur un projet court / MSR LoRA si l'identité du personnage doit tenir sur plusieurs plans consécutifs
⚠️ Limite à connaître sur la cohérence multi-personnages : LTX ne peut pas séquencer des dialogues (personnage A parle, puis B répond). C'est une limite architecturale du modèle, pas un bug. FFLF avec keyframes reste possible pour alterner les plans, mais pas au sein d'une même génération.
Contrôle caméra et mouvement
LoRA Statica — caméra totalement fixe. Recette validée : strength à 1.5, prompts courts (enlever une phrase redondante suffit à éviter le drift)
Any Trajectory Instruction — port de la technique Wan vers LTX. HuggingFace + workflow inclus. Utilise le path animator node pour définir les trajectoires de mouvement
Édition
Inpainting / Outpainting — IC-LoRA officiel Lightricks (juin 2026). Fonctionne bien en usage général ; expression faciale encore perfectible selon les tests communauté
Phase 5
AUDIO
Audio et motion réactif
Optionnel — mais impressionnant pour des démos pédagogiques
3–4h
LTX Audio-to-Motion V3
Nekodificador × Nvidia Spain — workflow ComfyUI audio-réactif sorti le 17 juin 2026. Tutorial YouTube en anglais, installation guidée pas à pas. Mouvement synchronisé au rythme audio
Lien repo : GitHub Nekodificador — workflow JSON inclus
Précisions sur l'audio dans LTX
En mode T2V, LTX accroche mieux au rythme musical qu'en mode Director — mais sacrifie la complexité visuelle. Les deux modes ont leur usage
Ne pas utiliser un latent audio vide — produit du speech inintelligible. Utiliser Audio VAE Encode avec un vrai fichier audio pour restaurer l'intelligibilité
🎵 LTX 2.3 est multimodal natif vidéo + audio. L'audio n'est pas ajouté en post — il conditionne la génération. Ça change la façon de penser les workflows par rapport à une approche "vidéo puis musique".
À éviter au début

Garder pour plus tard

LoRA training LTX — possible sur 5090 mais nécessite WSL/Ubuntu sur Windows. Les discussions de juin 2026 montrent que le trainer officiel demande 80 GB de VRAM et plante souvent sur Windows natif
Wan 2.2 — meilleur sur la physique des corps (moins de déformation), mais le pipeline ComfyUI est moins mature. À apprendre après avoir bien digéré LTX
Quantification agressive (fp8 skipping, GGUF) — la 5090 n'en a pas besoin. Ne pas commencer avec des options de compromise mémoire qui rendent le debug plus difficile