FilmoTvor.AI
Retour aux guides

Vidéo

Guide de génération vidéo LTX-2.3

12 min de lectureLa plupart des modèles vidéo IA devinent le bon mouvement. LTX-2.3 écoute — il accepte l'audio à côté du texte et génère une vidéo synchronisée sur la forme d'onde.

La plupart des modèles de vidéo IA prennent un prompt texte et devinent le mouvement qui semble correct. LTX-2.3 écoute. Le modèle DiT de 22 milliards de paramètres de Lightricks accepte un audio en complément d'un prompt texte et génère une vidéo synchronisée sur la forme d'onde. Les lèvres d'un personnage correspondent aux mots prononcés jusqu'aux phonèmes individuels, tandis que les bras d'un batteur se posent sur chaque frappe de caisse claire contenue dans l'audio.

Via FilmoTvor.AI, LTX-2.3 tourne en trois modes : text-to-video, image-to-video et audio-to-video. Ce guide passe en revue la structure des prompts et les paramètres techniques pour les trois, avec six exemples détaillés et du code que vous pouvez exécuter aujourd'hui.

Trois façons de générer de la vidéo

Chaque mode prend une entrée différente et résout un problème différent.

Les trois partagent les mêmes paramètres fondamentaux : 24 fps fixes, 2-10 secondes de sortie (49-241 images), résolutions jusqu'à 1024×1024.

Comment écrire des prompts pour LTX-2.3

LTX-2.3 répond le mieux aux prompts rédigés comme un paragraphe fluide au présent. Considérez cela comme la description d'un plan pour un chef opérateur – incluez le sujet, l'environnement, l'action, le comportement caméra, l'éclairage et le style, mais tissez-les ensemble naturellement plutôt que de les séparer en sections étiquetées.

Visez à couvrir ces éléments dans chaque prompt : le type de plan et la position caméra, la scène et l'éclairage, l'action centrale comme une séquence naturelle, les détails du personnage exprimés par des signes physiques, le mouvement caméra, et toute description audio.

Écrivez en prose naturelle, pas en listes de mots-clés. « Une femme de 35 ans aux cheveux sombres parle à la caméra dans un bureau moderne » fonctionne mieux que « woman, dark hair, office, talking, 35yo ». Le modèle analyse les phrases comme un modèle de langage – l'ordre des mots fixe la priorité, alors commencez par l'élément visuel le plus important et soyez précis sur les détails physiques.

Longueur de prompt cible : 60-200 mots. En dessous de 60, la sortie tend vers un mouvement générique, tandis que les prompts proches de 200 mots donnent au modèle assez de détail pour rester cohérent sur des clips de plus de 5 secondes.

Deux règles valables pour tous les modes :

  • Décrivez les micro-mouvements explicitement. Sans consignes comme « subtle head nods » ou « natural blinks », les visages ont tendance à se figer en regard de mannequin. Le modèle génère le mouvement que vous demandez – le silence dans le prompt signifie l'immobilité dans la vidéo.

  • Adaptez le mouvement caméra au contenu. Les plans statiques ou en lents travellings conviennent le mieux aux dialogues et aux gros plans. Gardez le travail caméra dynamique pour les larges plans d'installation et les performances où le visage n'est pas le centre d'attention.

Text-to-Video : prompts et exemples

Le text-to-video génère une scène entièrement à partir de votre description. Le modèle construit tout à partir du prompt – apparence et mouvement – ce qui en fait le bon choix pour les plans d'installation et les scènes atmosphériques où le contrôle créatif compte plus que la cohérence visuelle.

Exemple 1 : Plan d'installation cinématographique

Prompt :

Un plan large d'une ruelle de Tokyo éclairée au néon la nuit sous la pluie. Des dizaines d'enseignes lumineuses en kanji japonais se reflètent sur l'asphalte mouillé en traînées roses, bleues et orange. De la vapeur s'élève des stands de nourriture des deux côtés, une chaude lumière jaune se répandant sur le trottoir. La caméra avance lentement dans la ruelle déserte, les enseignes au néon défilant de chaque côté, des flaques captant les couleurs à mesure que l'angle change. La pluie traverse la lueur de chaque enseigne. L'audio est une forte pluie sur le trottoir, un léger bourdonnement électrique des néons, et un trafic urbain lointain. 35 mm anamorphique, Kodak Vision3 500T, grain marqué, faible profondeur de champ.

Pourquoi ça marche : Un seul mouvement, une seule direction – la caméra avance et tout le reste en découle. Aucun personnage à animer, aucun changement d'action en plein clip. Les reflets de néon sur l'asphalte mouillé donnent au modèle des interactions lumineuses concrètes sur chaque surface, et la parallaxe des enseignes qui défilent vend le mouvement vers l'avant. Nommer une pellicule précise oriente l'étalonnage colorimétrique plus précisément que des adjectifs comme « cinematic » ou « moody ».

Exemple 2 : Scène de dialogue à deux personnages

Prompt :

Un café européen chaleureux un après-midi pluvieux, vu de derrière une femme de 30 ans en pull couleur rouille. Elle est assise à une table côté fenêtre en face d'un homme de 40 ans en blazer marine qui se penche en avant au-dessus de sa tasse de café. De la vapeur s'élève entre eux, et la pluie coule sur la fenêtre derrière. L'homme fait un geste de la main droite : « So I told him – this is not how any of this works. » Il marque une pause, secoue la tête. La femme se renverse en arrière, les bras croisés, un sourire en coin qui se forme. « And he believed you? » L'homme expire, regarde sa tasse. « That's the thing. He didn't. » Elle rit doucement et attrape son café. La caméra effectue un léger travelling avant pendant la durée du clip sur un objectif 35 mm. La douce lumière du jour voilé depuis la fenêtre sert de lumière clé, une lampe pendulaire chaude au-dessus ajoute un fill orange. L'audio est constitué de leurs voix avec l'ambiance du café – tasses qui tintent, conversations étouffées, pluie contre la vitre. Grain de pellicule 35 mm, palette désaturée atténuée, faible profondeur de champ.

Pourquoi ça marche : Le dialogue est découpé en courtes phrases avec du jeu physique entre elles – un geste, une pause, un hochement de tête. Cela donne à LTX-2.3 une timeline beat par beat au lieu d'une vague consigne de « talk ». Assigner des rôles clairs (il parle, elle écoute et réagit) empêche le modèle de confondre qui fait quoi. Le cadrage par-dessus l'épaule garde les deux visages visibles sans exiger une mise en page complexe. Ajouter une description audio pour l'ambiance du café ancre la scène dans un espace acoustique précis.

Image-to-Video : animer des images fixes

L'image-to-video prend une image de référence comme première image et génère le mouvement à partir de là. Le prompt décrit ce qui se passe ensuite – l'image gère l'identité et la composition, donc vous vous concentrez entièrement sur l'action et la caméra.

Faites appel à ce mode quand vous avez déjà un personnage ou une prise de vue produit précis qui a besoin de mouvement. Le modèle préserve le visage, la garde-robe et la palette de couleurs de la référence à chaque génération.

Deux notes pratiques : le champ first_frame_image accepte JPG, PNG, GIF, BMP ou WebP jusqu'à 10 Mo. Vous pouvez aussi fixer une last_frame_image, mais pour la plupart des cas d'usage laisser le modèle décider de la fin produit un mouvement plus naturel.

Exemple 3 : Portrait qui prend vie

Prompt :

La femme de l'image de référence tourne lentement la tête d'un profil aux trois quarts pour faire face à la caméra directement. En tournant, ses lèvres s'écartent en un sourire chaleureux et une mèche de cheveux tombe sur son front. Elle lève la main et la passe derrière son oreille, puis soutient le regard de la caméra avec des yeux stables et inébranlables. La caméra reste verrouillée à hauteur des yeux en plan rapproché moyen sur un objectif 50 mm, légère oscillation à main levée. De douces ombres se déplacent sur ses pommettes quand elle bouge, l'éclairage de l'image de référence préservé tout au long. L'audio est celui d'une pièce silencieuse – léger bruissement de tissu quand elle bouge, respiration faible, doux bourdonnement ambiant. Grain de pellicule 35 mm, faible profondeur de champ, étalonnage naturel chaud.

Image d'entrée

Pourquoi ça marche : Le mouvement se lit comme une séquence que le modèle peut suivre beat par beat – tourner, sourire, replacer les cheveux, contact visuel. Chaque action déclenche la suivante. Décrire la chute des cheveux et le déplacement des ombres donne au modèle des conséquences physiques de la rotation de tête à rendre, plutôt que de s'en remettre à un vague « expression change ». L'instruction de préserver l'éclairage de référence empêche le modèle d'inventer un nouvel étalonnage en plein clip.

Exemple 4 : Paysage qui prend vie

Prompt :

Le vent traverse les hautes herbes au premier plan, courbant les tiges en lentes vagues de gauche à droite. Des nuages dérivent au-dessus de la chaîne de montagnes en arrière-plan, leurs ombres rampant sur la verte vallée en dessous. Une volée d'oiseaux s'envole de la lisière d'arbres à droite et se disperse dans le ciel. La caméra pousse lentement vers les montagnes, les herbes du premier plan sortant du focus tandis que les pics lointains se nettent. La lumière de l'heure dorée depuis la gauche attrape les pointes des herbes et les bords des nuages. L'audio est un vent régulier dans les herbes, un chant d'oiseaux lointain, et le faible ruissellement d'une rivière quelque part sous le cadre. 35 mm, faible profondeur de champ qui se décale avec le travelling avant, étalonnage naturel chaud.

Image d'entrée

Pourquoi ça marche : Les paysages sont l'un des cas d'usage les plus forts pour l'image-to-video parce que le modèle n'a qu'à ajouter du mouvement organique à une image déjà composée. Le vent dans les herbes, les nuages à la dérive et les oiseaux en vol sont autant de mouvements que le modèle gère de façon fiable – aucune géométrie complexe ni physique précise requise. Le lent travelling avant avec décalage de focus donne au clip une progression cinématographique au lieu de donner l'impression d'un fond d'écran animé en boucle. Décrire la direction du vent (gauche à droite) et le mouvement des ombres des nuages donne au modèle des vecteurs de mouvement cohérents sur tout le cadre.

Audio-to-Video : synchroniser le mouvement au son

Le modèle gère le minutage automatiquement. Votre prompt contrôle le style de performance : associer des parties du corps précises à des sons précis, et décrire les micro-expressions qui remplissent l'espace entre les phrases.

Spécifications audio

Paramètre Spécification
Durée 1-11 secondes (l'audio au-delà de 11 s est rejeté)
Formats MP3, WAV, OGG, FLAC
Taille max du fichier 20 Mo
Meilleure qualité Signal propre, loudness normalisé, bruit de fond minimal
Locuteurs Un seul locuteur fonctionne le mieux. L'audio multi-locuteurs se synchronise sur la voix dominante

Alignez votre nombre d'images sur la durée audio : frames = round_to_8n+1(audio_seconds × 24). Un clip vocal de 5 secondes nécessite ~121 images. Une piste musicale de 10 secondes en nécessite 241.

Exemple 5 : Portrait parlant lip-syncé

Prompt :

Une femme de 35 ans aux longs cheveux sombres et aux yeux bruns chaleureux, maquillage léger naturel, portant un chemisier en soie crème, assise à un bureau dans un bureau à domicile moderne. De douces étagères floues remplissent l'arrière-plan, et une chaude lampe de bureau à droite projette une lumière de fin d'après-midi sur son visage. Elle parle directement à la caméra, sa tête penchant légèrement sur les points clés, ses sourcils se levant pour l'insistance, de brefs sourires se formant entre les phrases. Ses yeux soutiennent l'objectif, puis dérivent vers le bas comme pour rassembler une pensée, puis reviennent. Ses mains se lèvent occasionnellement en gestes paume ouverte sous son menton. La caméra la cadre en plan rapproché moyen à hauteur des yeux sur un objectif 50 mm avec un léger mouvement à main levée. Chaude lumière de fenêtre depuis le haut gauche, fill orange depuis la lampe de bureau à droite, doux éclairage de contour qui la détache de l'arrière-plan. L'audio est sa voix claire et posée avec une légère tonalité de pièce et le doux tic-tac d'une horloge. Ambiance d'interview documentaire, grain de pellicule 35 mm, étalonnage colorimétrique chaud.

Entrée audio

Pourquoi ça marche : La précision du lip-sync dépend de deux choses : la qualité audio et le détail du prompt. Le modèle associe automatiquement les phonèmes aux formes de bouche, mais tout ce qui entoure la bouche – inclinaisons de tête, élévations de sourcils, direction du regard – provient du prompt. Sans ces consignes de micro-mouvement, le visage se rend comme un masque figé avec une bouche en mouvement. Le cadrage en plan rapproché moyen rend le lip-sync lisible, et la caméra statique empêche le flou de mouvement de masquer l'articulation.

Combiner image et audio

Générez trois clips text-to-video de « a 30-year-old woman speaking » et vous obtiendrez trois femmes différentes. L'audio-to-video seul a le même problème. Mais fixez le visage avec une image de référence et le minutage avec l'audio, et chaque clip montre la même personne livrant le même style de performance. L'image gère l'identité, l'audio gère la synchronisation – votre prompt n'a qu'à décrire comment elle performe.

Le personnage de l'image de référence parle à la caméra, les yeux soutenant le regardeur avec un contact chaleureux, puis regardant légèrement hors-champ à droite entre les phrases comme si quelqu'un était assis à proximité. Ses sourcils se lèvent sur les mots clés, un sourire franc se forme sur les moments légers, et ses mains entrent occasionnellement dans le cadre en gestes conversationnels ouverts. Entre les phrases elle marque une pause, jette un bref regard vers le bas, puis revient au regardeur avec une attention renouvelée. La caméra la cadre en plan rapproché moyen, poussant légèrement vers elle pendant la durée du clip avec une imperceptible oscillation à main levée. L'éclairage de l'image de référence est préservé tout au long. L'audio est sa voix chaleureuse et articulée avec une douce ambiance de pièce. Documentaire cinématographique, 35 mm, faible profondeur de champ, étalonnage colorimétrique naturel.

L'image définit déjà le qui et le où. Consacrez tout votre budget de prompt à décrire comment le personnage réagit à l'audio.

Référence des résolutions et cadrages

LTX-2.3 prend en charge les résolutions de 512×512 à 1024×1024. Choisir le bon ratio d'aspect compte – une tête parlante en 1:1 gaspille la moitié du cadre en espace vide, tandis qu'un plan d'installation de paysage en 9:16 rogne le décor que vous essayez de montrer.

Ratio d'aspect Options de résolution Idéal pour
16:9 1024×576, 896×512 Dialogues, interviews, performances, YouTube
9:16 576×1024, 512×896 Reels, TikTok, Stories, lip-sync vertical
2.39:1 960×416, 1024×432 Plans d'installation cinématographiques, esthétique film
1:1 768×768, 1024×1024 Prises de vue produit, miniatures réseaux sociaux

Pour l'audio-to-video, alignez votre nombre d'images sur la durée audio. La formule : frames = round_to_8n+1(audio_seconds × 24). Voici les valeurs les plus courantes :

Durée audio Images
2 secondes 49
5 secondes 121
8 secondes 193
10 secondes 241

Un décalage entre la longueur audio et le nombre d'images pousse le modèle soit à tronquer l'audio, soit à générer des images muettes à la fin. Ni l'un ni l'autre n'est ce que vous voulez.

Erreurs courantes et comment les corriger

« Visage de mannequin » en audio-to-video. Le modèle synchronise les lèvres automatiquement, mais le reste du visage reste figé sauf si vous décrivez des micro-expressions dans le prompt. Ajoutez « subtle head nods », « eyebrow raises on emphasis » et « natural blinks between phrases ». Ces trois phrases à elles seules font la différence entre une tête parlante robotique et un visage qui semble vivant.

Lip-sync décalé de ~100 ms. Presque toujours causé par une inadéquation images/audio. Recalculez avec la formule ci-dessus, et vérifiez que votre audio fait exactement la longueur que vous croyez. Si le décalage persiste, essayez d'ajouter 100 ms de silence au début de votre fichier audio.

Caméra trop rapide pour le dialogue. Les panoramiques rapides et les mouvements de fouet floutent le visage et rendent le lip-sync illisible. Pour toute scène où l'articulation de la bouche compte, gardez la caméra statique ou utilisez un lent travelling avant. Réservez le travail caméra dynamique aux plans larges et aux performances musicales.

Les clips de 10 secondes perdent l'identité du personnage. À la durée maximale (241 images), le modèle doit maintenir la cohérence sur beaucoup de contenu généré. L'audio ancre la timeline et réduit de moitié la dérive – même un prompt text-to-video médiocre produit des clips longs plus cohérents en mode audio-to-video que sans audio.

Phrases de prompt qui fonctionnent

Une antisèche de référence rapide pour les prompts audio-to-video. Copiez ce qui convient à votre scène.

Lip-sync (parole) :

  • lip movements perfectly synced to each phoneme

  • natural conversational pacing, not theatrical

  • soft pressed-lip pauses between phrases

Micro-expressions :

  • subtle eyebrow raises on key words

  • small smiles forming at warm moments

  • barely perceptible nod agreeing with own statements

Contact visuel :

  • soft engaged eye contact with the viewer

  • eyes occasionally drifting slightly off-camera as if thinking

  • intermittent eye contact, looking down reflectively between phrases

Synchronisation au beat (musique) :

  • head nodding on downbeats

  • shoulder lift on every snare hit

  • foot tapping on the kick drum

  • body swaying with the rhythm

Réactions aux effets sonores :

  • flinches on loud impact sounds

  • head snaps toward unexpected sound

  • eyes widen on dramatic sound effect