FilmoTvor.AI
Torna alle guide

Video

Guida alla generazione video LTX-2.3

12 min di letturaLa maggior parte dei modelli video IA indovina il movimento giusto. LTX-2.3 ascolta — accetta l'audio accanto al testo e genera video sincronizzato alla forma d'onda.

La maggior parte dei modelli video AI prende un prompt testuale e indovina quale movimento sembri giusto. LTX-2.3 ascolta. Il modello DiT da 22 miliardi di parametri di Lightricks accetta audio insieme a un prompt testuale e genera video sincronizzato alla forma d'onda. Le labbra di un personaggio corrispondono alle parole parlate fino ai singoli fonemi, mentre le braccia di un batterista atterrano su ogni colpo di rullante che l'audio contiene.

Tramite FilmoTvor.AI, LTX-2.3 gira in tre modalità: text-to-video, image-to-video e audio-to-video. Questa guida illustra la struttura dei prompt e i parametri tecnici in tutte e tre, con sei esempi sviluppati e codice che puoi eseguire oggi.

Tre modi per generare video

Ogni modalità prende un input diverso e risolve un problema diverso.

Tutte e tre condividono gli stessi parametri di base: 24 fps fissi, 2-10 secondi di output (49-241 frame), risoluzioni fino a 1024×1024.

Come scrivere prompt per LTX-2.3

LTX-2.3 risponde meglio ai prompt scritti come un singolo paragrafo fluido al presente. Pensala come scrivere la descrizione di un'inquadratura per un direttore della fotografia – includi soggetto, ambiente, azione, comportamento della fotocamera, illuminazione e stile, ma intrecciali insieme in modo naturale invece di separarli in sezioni etichettate.

Cerca di coprire questi elementi in ogni prompt: il tipo di inquadratura e la posizione della fotocamera, la scena e l'illuminazione, l'azione centrale come sequenza naturale, i dettagli del personaggio espressi attraverso spunti fisici, il movimento della fotocamera e qualunque descrizione audio.

Scrivi in prosa naturale, non liste di keyword. «Una donna di 35 anni con capelli scuri parla alla fotocamera in un ufficio moderno» funziona meglio di «donna, capelli scuri, ufficio, che parla, 35ennne». Il modello analizza le frasi come un modello linguistico – l'ordine delle parole stabilisce la priorità, quindi comincia con l'elemento visivo più importante e sii specifico sui dettagli fisici.

Lunghezza target del prompt: 60-200 parole. Sotto le 60 l'output tende a un movimento generico, mentre prompt vicini alle 200 danno al modello dettaglio sufficiente per restare coerente in clip oltre i 5 secondi.

Due regole che valgono per tutte le modalità:

  • Descrivi esplicitamente i micro-movimenti. Senza istruzioni come «lievi cenni del capo» o «ammiccare naturale», i volti tendono a congelarsi in un fissamento da manichino. Il modello genera il movimento che gli chiedi – silenzio nel prompt significa immobilità nel video.

  • Abbina il movimento della fotocamera al contenuto. Inquadrature statiche o con lento dolly funzionano meglio per dialoghi e close-up. Riserva il lavoro dinamico di fotocamera alle inquadrature wide di apertura e alle performance in cui il volto non è il focus.

Text-to-video: prompt ed esempi

Il text-to-video genera una scena interamente dalla tua descrizione. Il modello costruisce tutto dal prompt – aspetto e movimento allo stesso modo – il che lo rende la scelta giusta per inquadrature di apertura e scene atmosferiche dove il controllo creativo conta più della consistenza visiva.

Esempio 1: Inquadratura cinematografica di apertura

Prompt:

Un'inquadratura wide di un vicolo di Tokyo illuminato al neon di notte sotto la pioggia. Dozzine di insegne luminose in kanji giapponese si riflettono sull'asfalto bagnato in striature rosa, blu e arancioni. Vapore sale dalle bancarelle di cibo su entrambi i lati, una calda luce gialla che si riversa sul marciapiede. La fotocamera avanza lentamente lungo il vicolo vuoto, le insegne al neon che scivolano via su entrambi i lati, le pozzanghere che catturano i colori mentre l'angolazione cambia. La pioggia attraversa in striature il bagliore di ogni insegna. L'audio è pioggia battente sull'asfalto, un basso ronzio elettrico del neon e traffico cittadino in lontananza. 35mm anamorfico, Kodak Vision3 500T, grana pesante, scarsa profondità di campo.

Perché funziona: Un movimento, una direzione – la fotocamera avanza e tutto il resto ne consegue. Nessun personaggio da animare, nessun cambio di azione a metà clip. I riflessi del neon sull'asfalto bagnato danno al modello interazioni luminose concrete su ogni superficie, e la parallasse delle insegne che scivolano via vende il movimento in avanti. Nominare una specifica pellicola orienta il color grade più precisamente degli aggettivi come «cinematografico» o «atmosferico».

Esempio 2: Scena di dialogo a due

Prompt:

Un accogliente caffè europeo in un pomeriggio piovoso, visto da dietro una donna di 30 anni con un maglione color ruggine. Siede a un tavolo accanto alla finestra di fronte a un uomo di 40 anni in blazer navy che si sporge in avanti sulla sua tazza di caffè. Vapore sale tra loro, e la pioggia scorre in striature sul vetro dietro. L'uomo gesticola con la mano destra: «Così gli ho detto – non è così che funziona nessuna di queste cose». Fa una pausa, scuote la testa. La donna si appoggia allo schienale, braccia conserte, un sorrisetto che si forma. «E ti ha creduto?» L'uomo espira, guarda giù verso la sua tazza. «È questo il punto. Non mi ha creduto.» Lei ride dolcemente e allunga la mano verso il suo caffè. La fotocamera fa un dolce dolly-in lungo la durata della clip con un obiettivo 35mm. La soffice luce diurna nuvolosa dalla finestra funge da key light, una calda lampada pendente sopra aggiunge un fill arancione. L'audio è le loro voci con ambient del caffè – tazze che tintinnano, conversazione ovattata, pioggia contro il vetro. Grana di pellicola 35mm, palette desaturata e smorzata, scarsa profondità di campo.

Perché funziona: Il dialogo è spezzato in frasi brevi con recitazione fisica tra l'una e l'altra – un gesto, una pausa, uno scuotere di testa. Questo dà a LTX-2.3 una timeline battuta per battuta invece di una sola vaga istruzione a «parlare». Assegnare ruoli chiari (lui parla, lei ascolta e reagisce) evita che il modello confonda chi fa cosa. L'inquadratura over-the-shoulder tiene entrambi i volti visibili senza richiedere una composizione complessa. Aggiungere la descrizione audio per l'ambient del caffè radica la scena in uno spazio acustico specifico.

Image-to-video: animare immagini statiche

L'image-to-video prende un'immagine di riferimento come primo frame e genera movimento da lì. Il prompt descrive cosa succede dopo – l'immagine gestisce identità e composizione, quindi ti concentri interamente su azione e fotocamera.

Raggiungi questa modalità quando hai già un personaggio o uno scatto di prodotto specifico che ha bisogno di movimento. Il modello preserva volto, guardaroba e palette di colori dal riferimento in ogni generazione.

Due note pratiche: il campo first_frame_image accetta JPG, PNG, GIF, BMP o WebP fino a 10 MB. Puoi fissare opzionalmente anche un last_frame_image, anche se per la maggior parte dei casi d'uso lasciare che il modello decida il finale produce movimento più naturale.

Esempio 3: Ritratto che prende vita

Prompt:

La donna dell'immagine di riferimento gira lentamente la testa da un profilo tre quarti per guardare la fotocamera direttamente. Mentre si gira, le labbra si schiudono in un caldo sorriso e una ciocca di capelli le cade sulla fronte. Alza la mano e la sistema dietro l'orecchio, poi regge lo sguardo della fotocamera con occhi fermi, inamovibili. La fotocamera resta bloccata all'altezza degli occhi in un medio close-up con un 50mm, leggero tremolio a mano libera. Morbide ombre si spostano sugli zigomi mentre si muove, l'illuminazione dell'immagine di riferimento preservata per tutta la durata. L'audio è una stanza silenziosa – morbido fruscio di stoffa mentre si muove, debole respiro, gentile ronzio ambientale. Grana di pellicola 35mm, scarsa profondità di campo, color grade naturale caldo.

Immagine di input

Perché funziona: Il movimento si legge come una sequenza che il modello può seguire battuta per battuta – giro, sorriso, ciocca di capelli sistemata, contatto visivo. Ogni azione innesca la successiva. Descrivere i capelli che cadono e lo spostamento d'ombra dà al modello conseguenze fisiche del giro di testa da renderizzare, invece di affidarsi a un vago «cambio di espressione». L'istruzione di preservare l'illuminazione di riferimento impedisce al modello di inventare un nuovo color grade a metà clip.

Esempio 4: Paesaggio che prende vita

Prompt:

Il vento attraversa l'erba alta in primo piano, piegando gli steli in lente onde da sinistra a destra. Le nuvole scivolano sulla catena montuosa sullo sfondo, le loro ombre che strisciano sulla verde valle sottostante. Uno stormo di uccelli si alza dalla linea degli alberi a destra e si disperde nel cielo. La fotocamera fa una lenta carica verso le montagne, l'erba in primo piano che esce dal fuoco mentre le cime lontane si fanno nitide. La luce dorata del sole da sinistra cattura le punte dell'erba e i bordi delle nuvole. L'audio è vento costante tra l'erba, canto di uccelli in lontananza e il debole scroscio di un fiume da qualche parte sotto l'inquadratura. 35mm, scarsa profondità di campo che si sposta con la carica, color grade naturale caldo.

Immagine di input

Perché funziona: I paesaggi sono uno dei casi d'uso più forti per l'img2video perché il modello deve solo aggiungere movimento organico a un frame già composto. Vento tra l'erba, nuvole che scivolano e uccelli in volo sono tutti movimenti che il modello gestisce in modo affidabile – nessuna geometria complessa o fisica precisa richiesta. La lenta carica con fuoco che si sposta dà alla clip una progressione cinematografica invece di sembrare un wallpaper animato in loop. Descrivere la direzione del vento (da sinistra a destra) e il movimento delle ombre delle nuvole dà al modello vettori di movimento coerenti su tutto il frame.

Audio-to-video: sincronizzare il movimento al suono

Il modello gestisce il tempismo automaticamente. Il tuo prompt controlla lo stile di performance: mappare parti del corpo specifiche su suoni specifici e descrivere le micro-espressioni che riempiono lo spazio tra le frasi.

Requisiti audio

Parametro Requisito
Durata 1-11 secondi (l'audio oltre gli 11s viene rifiutato)
Formati MP3, WAV, OGG, FLAC
Dimensione massima file 20 MB
Qualità migliore Pulito, loudness normalizzato, rumore di fondo minimo
Parlanti Un parlante singolo funziona meglio. L'audio con più parlanti si sincronizza sulla voce dominante

Allinea il conteggio dei frame alla durata dell'audio: frames = round_to_8n+1(audio_seconds × 24). Un clip vocale di 5 secondi ha bisogno di ~121 frame. Una traccia musicale di 10 secondi ne ha bisogno di 241.

Esempio 5: Ritratto parlante con lip-sync

Prompt:

Una donna di 35 anni con lunghi capelli scuri e caldi occhi marroni, trucco leggero e naturale, indossa una camicetta di seta crema, siede a una scrivania in un home office moderno. Soffuse librerie sfocate riempiono lo sfondo, e una calda lampada da scrivania a destra proietta luce del tardo pomeriggio sul suo volto. Parla direttamente alla fotocamera, la testa che si inclina leggermente sui punti chiave, le sopracciglia che si alzano per enfasi, brevi sorrisi che si formano tra le frasi. I suoi occhi reggono l'obiettivo, poi scivolano in basso come se raccogliesse un pensiero, poi tornano. Le sue mani si alzano occasionalmente in gesti a palma aperta sotto il mento. La fotocamera la inquadra in un medio close-up all'altezza degli occhi con un 50mm con leggero movimento a mano libera. Calda luce dalla finestra in alto a sinistra, fill arancione dalla lampada da scrivania a destra, soffice rim light che la stacca dallo sfondo. L'audio è la sua voce chiara e ferma con un debole room tone e il morbido ticchettio di un orologio. Atmosfera da intervista documentaristica, grana di pellicola 35mm, color grade caldo.

Input audio

Perché funziona: La precisione del lip-sync dipende da due cose: qualità audio e dettaglio del prompt. Il modello abbina i fonemi alle forme della bocca automaticamente, ma tutto ciò che sta attorno alla bocca – inclinazioni della testa, sollevamenti di sopracciglia, direzione dello sguardo – arriva dal prompt. Senza queste istruzioni di micro-movimento, il volto viene renderizzato come una maschera ferma con una bocca che si muove. L'inquadratura a medio close-up rende il lip-sync leggibile, e la fotocamera statica impedisce al motion blur di oscurare l'articolazione.

Combinare immagine e audio

Genera tre clip text-to-video di «una donna di 30 anni che parla» e otterrai tre donne diverse. L'audio-to-video da solo ha lo stesso problema. Ma fissa il volto con un'immagine di riferimento e il tempismo con l'audio, e ogni clip mostra la stessa persona che consegna lo stesso stile di performance. L'immagine gestisce l'identità, l'audio gestisce la sincronizzazione – il tuo prompt deve solo descrivere come lei si esibisce.

Il personaggio dell'immagine di riferimento parla alla fotocamera, gli occhi che reggono lo spettatore con caldo contatto, poi guardando leggermente fuori campo a destra tra le frasi come se qualcuno fosse seduto vicino. Le sopracciglia si alzano sulle parole chiave, un sorriso genuino si forma nei momenti più leggeri, e le sue mani entrano occasionalmente nell'inquadratura in aperti gesti conversazionali. Tra le frasi fa una pausa, guarda giù brevemente, poi torna allo spettatore con rinnovata concentrazione. La fotocamera la inquadra in un medio close-up, spingendosi dolcemente in avanti lungo la durata della clip con un impercettibile tremolio a mano libera. L'illuminazione dell'immagine di riferimento è preservata per tutta la durata. L'audio è la sua voce calda e articolata con soffice ambient della stanza. Documentario cinematografico, 35mm, scarsa profondità di campo, color grade naturale.

L'immagine definisce già chi e dove. Dirigi tutto il tuo budget di prompt verso descrivere come il personaggio reagisce all'audio.

Riferimento per risoluzione e framing

LTX-2.3 supporta risoluzioni da 512×512 a 1024×1024. Scegliere il rapporto di aspetto giusto conta – una talking head in 1:1 spreca metà del frame in spazio vuoto, mentre un'inquadratura di apertura paesaggistica in 9:16 ritaglia via il paesaggio che stai cercando di mostrare.

Rapporto di aspetto Opzioni di risoluzione Ideale per
16:9 1024×576, 896×512 Dialoghi, interviste, performance, YouTube
9:16 576×1024, 512×896 Reels, TikTok, Stories, lip-sync verticale
2.39:1 960×416, 1024×432 Inquadrature cinematografiche di apertura, estetica filmica
1:1 768×768, 1024×1024 Scatti di prodotto, miniature per social media

Per l'audio-to-video, abbina il tuo conteggio di frame alla durata dell'audio. La formula: frames = round_to_8n+1(audio_seconds × 24). Ecco i valori più comuni:

Durata audio Frame
2 secondi 49
5 secondi 121
8 secondi 193
10 secondi 241

Un mismatch tra lunghezza audio e conteggio di frame fa sì che il modello tagli l'audio o generi frame muti alla fine. Né l'uno né l'altro è ciò che vuoi.

Errori comuni e come risolverli

«Volto da manichino» nell'audio-to-video. Il modello sincronizza le labbra automaticamente, ma il resto del volto resta congelato a meno che tu non descriva micro-espressioni nel prompt. Aggiungi «lievi cenni del capo», «sopracciglia che si alzano sull'enfasi» e «ammiccare naturale tra le frasi». Quelle tre frasi sole fanno la differenza tra una testa parlante robotica e un volto che sembra vivo.

Lip-sync sfasato di ~100ms. Quasi sempre causato da un mismatch frame/audio. Ricalcola usando la formula sopra e verifica che il tuo audio sia esattamente della lunghezza che pensi. Se lo sfasamento persiste, prova ad aggiungere 100ms di silenzio all'inizio del tuo file audio.

Fotocamera troppo veloce per il dialogo. Panning veloci e movimenti a frusta sfocano il volto e rendono il lip-sync illeggibile. Per ogni scena in cui l'articolazione della bocca conta, mantieni la fotocamera statica o usa un lento dolly-in. Riserva il lavoro dinamico di fotocamera alle inquadrature wide e alle performance musicali.

Clip da 10 secondi che perdono identità del personaggio. Alla durata massima (241 frame), il modello deve mantenere la coerenza su molto contenuto generato. L'audio ancora la timeline e dimezza la deriva – anche un prompt text-to-video mediocre produce clip lunghe più coerenti in modalità audio-to-video che senza audio.

Frasi di prompt che funzionano

Un cheat sheet di riferimento rapido per i prompt audio-to-video. Copia ciò che si adatta alla tua scena.

Lip-sync (parlato):

  • movimenti delle labbra perfettamente sincronizzati a ogni fonema

  • pacing conversazionale naturale, non teatrale

  • morbide pause a labbra premute tra le frasi

Micro-espressioni:

  • leggeri sollevamenti di sopracciglia sulle parole chiave

  • piccoli sorrisi che si formano nei momenti caldi

  • cenno appena percettibile che concorda con le proprie affermazioni

Contatto visivo:

  • morbido contatto visivo coinvolto con lo spettatore

  • occhi che occasionalmente scivolano leggermente fuori campo come se stesse pensando

  • contatto visivo intermittente, sguardo in basso riflessivo tra le frasi

Sincronia beat (musica):

  • cenno del capo sui downbeat

  • sollevamento delle spalle a ogni colpo di rullante

  • piede che tiene il tempo sulla cassa

  • corpo che ondeggia con il ritmo

Reazioni agli effetti sonori:

  • sobbalzi sui suoni di impatto forti

  • la testa si gira di scatto verso un suono inaspettato

  • occhi che si spalancano su un effetto sonoro drammatico