Väčšina AI video modelov prijme textový prompt a len háda, aký pohyb bude vyzerať správne. LTX-2.3 počúva. 22-miliardový DiT model od Lightricks prijíma spolu s textovým promptom aj audio a generuje video synchronizované s waveformou. Pery postavy sa prispôsobia hovoreným slovám až na úroveň jednotlivých fonémov, kým ruky bubeníka dopadnú na každý úder virblu, ktorý audio obsahuje.
Cez FilmoTvor.AI beží LTX-2.3 v troch režimoch: text-to-video, image-to-video a audio-to-video. Tento sprievodca prechádza štruktúrou promptu a technickými parametrami vo všetkých troch, so šiestimi rozobranými príkladmi a kódom, ktorý môžete spustiť ešte dnes.
Tri spôsoby generovania videa
Každý režim prijíma iný vstup a rieši iný problém.
Všetky tri zdieľajú rovnaké základné parametre: 24 fps fixne, 2–10 sekúnd výstupu (49–241 snímok), rozlíšenia až do 1024×1024.
Ako písať prompty pre LTX-2.3
LTX-2.3 najlepšie reaguje na prompty napísané ako jeden súvislý odstavec v prítomnom čase. Považujte to za písanie opisu záberu pre kameramana – zahrňte subjekt, prostredie, akciu, správanie kamery, osvetlenie a štýl, ale prepleťte ich prirodzene namiesto oddeľovania do označených sekcií.
Snažte sa v kažnom prompte pokryť tieto prvky: typ záberu a pozícia kamery, scéna a osvetlenie, jadrová akcia ako prirodzená sekvencia, detaily postavy vyjadrené fyzickými náznakmi, pohyb kamery a prípadný opis audia.
Píšte v prirodzenej próze, nie zoznamoch kľúčových slov. „35-ročná žena s tmavými vlasmi hovorí do kamery v modernej kancelárii“ funguje lepšie než „žena, tmavé vlasy, kancelária, hovorenie, 35r.“ Model parsuje vety ako jazykový model – poradie slov určuje prioritu, takže začnite najdôležitejším vizuálnym prvkom a buďte konkrétni ohľadom fyzických detailov.
Cieľová dĺžka promptu: 60–200 slov. Pod 60 sa výstup prikláňa k generickému pohybu, kým prompty bližšie k 200 dávajú modelu dostatok detailov na udržanie súdržnosti naprieč klipmi nad 5 sekúnd.
Dve pravidlá, ktoré platia naprieč všetkými režimami:
Opisujte mikropohyby explicitne. Bez inštrukcií ako „jemné prikyvnutie hlavou“ či „prirodzené žmurkanie“ majú tváre tendenciu zamrznúť do manekýnskeho pohľadu. Model generuje pohyb, o ktorý požiadate – ticho v prompte znamená nehybnosť vo videu.
Prispôsobte pohyb kamery obsahu. Statické zábery alebo pomalé dolly fungujú najlepšie pre dialóg a detaily. Dynamickú kameru si nechajte na široké ustanovacie zábery a výkony, kde tvár nie je ohniskom.
Text-to-video: prompty a príklady
Text-to-video generuje scénu výlučne z vášho opisu. Model buduje všetko z promptu – vzhľad aj pohyb – čo z neho robí správnu voľbu pre ustanovacie zábery a atmosférické scény, kde na kreatívnu kontrolu záleží viac než na vizuálnej konzistencii.
Príklad 1: Filmový ustanovací záber
Prompt:
Široký záber neónmi osvetlenej tokijskej uličky v noci v daždi. Desiatky svetelných nápisov v japonských znakoch sa odrážajú v mokrom ashalte v prúžkoch ružovej, modrej a oranžovej. Para stúpa z jedálnych stánkov po oboch stranách, teplé žlté svetlo sa rozlieva cez dlažbu. Kamera pomaly pláchta vpred po prázdnej uličke, neónové nápisy sa zosúvajú popri oboch stranách, kaluže chytajú farby pri zmene uhla. Dážď presekáva žiarou každého nápisu. Audiu je ťažký dážď na dlažbe, nízke elektrické bzučanie z neónov a vzdialená mestská doprava. 35mm anamorfický, Kodak Vision3 500T, ťažké zrnko, plytká hĺbka ostrosti.
Prečo to funguje: Jeden pohyb, jeden smer – kamera pláchta vpred a všetko ostatné z toho vyplynie. Žiadne postavy na animovanie, žiadne zmeny akcie v polovici klipu. Odrazy neónov v mokrom ashalte dávajú modelu konkrétne interakcie osvetlenia na každom povrchu a parallax znakov sa zosúvajúcich popri zornecku predáva pohyb vpred. Pomenovanie konkrétneho typu filmu riadi farebný grading presnejšie než prídavné mená ako „filmový“ alebo „náladový“.
Príklad 2: Dvojpersonážna dialógová scéna
Prompt:
Útulná európska kaviareň v daždivom popoludní, videná zozadu 30-ročnej ženy vo svetle hrdzavej farby svetri. Sedí pri stolíku pri okne oproti 40-ročnému mužovi v námornícky modrom saku, ktorý sa nakláňa vpred nad svojím šálkom kávy. Medzi nimi stúpa para a za nimi po okne steká dážď. Muž gestikuluje pravou rukou: „Tak som mu povedal – tohle nefunguje takto.“ Zastaví sa, potrasie hlavou. Žena sa oprie, skrížené ruky, formuje sa úškrn. „A uveril ti?“ Muž vydýchne, pozrie dole na svoj šálak. „To je ten pointa. Neuveril.“ Ona sa ticho zasmije a siahne po svojej káve. Kamera počas trvania klipu jemne nasúva dopredu na 35mm objektíve. Mäkké zamračené denné svetlo z okna slúži ako hlavné svetlo, teplá visutá lampa nad hlavou pridáva oranžové vyplnenie. Audiu sú ich hlasy s kaviarenským ambientom – cinkanie šálok, tlmená konverzácia, dážď o sklo. 35mm filmové zrnko, tlmená desaturovaná paleta, plytká hĺbka ostrosti.
Prečo to funguje: Dialóg je rozbitý na krátke frázy s fyzickým herectvom medzi nimi – gesto, pauza, potrasenie hlavou. To dáva LTX-2.3 beat-po-beate časovú os namijednojnej vagnej inštrukcie „rozprávaj sa“. Priradenie jasných rolí (on hovorí, ona počúva a reaguje) bráni modelu v pomätení, kto robí čo. Rámovanie cez rameno drží obe tváre viditeľné bez nutnosti komplexného rozloženia. Pridanie opisu audia pre kaviarenský ambient ukotjuje scénu v konkrétnom akustickom priestore.
Image-to-video: oživovanie statických obrázkov
Image-to-video berie referenčný obrázok ako prvú snímku a generuje odtiaľ pohyb. Prompt opisuje, čo sa stane ďalej – obrázok sa postará o identitu a kompozíciu, takže sa sústredíte výhradne na akciu a kameru.
Siahnite po tomto režime, keď už máte konkrétnu postavu alebo produktový záber, ktorý potrebuje pohyb. Model zachováva tvár, šatník a farebnú paletu z referencie naprieč každou generáciou.
Dve praktické poznámky: pole first_frame_image prijíma JPG, PNG, GIF, BMP alebo WebP do 10 MB. Voliteľne môžete pripnúť aj last_frame_image, hoci pre väčšinu prípadov použitia prináša prirodzenejší pohyb, keď koniec nechá na model.
Príklad 3: Portrét oživá
Prompt:
Žena z referenčného obrázku pomaly otáča hlavu z trojštvrťového profilu, aby sa postavila priamo tvárou ku kamere. Pri otáčaní sa jej pery rozostúpia do teplého úsmevu a prameň vlasov jej spadne cez čelo. Siahne hore a založí si ho za ucho, potom upriavi pohľad do kamery pevnými, neochvejnými očami. Kamera zostáva zamknutá na úrovni očí v strednom detaile na 50mm objektíve, s jemným handheldom triasom. Mäkké tiene sa posúvajú po jej lícnych kostiach pri pohybe, osvetlenie z referenčného obrázku je zachované počas celého klipu. Audiu je tichá miestnosť – mäkký šuchot látky pri pohybe, slabý dych, jemné ambientné bzučanie. 35mm filmové zrnko, plytká hĺbka ostrosti, teplý prirodzený grading.
Vstupný obrázok

Prečo to funguje: Pohyb sa číta ako sekvencia, ktorú môže model nasledovať beat po beate – otoč, usmej sa, založ si vlasy, očný kontakt. Každá akcia spúšťa ďalšiu. Opis padajúcich vlasov a posunu tieňa dáva modelu fyzické dôsledky otočenia hlavy na rendrovanie namiesto spoliehania sa na vagne „zmena výrazu“. Inštrukcia zachovať referenčné osvetlenie bráni modelu vymyslieť nový farebný grading v polovici klipu.
Príklad 4: Krajina oživá
Prompt:
Vietor sa preháňa vysokou trávou v popredí a ohýba steblá v pomalých vlnách zľava doprava. Oblaky sa vznášajú cez pohorie v pozadí, ich tiene plazia sa nad zeleným údolím dolu. Kŕdeľ vtákov vzlietava z lesného pásu vpravo a rozptyľuje sa po oblohe. Kamera pomaly nasúva smerom k horám, tráva v popredí stráca ostrosť, zatiaľ čo vzdialené vrcholy sa zaostrujú. Zlatohodinové slnečné svetlo zľava chytá špičky trávy a okraje oblakov. Audiu je vyrovnaný vietor cez trávu, vzdialený vtáčí spev a slabý šum rieky niekde dolu pod záberom. 35mm, plytká hĺbka ostrosti meniaca sa s nasúvaním, teplý prirodzený farebný grading.
Vstupný obrázok

Prečo to funguje: Krajiny sú jedným z najsilnejších prípadov použitia pre img2video, pretože model potrebuje pridať organický pohyb do už skomponovaného záberu. Vietor cez trávu, plávajúce oblaky a letiace vtáky sú všetko pohyby, ktoré model zvláda spoľahlivo – bez komplexnej geometrie alebo presnej fyziky. Pomalé nasúvanie s posunom zaostrenia dáva klipu filmovú progresiu namiesto pocitu opakujúcej sa animovanej tapety. Opis smeru vetra (zľava doprava) a pohybu tieňov oblakov dáva modelu konzistentné vektory pohybu naprieč celým záberom.
Audio-to-video: synchronizácia pohybu so zvukom
Načasovanie rieši model automaticky. Váš prompt riadi štýl výkonu: mapovanie konkrétnych častí tela na konkrétne zvuky a opis mikroexpresií, ktoré vyplňujú priestor medzi frázami.
Požiadavky na audio
| Parameter | Požiadavka |
|---|---|
| Dĺžka | 1–11 sekúnd (audio nad 11s je odmietnuté) |
| Formáty | MP3, WAV, OGG, FLAC |
| Max. veľkosť súboru | 20 MB |
| Najlepšia kvalita | Čisté, normalizovaná hlasitosť, minimálny šum pozadia |
| Hovoriaci | Jediný hovoriaci funguje najlepšie. Audio s viacerými hovoriacimi sa synchronizuje na dominantný hlas |
Zarovnajte počet snímok na dĺžku audia: frames = round_to_8n+1(audio_seconds × 24). 5-sekundový hlasový klip potrebuje ~121 snímok. 10-sekundová hudobná stopa potrebuje 241.
Príklad 5: Lip-syncovaný hovoriaci portrét
Prompt:
35-ročná žena s dlhými tmavými vlasmi a teplými hnedými očami, jemný prirodzený make-up, oblečená v krémovej hodvábnej blúzke, sedí za stolom v modernej domácej kancelárii. Mäkké rozmazané knižné police vyplňujú pozadie a teplá stolná lampa vpravo vrhá neskoré popoludňajšie svetlo cez jej tvár. Hovorí priamo do kamery, jej hlava sa mierne nakláňa na kľúčových bodoch, obočie stúpa pre dôraz, medzi frázami sa formujú krátke úsmevy. Jej oči udržiavajú objektív, potom odídu dole, akoby zbierali myšlienku, a vrátia sa. Jej ruky občas vystupujú v otvorených dlaňových gestách pod bradou. Kamera ju rámuje v strednom detaile na úrovni očí na 50mm objektíve s jemným handheldovým pohybom. Teplé okenné svetlo zľava hore, oranžové vyplnenie zo stolnej lampy vpravo, mäkké kontúrované svetlo oddeľujúce ju od pozadia. Audiu je jej jasný, vyrovnaný hlas so slabým tónom miestnosti a mäkkým tikotom hodín. Pocit dokumentárneho rozhovoru, 35mm filmové zrnko, teplý farebný grading.
Audio vstup
Prečo to funguje: Presnosť lip-syncu závisí od dvoch vecí: kvality audia a detailu promptu. Model automaticky mapuje fonémy na tvary úst, ale všetko okolo úst – nakláňanie hlavy, dvíhanie obočia, smer pohľadu – prichádza z promptu. Bez týchto inštrukcií o mikropohybe sa tvár renderuje ako statická maska s pohybujúcimi sa ústami. Rámovanie v strednom detaile robí lip-sync čitateľným a statická kamera bráni pohybovému rozmazaniu v zakrytí artikulácie.
Kombinovanie obrázku a audia
Vygenerujte tri text-to-video klipy „30-ročnej ženy hovoriacej“ a dostanete tri rôzne ženy. Samotné audio-to-video má rovnaký problém. Ale pripnite tvár referenčným obrázkom a načasovanie audiom, a každý klip ukáže tú istú osobu dodávajúcu ten istý štýl výkonu. Obrázok sa postará o identitu, audio o synchronizáciu – váš prompt potrebuje opísať len ako vystupuje.
Postava z referenčného obrázku hovorí do kamery, oči udržiavajú diváka teplým kontaktom, potom sa medzi frázami pozerá mierne mimo kamery vpravo, akoby niekto sedel nablízku. Jej obočie stúpa na kľúčových slovách, na ľahších chvíľach sa formuje úprimný úsmev a jej ruky občas vstúpia do záberu v otvorených konverzačných gestách. Medzi vetami sa zastaví, krátko pozrie dole, potom sa vráti k divákovi s obnoveným zameraním. Kamera ju rámuje v strednom detaile, jemne nasúva počas trvania klipu s nebadateľným handheldovým triasotm. Osvetlenie z referenčného obrázku je zachované počas celého klipu. Audiu je jej teplý, artikulovaný hlas s mäkkým ambientom miestnosti. Filmový dokument, 35mm, plytká hĺbka ostrosti, prirodzený farebný grading.
Obrázok už definuje, kto a kde. Usmerňte celý svoj promptový rozpočet na opis toho, ako postava reaguje na audio.
Referencia rozlíšenia a rámovania
LTX-2.3 podporuje rozlíšenia od 512×512 do 1024×1024. Výber správneho pomeru strán záleží – hovoriaca hlava v 1:1 plytvá polovicou záberu na prázdny priestor, zatiaľ čo krajinný ustanovací záber v 9:16 odreze scénu, ktorú sa snažíte ukázať.
| Pomer strán | Možnosti rozlíšenia | Najlepšie na |
|---|---|---|
| 16:9 | 1024×576, 896×512 | Dialóg, rozhovory, výkon, YouTube |
| 9:16 | 576×1024, 512×896 | Reels, TikTok, Stories, vertikálny lip-sync |
| 2.39:1 | 960×416, 1024×432 | Filmové ustanovacie zábery, filmová estetika |
| 1:1 | 768×768, 1024×1024 | Produktové zábery, náhľady na sociálne siete |
Pre audio-to-video prispôsobte počet snímok dĺžke audia. Vzorec: frames = round_to_8n+1(audio_seconds × 24). Tu sú najbežnejšie hodnoty:
| Dĺžka audia | Snímky |
|---|---|
| 2 sekundy | 49 |
| 5 sekúnd | 121 |
| 8 sekúnd | 193 |
| 10 sekúnd | 241 |
Nesúlad medzi dĺžkou audia a počtom snímok spôsobuje, že model buď skráti audio, alebo vygeneruje tiché snímky na konci. Ani jedno nie je to, čo chcete.
Časté chyby a ako ich opraviť
„Manekýnska tvár“ v audio-to-video. Model synchronizuje pery automaticky, ale zvyšok tváre zostáva zamrznutý, pokiaľ v promptе neopíšete mikroexpresie. Pridajte „jemné prikyvnutie hlavou“, „dvíhanie obočia pri dôraze“ a „prirodzené žmurkanie medzi frázami“. Samotné tieto tri frázy sú rozdielom medzi robotickou hovoriacou hlavou a tvárou, ktorá pôsobí živo.
Posun lip-syncu o ~100ms. Takmer vždy spôsobený nesúladom snímok/audia. Prepočítajte pomocou vyššie uvedeného vzorca a overte, že vaše audio je presne tak dlhé, ako si myslíte. Ak posun pretrváva, skúste pridať 100ms ticha na začiatok vášho audio súboru.
Príliš rýchla kamera pre dialóg. Rýchle pan a bičovité pohyby rozmazú tvár a robia lip-sync nečitateľným. Pre akúkoľvek scénu, kde záleží na artikulácii úst, držte kameru statickú alebo použite pomalé dolly-in. Dynamickú kameru si nechajte na široké zábery a hudobné výkony.
10-sekundové klipy strácajúce identitu postavy. Pri maximálnej dĺžke (241 snímok) musí model udržiavať konzistenciu naprieč veľkým množstvom generovaného obsahu. Audio ukotjuje časovú os a znižuje drift na polovicu – dokonca aj priemerný text-to-video prompt produkuje súdržnejšie dlhé klipy v režime audio-to-video než bez audia.
Frázy v promptoch, ktoré fungujú
Rýchly referenčný tahák pre audio-to-video prompty. Skopírujte, čo sedí k vašej scéne.
Lip-sync (reč):
pohyby pier dokonale synchronizované s každou fonémom
prirodzené konverzačné tempo, nie divadelné
mäkké pauzy so stlačenými perami medzi frázami
Mikroexpresie:
jemné dvíhanie obočia na kľúčových slovách
malé úsmevy formujúce sa v teplých chvíľach
sotva badateľné prikytnutie súhlasiac s vlastnými výrokmi
Očný kontakt:
mäkký angažovaný očný kontakt s divákom
oči občas mierne odchádzajú mimo kamery, akoby premýšľali
prerušovaný očný kontakt, s pohľadom dole reflektívne medzi frázami
Beat-sync (hudba):
prikytnutie hlavou na downbeatoch
zdvih ramena pri každom údere virblu
poklepanie nohou na kick drum
kývanie telom s rytmom
Reakcie na zvukové efekty:
trhnutie pri hlasných úderových zvukoch
hlavou trhne smerom k nečakanému zvuku
oči sa rozšíria pri dramatickom zvukovom efekte
