FilmoTvor.AI
Volver a las guías

Vídeo

Guía de generación de vídeo LTX-2.3

12 min de lecturaLa mayoría de modelos de vídeo IA adivinan qué movimiento encaja. LTX-2.3 escucha — acepta audio junto al texto y genera vídeo sincronizado con la forma de onda.

La mayoría de modelos de vídeo de IA toman un prompt de texto y adivinan qué movimiento parece correcto. LTX-2.3 escucha. El modelo DiT de 22 mil millones de parámetros de Lightricks acepta audio junto con un prompt de texto y genera vídeo sincronizado con la forma de onda. Los labios de un personaje coinciden con las palabras habladas hasta los fonemas individuales, mientras que los brazos de un baterista caen en cada golpe de caja que contiene el audio.

A través de FilmoTvor.AI, LTX-2.3 funciona en tres modos: texto a vídeo, imagen a vídeo y audio a vídeo. Esta guía recorre la estructura del prompt y los parámetros técnicos en los tres, con seis ejemplos desarrollados y código que puedes ejecutar hoy.

Tres formas de generar vídeo

Cada modo toma una entrada diferente y resuelve un problema distinto.

Los tres comparten los mismos parámetros centrales: 24 fps fijos, 2-10 segundos de salida (49-241 fotogramas), resoluciones de hasta 1024×1024.

Cómo escribir prompts para LTX-2.3

LTX-2.3 responde mejor a los prompts escritos como un único párrafo fluido en presente. Piénsalo como escribir una descripción de plano para un director de fotografía: incluye el sujeto, el entorno, la acción, el comportamiento de la cámara, la iluminación y el estilo, pero entreteje todo de forma natural en lugar de separarlo en secciones etiquetadas.

Intenta cubrir estos elementos en cada prompt: el tipo de plano y la posición de la cámara, la escena y la iluminación, la acción central como una secuencia natural, los detalles del personaje expresados mediante señales físicas, el movimiento de cámara y cualquier descripción de audio.

Escribe en prosa natural, no en listas de palabras clave. «Una mujer de 35 años con pelo oscuro habla a la cámara en una oficina moderna» funciona mejor que «mujer, pelo oscuro, oficina, hablando, 35 años». El modelo analiza las frases como un modelo de lenguaje: el orden de las palabras establece la prioridad, así que empieza con el elemento visual más importante y sé específico con los detalles físicos.

Longitud objetivo del prompt: 60-200 palabras. Por debajo de 60 la salida tiende a un movimiento genérico, mientras que los prompts más cercanos a 200 le dan al modelo suficiente detalle para mantenerse coherente en clips de más de 5 segundos.

Dos reglas que se aplican a todos los modos:

  • Describe los micro-movimientos explícitamente. Sin instrucciones como «sutiles movimientos de cabeza» o «parpadeos naturales», los rostros tienden a congelarse en una mirada de maniquí. El modelo genera el movimiento que le pides: el silencio en el prompt significa quietud en el vídeo.

  • Ajusta el movimiento de cámara al contenido. Los planos estáticos o con dolly lento funcionan mejor para diálogos y primeros planos. Guarda el trabajo de cámara dinámico para planos generales amplios y actuaciones donde el rostro no es el foco.

Texto a vídeo: prompts y ejemplos

El modo texto a vídeo genera una escena completamente a partir de tu descripción. El modelo construye todo a partir del prompt (apariencia y movimiento por igual), lo que lo convierte en la opción correcta para planos generales y escenas atmosféricas donde el control creativo importa más que la consistencia visual.

Ejemplo 1: Plano general cinematográfico

Prompt:

Un plano amplio de un callejón de Tokio iluminado con neón de noche bajo la lluvia. Decenas de letreros brillantes en kanji japonés se reflejan en el asfalto mojado en franjas de rosa, azul y naranja. Sube vapor de los puestos de comida a ambos lados, luz amarilla cálida derramándose por el pavimento. La cámara avanza lentamente por el callejón vacío, los letreros de neón deslizándose a ambos lados, los charcos captando los colores según cambia el ángulo. La lluvia corta el brillo de cada letrero. El audio es fuerte lluvia sobre el pavimento, un zumbido eléctrico bajo de los neones y tráfico de ciudad lejano. 35 mm anamórfico, Kodak Vision3 500T, grano marcado, poca profundidad de campo.

Por qué funciona: un movimiento, una dirección: la cámara avanza y todo lo demás se deriva de eso. Sin personajes que animar, sin cambios de acción a mitad de clip. Los reflejos de neón en el asfalto mojado le dan al modelo interacciones de iluminación concretas en cada superficie, y el paralaje de los letreros deslizándose vende el movimiento hacia delante. Nombrar un tipo de película concreto dirige la gradación de color con más precisión que adjetivos como «cinematográfico» o «atmosférico».

Ejemplo 2: Escena de diálogo entre dos personas

Prompt:

Una acogedora cafetería europea en una tarde lluviosa, vista desde detrás de una mujer de 30 años con un jersey color óxido. Está sentada en una mesa junto a la ventana frente a un hombre de 40 años con americana azul marino que se inclina sobre su taza de café. Sube vapor entre ellos y la lluvia resbala por la ventana de detrás. El hombre gesticula con la mano derecha: «Así que le dije – esto no es cómo funciona nada de esto». Hace una pausa, niega con la cabeza. La mujer se retrasa, brazos cruzados, esbozando una sonrisa. «¿Y te creyó?». El hombre exhala, mira su taza hacia abajo. «Es que ahí está la cosa. No me creyó». Ella se ríe suavemente y alcanza su café. La cámara hace un dolly suave hacia dentro durante la duración del clip con un objetivo de 35 mm. La suave luz de día nublado de la ventana sirve como luz principal, una lámpara colgante cálida por encima añade un relleno naranja. El audio es sus voces con ambiente de cafetería: tazas tintineando, conversación amortiguada, lluvia contra el cristal. Grano de película de 35 mm, paleta apagada desaturada, poca profundidad de campo.

Por qué funciona: el diálogo se divide en frases cortas con actuación física entre ellas: un gesto, una pausa, un movimiento de cabeza. Esto le da a LTX-2.3 una línea temporal latido a latido en lugar de una única instrucción vaga de «hablar». Asignar roles claros (él habla, ella escucha y reacciona) evita que el modelo confunda quién hace qué. El encuadre sobre el hombro mantiene ambos rostros visibles sin exigir una composición compleja. Añadir descripción de audio para el ambiente de la cafetería asienta la escena en un espacio acústico específico.

Imagen a vídeo: animar imágenes fijas

El modo imagen a vídeo toma una imagen de referencia como primer fotograma y genera movimiento a partir de ahí. El prompt describe lo que ocurre después: la imagen gestiona la identidad y la composición, así que te centras por completo en la acción y la cámara.

Recurre a este modo cuando ya tienes un personaje específico o una foto de producto que necesita movimiento. El modelo conserva el rostro, el vestuario y la paleta de colores de la referencia en cada generación.

Dos notas prácticas: el campo first_frame_image admite JPG, PNG, GIF, BMP o WebP de hasta 10 MB. Puedes fijar opcionalmente también un last_frame_image, aunque para la mayoría de casos de uso dejar que el modelo decida el final produce un movimiento más natural.

Ejemplo 3: Retrato que cobra vida

Prompt:

La mujer de la imagen de referencia gira lentamente la cabeza desde un perfil de tres cuartos hasta encarar la cámara directamente. Al girar, sus labios se abren en una sonrisa cálida y un mechón de pelo cae sobre su frente. Levanta la mano y se lo peina detrás de la oreja, luego sostiene la mirada de la cámara con ojos firmes e inquebrantables. La cámara permanece fija a la altura de los ojos en un plano medio cercano con un objetivo de 50 mm, con un suave temblor de cámara en mano. Las sombras suaves se desplazan por sus pómulos según se mueve, conservándose la iluminación de la imagen de referencia durante todo el clip. El audio es una habitación en silencio: suave susurro de tela al moverse, respiración apenas audible, suave zumbido ambiental. Grano de película de 35 mm, poca profundidad de campo, gradación cálida natural.

Imagen de entrada

Por qué funciona: el movimiento se lee como una secuencia que el modelo puede seguir latido a latido: girar, sonreír, recogerse el pelo, contacto visual. Cada acción activa la siguiente. Describir la caída del pelo y el desplazamiento de la sombra le da al modelo consecuencias físicas del giro de cabeza que renderizar, en lugar de depender de un vago «cambio de expresión». La instrucción de conservar la iluminación de referencia evita que el modelo invente una nueva gradación de color a mitad de clip.

Ejemplo 4: Paisaje que cobra vida

Prompt:

El viento ondula por la hierba alta del primer plano, doblando los tallos en olas lentas de izquierda a derecha. Las nubes se deslizan por la cordillera del fondo, sus sombras arrastrándose sobre el verde valle de abajo. Una bandada de pájaros despega desde la línea de árboles de la derecha y se dispersa por el cielo. La cámara avanza lentamente hacia las montañas, la hierba del primer plano saliendo de enfoque mientras los picos lejanos se afilan. La luz solar de la hora dorada desde la izquierda atrapa las puntas de la hierba y los bordes de las nubes. El audio es viento constante a través de la hierba, canto lejano de pájaros y el débil rumor de un río en algún punto por debajo del encuadre. 35 mm, poca profundidad de campo que cambia con el avance, gradación de color cálida natural.

Imagen de entrada

Por qué funciona: los paisajes son uno de los casos de uso más sólidos para img2vídeo porque el modelo solo necesita añadir movimiento orgánico a un encuadre ya compuesto. El viento sobre la hierba, las nubes a la deriva y los pájaros volando son todos movimientos que el modelo gestiona de forma fiable: sin geometría compleja ni física precisa necesaria. El lento avance con enfoque cambiante le da al clip una progresión cinematográfica en lugar de sentirse como un fondo de escritorio animado en bucle. Describir la dirección del viento (de izquierda a derecha) y el movimiento de las sombras de las nubes le da al modelo vectores de movimiento consistentes en todo el encuadre.

Audio a vídeo: sincronizar el movimiento con el sonido

El modelo gestiona el tiempo automáticamente. Tu prompt controla el estilo de interpretación: mapear partes específicas del cuerpo a sonidos específicos y describir las microexpresiones que llenan el espacio entre frases.

Requisitos de audio

Parámetro Requisito
Duración 1-11 segundos (el audio de más de 11 s se rechaza)
Formatos MP3, WAV, OGG, FLAC
Tamaño máximo de archivo 20 MB
Mejor calidad Limpio, loudness normalizado, ruido de fondo mínimo
Voces Una sola voz funciona mejor. El audio con varias voces se sincroniza con la voz dominante

Ajusta tu número de fotogramas a la duración del audio: frames = round_to_8n+1(audio_seconds × 24). Un clip de voz de 5 segundos necesita ~121 fotogramas. Una pista de música de 10 segundos necesita 241.

Ejemplo 5: Retrato hablando con lip-sync

Prompt:

Una mujer de 35 años con pelo oscuro largo y ojos marrones cálidos, maquillaje natural ligero, con una blusa de seda crema, sentada en un escritorio en un estudio doméstico moderno. Suaves estanterías desenfocadas llenan el fondo y una lámpara cálida de escritorio a la derecha proyecta luz de última hora de la tarde sobre su rostro. Habla directamente a la cámara, ladeando ligeramente la cabeza en los puntos clave, levantando las cejas para enfatizar, formándose breves sonrisas entre frases. Sus ojos sostienen el objetivo, luego se desvían hacia abajo como si reuniera un pensamiento, y luego regresan. Sus manos se elevan ocasionalmente en gestos de palmas abiertas bajo la barbilla. La cámara la encuadra en un plano medio cercano a la altura de los ojos con un objetivo de 50 mm y un suave movimiento en mano. Luz cálida de ventana desde arriba a la izquierda, relleno naranja de la lámpara de escritorio a la derecha, suave luz de borde que la separa del fondo. El audio es su voz clara y firme con un débil tono de habitación y el suave tic-tac de un reloj. Sensación de entrevista documental, grano de película de 35 mm, gradación de color cálida.

Entrada de audio

Por qué funciona: la precisión del lip-sync depende de dos cosas: la calidad del audio y el detalle del prompt. El modelo empareja los fonemas con las formas de la boca automáticamente, pero todo lo que rodea la boca (inclinaciones de cabeza, levantamiento de cejas, dirección de la mirada) proviene del prompt. Sin estas instrucciones de micro-movimiento, el rostro se renderiza como una máscara inmóvil con una boca que se mueve. El encuadre de plano medio cercano hace legible el lip-sync, y la cámara estática evita que el desenfoque de movimiento oculte la articulación.

Combinar imagen y audio

Genera tres clips de texto a vídeo de «una mujer de 30 años hablando» y obtendrás tres mujeres diferentes. El audio a vídeo por sí solo tiene el mismo problema. Pero fija el rostro con una imagen de referencia y el tiempo con audio, y cada clip muestra a la misma persona entregando el mismo estilo de interpretación. La imagen gestiona la identidad, el audio gestiona la sincronización: tu prompt solo necesita describir cómo actúa ella.

El personaje de la imagen de referencia habla a la cámara, los ojos sosteniendo al espectador con un contacto cálido, luego mirando ligeramente fuera de cámara hacia la derecha entre frases como si alguien estuviera sentado cerca. Sus cejas se elevan en las palabras clave, se forma una sonrisa genuina en los momentos más ligeros y sus manos entran ocasionalmente en el encuadre en gestos conversacionales abiertos. Entre frases hace una pausa, mira brevemente hacia abajo, luego regresa al espectador con un foco renovado. La cámara la encuadra en un plano medio cercano, avanzando suavemente durante la duración del clip con un imperceptible temblor en mano. La iluminación de la imagen de referencia se conserva durante todo el clip. El audio es su voz cálida y articulada con suave ambiente de habitación. Documental cinematográfico, 35 mm, poca profundidad de campo, gradación de color natural.

La imagen ya define quién y dónde. Destina todo tu presupuesto de prompt a describir cómo responde el personaje al audio.

Referencia de resolución y encuadre

LTX-2.3 admite resoluciones de 512×512 a 1024×1024. Elegir la relación de aspecto correcta importa: una cabeza parlante en 1:1 desperdicia la mitad del encuadre en espacio vacío, mientras que un plano general de paisaje en 9:16 recorta el paisaje que intentas mostrar.

Relación de aspecto Opciones de resolución Mejor para
16:9 1024×576, 896×512 Diálogo, entrevistas, actuación, YouTube
9:16 576×1024, 512×896 Reels, TikTok, Stories, lip-sync vertical
2.39:1 960×416, 1024×432 Planos generales cinematográficos, estética de cine
1:1 768×768, 1024×1024 Fotos de producto, miniaturas para redes sociales

Para audio a vídeo, ajusta tu número de fotogramas a la duración del audio. La fórmula: frames = round_to_8n+1(audio_seconds × 24). Aquí están los valores más comunes:

Duración de audio Fotogramas
2 segundos 49
5 segundos 121
8 segundos 193
10 segundos 241

Una discrepancia entre la duración del audio y el número de fotogramas hace que el modelo recorte el audio o genere fotogramas mudos al final. Ninguna de las dos es lo que quieres.

Errores comunes y cómo solucionarlos

«Rostro de maniquí» en audio a vídeo. El modelo sincroniza los labios automáticamente, pero el resto del rostro permanece congelado a menos que describas microexpresiones en el prompt. Añade «sutiles movimientos de cabeza», «las ceñas se elevan al enfatizar» y «parpadeos naturales entre frases». Esas tres frases por sí solas son la diferencia entre una cabeza parlante robótica y un rostro que parece vivo.

Lip-sync desplazado ~100 ms. Casi siempre causado por una discrepancia entre fotogramas y audio. Recalcula usando la fórmula anterior y verifica que tu audio es exactamente de la longitud que crees. Si el desplazamiento persiste, prueba a añadir 100 ms de silencio al principio de tu archivo de audio.

Cámara demasiado rápida para el diálogo. Las panorámicas rápidas y los movimientos de latigo desenfocan el rostro y hacen ilegible el lip-sync. Para cualquier escena donde la articulación de la boca importe, mantén la cámara estática o usa un dolly lento hacia dentro. Guarda el trabajo de cámara dinámico para planos amplios y actuaciones musicales.

Clips de 10 segundos que pierden la identidad del personaje. A la duración máxima (241 fotogramas), el modelo tiene que mantener la consistencia a lo largo de mucho contenido generado. El audio ancla la línea temporal y reduce el desplazaje a la mitad: incluso un prompt mediocre de texto a vídeo produce clips largos más coherentes en el modo audio a vídeo que sin audio.

Frases de prompt que funcionan

Una hoja de referencia rápida para prompts de audio a vídeo. Copia lo que encaje con tu escena.

Lip-sync (habla):

  • movimientos labiales perfectamente sincronizados con cada fonema

  • ritmo conversacional natural, no teatral

  • suaves pausas de labios apretados entre frases

Microexpresiones:

  • sutiles levantamientos de cejas en las palabras clave

  • pequeñas sonrisas formándose en los momentos cálidos

  • un asentimiento apenas perceptible que acompaña las propias afirmaciones

Contacto visual:

  • suave contacto visual comprometido con el espectador

  • ojos que se desvían ocasionalmente un poco fuera de cámara como si pensara

  • contacto visual intermitente, mirando hacia abajo reflexivamente entre frases

Sincronización de compás (música):

  • movimiento de cabeza en los tiempos fuertes

  • subida de hombro en cada golpe de caja

  • golpe de pie en el bombo

  • cuerpo balanceándose con el ritmo

Reacciones a efectos de sonido:

  • se estremece en los sonidos de impacto fuertes

  • la cabeza gira hacia el sonido inesperado

  • los ojos se abren en el efecto de sonido dramático