FilmoTvor.AI
Volver a las guías

Generación de imágenes

Guía de prompting para Z-Image Turbo: fórmula, consejos y 5 prompts de ejemplo

7 min de lecturaLa sintaxis «1girl, solo, masterpiece» se creó para Stable Diffusion. Z-Image habla otro idioma — oraciones naturales y detalles al frente.

Escribes «1girl, solo, masterpiece, best quality» en Z-Image Turbo y te preguntas por qué la salida parece genérica. Esa sintaxis de prompt se creó para Stable Diffusion. Z-Image habla un lenguaje completamente distinto.

Bajo el capó, es un transformador de difusión de flujo único de 6 mil millones de parámetros (S3-DiT) que procesa los tokens de texto e imagen en una sola secuencia unificada. En lugar de analizar etiquetas separadas por comas, lee tu prompt como un humano lee una frase.

A continuación: lo que el modelo espera, una fórmula de prompt reutilizable y cinco prompts que puedes adaptar para tus propias generaciones.

Por qué los viejos hábitos de prompting fallan aquí

Si has pasado meses ajustando tu flujo de trabajo de Stable Diffusion (sintaxis de etiquetas, prompts negativos abundantes, ajuste del guidance scale), Z-Image Turbo te resultará desconocido. Tres cosas son fundamentalmente diferentes.

El modelo entiende frases. Z-Image se entrenó con descripciones en lenguaje natural en inglés y chino simultáneamente. Escribe una descripción, no una lista de la compra.

El número de pasos importa menos de lo que esperarías. La variante Turbo se destiló para 8 pasos de muestreo: ese es el punto óptimo de producción. Subirlo a 40 puede introducir artefactos tipo rejilla en lugar de mejorar la calidad. Usa 4 pasos para pruebas A/B rápidas, 8 para la salida final.

¿Y el guidance scale? No lo tocas. La destilación Turbo (Decoupled-DMD) integró el guidance directamente en los pesos, así que tu prompt hace toda la dirección.

La fórmula de prompt de 6 partes

Todo prompt sólido de Z-Image sigue el mismo esqueleto. No necesitas las seis partes cada vez, pero conocer la estructura completa te ayuda a diagnosticar resultados débiles.

  • Sujeto: quién o qué, con detalles específicos. Edad, ropa, pelo, accesorios. Para varios sujetos, describe cada uno por separado.

  • Escena: dónde ocurre. Z-Image tiene un fuerte conocimiento geográfico, especialmente de localizaciones de Asia Oriental y Europa. «Un estrecho callejón de Shibuya a medianoche con vapor saliendo de una tienda de ramen» produce una salida más coherente que «calle japonesa de noche».

  • Composición: tipo de plano, encuadre, relación de aspecto. El modelo responde al lenguaje de cámara: «plano medio», «primer plano», «gran angular». Especifica una distancia focal si quieres control: «85 mm f/1.4» produce una imagen diferente a «24 mm f/2.8».

  • Iluminación: la única variable que más afecta a la salida de Z-Image. «Suave luz difusa de día nublado» y «iluminación de estudio de tres puntos» producen resultados dramáticamente distintos. Nombra la fuente, su dirección, su calidad.

  • Estilo: elige UN medio dominante. «Fotografía analógica en película» o «ilustración anime con sombreado cel» o «pintura al óleo con pinceladas visibles». Mezclar tres estilos a la vez confunde a cualquier modelo.

  • Restricciones: lo que NO debe aparecer. Como los prompts negativos funcionan distinto aquí (más sobre eso abajo), integra tus restricciones directamente: «sin marca de agua, sin texto adicional, anatomía correcta».

El punto óptimo es 30-120 palabras de descripción estructurada en lenguaje natural.

Prompts negativos: menos es más

El pipeline estándar de código abierto ignora los prompts negativos por completo porque el guidance está fijado a cero. A través del pipeline de FilmoTvor.AI, los prompts negativos SÍ se respetan, pero funcionan de manera distinta que en SD 1.5.

La regla: sé específico, sé minimalista. Dos o tres defectos concretos que realmente ves en tus generaciones. «Extremidades extra, texto deformado» es útil. El clásico muro de texto «low quality, blurry, bad anatomy, worst quality, jpeg artifacts, ugly» perjudica activamente: distrae al modelo sin mejorar la salida.

Un caso límite importante: si necesitas prohibir que aparezcan caracteres chinos (o viceversa), pon esa instrucción en el prompt POSITIVO. «Solo texto en inglés, sin caracteres chinos en el cartel» funciona mejor como dirección positiva que como restricción negativa.

El superpoder bilingüe

La mayoría de desarrolladores lo pasa por alto por completo. Z-Image renderiza caracteres CJK y texto latino de forma legible en la misma imagen. Pide a FLUX que renderice kanji y obtendrás ruido visual; Z-Image lee ambos sistemas y produce tipografía limpia.

Piensa en etiquetas de producto que mezclan japonés e inglés, o letreros de neón con caracteres chinos y latinos. Si tu app sirve a mercados multilingües, esta es la razón para elegir Z-Image.

Para usarlo, pon el texto exacto que quieres renderizar entre comillas dentro de tu prompt: the sign reads "夜市 / NIGHT MARKET". Describe la tipografía por separado: «caracteres en neón rojo bold arriba, fuente inglesa más fina debajo». El modelo gestiona ambos sistemas con un renderizado consistente.

5 prompts que puedes copiar ahora mismo

Cada prompt va dirigido a un caso de uso distinto. Todos están probados a 8 pasos, resolución 1024×1024.

1. Retrato editorial

Un retrato editorial sereno de una mujer japonesa de 28 años con pelo negro corto cortado a lo bob y pecas sutiles, llevando un abrigo holgado de lana beige sobre un cuello alto blanco, de pie frente a un muro minimalista de hormigón en el distrito tokiota de Aoyama durante una llovizna, suave luz difusa de día nublado, gotas de lluvia en los hombros de su abrigo, tomada con Sony A7R IV con 85 mm f/1.4 GM, poca profundidad de campo, paleta de colores fría y apagada, emulación de película Fujifilm Pro 400H, ambiente contemplativo y calmado.

Por qué funciona: Nombrar un cuerpo de cámara específico y una emulación de película ancla toda la paleta de colores. La descripción meteorológica («durante una llovizna, gotas de lluvia en su abrigo») le da a Z-Image señales atmosféricas que gestiona excepcionalmente bien.

Prueba a cambiar: Sustituye «Fujifilm Pro 400H» por «Kodak Portra 800» para pasar de tonos fríos apagados a un grano más cálido.

2. Foto de producto con etiqueta bilingüe

Packshot comercial de una lata premium de té matcha: aluminio cilíndrico cepillado con una etiqueta esmeralda minimalista que reza «UJI MATCHA 宇治抹茶» en tipografía mixta de kanji japonés y latino, sutiles gotas de condensación en la superficie, colocada sobre una superficie pulida de madera de nogal oscuro, dos batidores de bambú esparcidos y un cuenco chawan de cerámica medio lleno de espuma de matcha verde brillante a la izquierda, suave luz cenital de softbox con una luz de borde dorada desde arriba a la derecha, sombra limpia, fondo en degradado gris medio neutral, tomada con Phase One IQ4 con macro de 80 mm a f/9, fotografía comercial de alimentación.

Por qué funciona: Este pone a prueba el mayor diferenciador de Z-Image: el renderizado de texto bilingüe. Los kanji 宇治抹茶 y el latino «UJI MATCHA» aparecen legiblemente en la misma etiqueta. La mayoría de modelos de código abierto suspenden esta prueba por completo.

Prueba a cambiar: Sustituye el producto por el tuyo: la fórmula (objeto + superficie + atrezzo + iluminación + cámara) se transfiere directamente a cualquier packshot.

3. Banner para redes sociales (16:9)

Un amplio panorama cinematográfico de un fotógrafo solitario de pie al borde de una playa volcánica de arena negra en Islandia, dramáticos farallones basálticos emergiendo del océano en el plano medio, olas blancas estrellándose contra rocas oscuras, cielo plateado nublado con una única abertura de luz dorada en el horizonte, tomada con objetivo gran angular de 24 mm, f/8, gran profundidad de campo, tonos fríos desaturados con acento cálido en las luces, fotografía editorial de paisaje.

Por qué funciona: La instrucción de gran angular de 24 mm combinada con «gran profundidad de campo» le dice al modelo que mantenga toda la escena nítida, algo crítico para banners donde primer plano y fondo importan por igual. Z-Image gestiona texturas geológicas (basalto, arena mojada, rocío del océano) con gran detalle. Ejecuta esto a 1536×640 para un verdadero panorama cinematográfico.

Prueba a cambiar: Pon la resolución a 1280×720 para una miniatura estándar de YouTube 16:9, o 720×1280 para una historia de Instagram.

4. Cartel de neón con texto bilingüe

Un callejón de Shanghái bajo la lluvia a medianoche, un cartel de neón vertical colgado de una pared de ladrillo, el cartel brilla con caracteres rojos y rosas bold «夜市 / NIGHT MARKET»: caracteres chinos arriba, traducción al inglés debajo en una fuente de tubo de neón más fina, reflejos en el pavimento mojado, grano de película cinematográfico, poca profundidad de campo 35 mm f/1.4, tonos cyberpunk apagados, bruma atmosférica cargada, un viandante silueteado alejándose a la derecha, paleta de colores inspirada en Wong Kar-wai.

Por qué funciona: Dos sistemas, dos estilos tipográficos, renderizados de forma consistente en una sola imagen. La «paleta de colores inspirada en Wong Kar-wai» es una abreviatura sorprendentemente eficaz: Z-Image entiende los estilos de dirección como referencias de color y ambiente.

Prueba a cambiar: Sustituye «Shanghái» por «Taipéi» o «Hong Kong» para fondos arquitectónicos claramente distintos manteniendo la misma estética de neón.

5. Anime / Ilustración

Una exuberante ilustración anime con sombreado cel al estilo de las producciones del estudio KyoAni: una estudiante de instituto con uniforme de verano blanco de pie en un paso elevado de tren a la hora dorada, mirando hacia abajo las vías del tren, el viento soplando su largo pelo castaño, luz de contraluz cálida en el borde de su silueta, nubes de algodón en un cielo de degradado de naranja a rosa, detalles dibujados a mano, suaves sangrados de color, composición centrada de cintura para arriba.

Por qué funciona: Nombrar un estilo de estudio específico («KyoAni») fija una estética precisa sin copiar un solo título. Las señales atmosféricas (luz de contraluz de la hora dorada, viento en el pelo, cielo en degradado) son rasgos del iyashikei que Z-Image interpreta con gran fidelidad. Este prompt también demuestra que Z-Image gestiona la ilustración estilizada tan bien como el fotorrealismo.

Prueba a cambiar: Sustituye «KyoAni» por «Makoto Shinkai» para obtener una iluminación más dramática y cielos saturados, o «inspirado en Ghibli» para un trazado más suave y pictórico.