FLUX.2 Klein no sigue las mismas reglas que Stable Diffusion ni siquiera que su predecesor, FLUX.1. Black Forest Labs construyó este modelo desde cero sobre una nueva arquitectura MMDiT, sustituyendo el antiguo codificador de texto T5+CLIP por Qwen3. El resultado es un modelo de generación de imágenes que lee tus prompts más como un LLM que como un modelo de difusión.
Esta guía desglosa cómo FLUX.2 Klein interpreta los prompts, recorre cinco ejemplos reales con salidas generadas.
Qué hace diferente a FLUX.2 Klein
Tres decisiones de arquitectura definen cómo deberías hacer prompts a este modelo.
Codificador de texto Qwen3. Mientras que FLUX.1 usaba T5+CLIP para analizar tu prompt, FLUX.2 Klein lo procesa con Qwen3, un modelo de lenguaje multilingüe que entiende relaciones espaciales, condiciones lógicas y descripciones de varias frases hasta 512 tokens. Puedes escribir «un gato sosteniendo un cartel donde el texto coincide con el color de los ojos del gato» y el modelo realmente intentará esa relación.
Generación fija de 4 pasos. El modelo fue destilado por pasos para producir su mejor salida en exactamente 4 pasos de inferencia. Cambiar este número no mejorará la calidad: la romperá. Piénsalo como una función que hace que cada imagen cueste la misma cantidad predecible de cómputo.
Sin prompt negativo, sin guidance scale. No tienes una palanca de «evita esto». Cada instrucción tiene que formularse en positivo: en lugar de «sin desenfoque», escribe «enfoque nítido con detalles afilados como una cuchilla». Esta restricción obliga a escribir mejores prompts, lo que conduce a mejores imágenes.
Más allá de estas diferencias centrales, FLUX.2 Klein admite referencia multi-imagen: hasta 3 imágenes de entrada que el modelo usa como contexto visual mediante KV-caching. Una foto de producto, una referencia de escena y una guía de estilo pueden combinarse en una sola generación sin ningún entrenamiento LoRA. La variante de 4B se publica bajo Apache 2.0, así que el uso comercial está totalmente permitido.
La estructura de prompt que funciona
FLUX.2 Klein premia la prosa sobre las palabras clave. «Una mujer de unos 30 años de pie en un paso de peatones de Tokio empapado por la lluvia» genera una mejor imagen que «mujer, 30 años, Tokio, lluvia, paso de peatones, calle».
Aquí tienes el marco que produce consistentemente resultados sólidos:
| Elemento | Propósito | Ejemplo |
|---|---|---|
| Sujeto | Quién o qué | «Un pescador curtido a finales de los sesenta» |
| Acción | Qué está ocurriendo | «remendando una red rota con manos callosas» |
| Escena | Dónde, estratificado por profundidad | «en un muelle de madera, barcos pesqueros en el plano medio, colinas cubiertas de niebla al fondo» |
| Estilo | Enfoque visual | «fotografía documental, tomada con Leica M11» |
| Iluminación | Fuente, calidad, dirección | «luz difusa de día nublado con una rotura cálida en las nubes a la izquierda de cámara» |
| Cámara | Objetivo, apertura, composición | «85 mm a f/2.8, poca profundidad de campo, regla de los tercios» |
| Materiales | Texturas de superficie | «chaqueta de lona manchada de sal, cuerda de cáñamo deshilachada, tablones de teca curtidos» |
Coloca tu sujeto al principio. El modelo presta más atención a lo que aparece primero en el prompt. Enterrar tu sujeto principal tras tres frases de descripción de escena debilita su presencia en la salida.
Nombra tus materiales. FLUX.2 Klein tiene una biblioteca de texturas excepcionalmente detallada. «Aluminio cepillado con grano radial sutil» se renderiza de forma diferente a simplemente «metal», y más cerca de lo que realmente quieres.
Describe la luz como lo haría un fotógrafo. Especifica la fuente (natural, artificial, ambiental), la calidad (suave, dura, difusa), la dirección (lateral, contraluz, cenital) y la temperatura de color (cálida, fría, dorada). Las descripciones de iluminación tienen el mayor impacto individual en la calidad de la salida.
Ejemplos de prompts
1. Retrato fotorrealista
Un retrato editorial a plano completo de una artista ceramista japonesa de 28 años con pelo negro muy corto y polvo de arcilla en los antebrazos, llevando un delantal holgado de lino teñido de índigo sobre una camiseta de algodón blanco. Está de pie en su taller rodeada de cerámica secándose en estantes de madera, suave luz de ventana orientada al norte iluminando su rostro desde la izquierda de cámara, enfoque nítido en sus ojos, poca profundidad de campo a f/1.8, tomada con Fujifilm GFX100S con objetivo de 110 mm, paleta de colores cálida y terrosa, textura de piel fina con poros visibles, concentración serena en su expresión, grano de película mate.

FLUX.2 Klein renderiza la textura de la piel y la tela a un nivel que los modelos de código abierto anteriores no podían igualar. Nombrar materiales específicos («lino teñido de índigo», «polvo de arcilla», «algodón blanco») activa el renderizado de texturas del modelo de formas que las descripciones genéricas no logran.
2. Ilustración con estilos mixtos
Una ilustración digital ricamente detallada que fusiona el trazado de líneas de Moebius con lavados de acuarela al estilo Ghibli: una joven bióloga marina con un traje de buceo retrofuturista con una visera de ámbar agrietada, sentada sobre el casco de un carguero hundido en el fondo del océano a profundidad crepuscular. Medusas bioluminiscentes flotan en el plano medio, un ancla incrustada de coral descansa a su lado. El resplandor ámbar cálido de la lámpara de su traje se mezcla con la bioluminiscencia turquesa fría del agua circundante, líneas de contorno dibujadas a mano sobre rellenos de color plano suaves, textura de papel de acuarela visible, atmósfera contemplativa y serena, composición amplia centrada.

El codificador Qwen3 entiende las referencias a artistas con nombre y las fusiona en una estética coherente en lugar de elegir una sobre la otra. Las fuentes de luz duales (la lámpara cálida del traje frente a la bioluminiscencia fría) activan especialmente bien las capacidades de gradación de color del modelo.
3. Foto de producto con referencia multi-imagen


Coloca el reloj de bolsillo de la primera imagen de referencia sobre la escena del escritorio de roble de la segunda referencia, conservando sus proporciones exactas, las marcas de la esfera y el acabaje de la caja. Posiciónalo ligeramente a la izquierda del centro con la cadena cayendo hacia el borde derecho, un paño de lino doblado debajo, suave luz difusa matutina desde la derecha de cámara creando un reflejo dorado en el borde de la caja abierta. Sutil reflejo en la superficie del escritorio, tomada con Hasselblad H6D con macro de 120 mm a f/8, fotografía de producto comercial, composición limpia, gradación de color cálida neutral.

Este flujo de trabajo es exactamente para lo que se construyó la referencia multi-imagen. El producto mantiene su identidad de la referencia uno, la escena proviene de la referencia dos y tu prompt solo necesita describir la combinación: posicionamiento, iluminación y composición.
4. Texto preciso en una imagen
Una taza de café negro mate sobre una encimera de hormigón junto a un periódico doblado. La taza lleva el texto «GOOD CODE SHIPS FAST» en tipografía sans-serif bold blanca y limpia envuelta alrededor de su centro. Sube vapor de la taza, suave luz cenital difusa de cocina, poca profundidad de campo a 50 mm f/2.8, fondo de interior moderno y minimalista ligeramente desenfocado, paleta de colores fría neutral, fotografía editorial de producto, tipografía nítida y legible.

FLUX.2 Klein gestiona el texto dentro de la imagen significativamente mejor que FLUX.1. Especificar el estilo de fuente («sans-serif bold»), el color («blanco limpio»), la ubicación («envuelta alrededor de su centro») y las mayúsculas/minúsculas da al modelo suficiente información para renderizar tipografía legible de forma consistente.
5. Escena compleja de múltiples capas
Una vista cinematográfica de una gran biblioteca antigua a la hora dorada. Primer plano: una pesada mesa de lectura de roble con un libro abierto encuadernado en cuero, una lupa de latón apoyada en sus páginas. Plano medio: altas estanterías de madera oscura que van del suelo al techo, llenas de lomos envejecidos en borgoña, azul marino y verde bosque. Fondo: una gran ventana arqueada con cálida luz solar dorada entrando a raudales, partículas de polvo flotando en los haces de luz. Tomada en 35 mm a f/4, enfoque profundo, grano de película fino, rica paleta de colores cálida con tonos de madera profundos y luz ámbar, composición centrada y simétrica.

Dividir una escena en primer plano, plano medio y fondo le da a FLUX.2 Klein una estructura de profundidad clara que seguir. Cada plano tiene sus propios materiales e interacciones de iluminación: cuero y latón de cerca, lomos de libros envejecidos en el medio, luz dorada de la ventana al fondo. El modelo gestiona este enfoque por capas de forma mucho más fiable que una sola descripción interminable de toda la sala.
Errores comunes
Usar prompts negativos. FLUX.2 Klein los ignora por completo. Describe lo que quieres ver en su lugar: «superficie limpia, sin marcas» en lugar de intentar excluir «texto, marca de agua».
Cambiar el número de pasos. El modelo produce la salida correcta solo con 4 pasos. Configurarlo en 20 o 50 no añadirá detalle: el proceso de destilación por pasos se optimizó exactamente alrededor de 4.
Escribir prompts cortos y vagos. «Una mujer con un vestido rojo» desperdicia las capacidades del codificador Qwen3. FLUX.2 Klein produce su salida más sólida con prompts de 40-120 palabras que describen sujeto, escena, iluminación y materiales en detalle.
Generar por debajo de 768 px. El modelo se entrenó para salidas de alta resolución. Por debajo de 768×768, la calidad cae notablemente. El punto óptimo se sitúa entre 1024 y 1536 píxeles por lado.
Aplicar LoRAs de FLUX.1. FLUX.2 usa una arquitectura completamente diferente: nuevo transformador, nuevo codificador de texto. Los LoRAs de FLUX.1 son incompatibles. La referencia multi-imagen gestiona la mayoría de los casos de uso que antes requerían entrenamiento LoRA.
