Prompts para IA de imágenes: estructura, no extensión
Resumen
Los prompts para IA efectivos no se ganan con extensión sino con estructura. Descubre el framework de seis slots (subject, style, lighting, composition, mood, technical) que separa los outputs genéricos de los controlados en Midjourney, Flux y SD3.5. No es magia: es disciplina en el moodboard.
Los mejores prompts para IA de imagenes no son más largos, son estructurados. Los buenos prompts para IA no dependen de la extensión sino de cómo distribuyes la información. Seis slots: subject, style, lighting, composition, mood, technical. Omite uno y Midjourney o Flux lo rellena con lo más genérico del arsenal, por eso tus renders se parecen al board de Pinterest de todos los demás. Esto no tiene que ver con apilar adjetivos hasta que algo pegue. Tiene que ver con nombrar cada decisión que un fotógrafo real o un art director tomaría antes de que la cámara siquiera se abriera. Esa es la única diferencia entre un output de suerte y uno repetible.
Probablemente ya hiciste esto: tipeas "a woman in a park, cinematic, 8k, best quality" y recibes exactamente el mismo render sobre-iluminado, sobre-suavizado que el modelo le da a cualquiera que escriba esa frase. No es mala suerte. Es un prompt con tres slots vacíos, rellenados por la predicción más genérica que el modelo tiene en stock.
Los Seis Slots que Todo Prompt Funcional Contiene
Olvida la sopa de palabras clave separadas por comas. "Fox, forest, autumn, misty, sunlight, 8k, best quality" le dice nada al modelo sobre lo que realmente quieres, así que defaults a algo genérico. Cada modelo ha visto diez mil imágenes etiquetadas con esas palabras exactas, y promedia todas ellas en el output más seguro posible.
El brief que se sostiene entre modelos: subject, style, lighting, composition, mood, technical. Seis slots. Si no puedes nombrar qué va en un slot, el modelo lo elige por ti, y elige el promedio de cada imagen que haya visto etiquetada así. Ese es el "AI look" que intentas sacudirte.
Sujeto primero, siempre. No "una mujer", sino qué está haciendo, qué lleva puesto, qué sostiene, dónde está. Estilo después: nombra un medio o un movimiento, no una vibra. "Cinematic" no significa nada específico para un modelo, es una palabra de marketing, no una instrucción visual. "Película de diapositiva Kodachrome, 1978" es algo que un modelo puede realmente simular.
Composición es el slot que casi nadie toca. Elección de lente, ángulo, distancia de encuadre: un ángulo bajo de 35mm a tres cuartos se lee completamente diferente a un close-up apretado de 85mm, y el modelo necesita que elijas uno en lugar de asumir "una toma bonita".
Abrelo y mira qué hay realmente en un prompt funcional: un sujeto haciendo algo concreto, un estilo nombrado, una fuente de luz con dirección, una opción de lente y encuadre, un registro emocional, y lo que sea necesario en flags específicos del modelo. Pierde dos de esos y tienes la cuadragésima variación del mismo retrato beige que todos están generando esta semana.
Mood es el slot que la mayoría salta completamente o sobrecarga con tres adjetivos contradictorios a la vez. Elige un registro: sereno, tenso, celebratorio, clínico. No "epic and serene and dramatic" apilados, que solo le dice al modelo que promedia tres emociones en un punto muerto plano e indeciso. Y técnico al final, no al inicio: aspect ratio, seed, flags específicos del modelo. Es el slot que fija los otros cinco una vez que realmente has decidido qué dicen.
Midjourney v7, Flux 1.1 Pro, SD3.5: Un Brief, Reglas Diferentes
Lanzamos el mismo brief de seis slots por tres modelos, mismo sujeto, misma pista de iluminación, mismo encuadre. Los outputs divergieron más de lo esperado, que es exactamente el punto de testear en lugar de asumir.
Midjourney v7 quiere frases cortas de alto signal, no oraciones completas. Recompensa --sref por consistencia de estilo y lee --stylize más agresivamente que versiones previas. Dispárale un párrafo completo y comienza a promediar el ruido de vuelta a algo más seguro y más blando. Sigue siendo el modelo con el sentido más fuerte de mood e iluminación atmosférica de los tres, pero necesita que seas económico sobre cómo pides.
Flux 1.1 Pro va completamente al otro lado. Sigue briefs en lenguaje natural de cerca y recompensa detalle, particularmente especificaciones de cámara y película. Di "85mm, f/1.8, Kodak Portra 400" y Flux realmente sostiene ese grano y respuesta de color en lugar de suavizarlo en algo plástico. Este es el modelo al que llegar cuando el brief es una fotografía, no una ilustración, y se ha convertido en el default profesional exactamente por esa razón.
Stable Diffusion 3.5 recompensa palabras clave estructuradas y ponderadas: paréntesis para empujar énfasis arriba, corchetes para bajarlo. (rim light:1.4) se comporta diferente a tipear "strong rim light" en una oración, y ese control numérico es todo el atractivo. Si estás construyendo un pipeline con LoRAs personalizadas y ControlNet, SD3.5 es aún el que posees de punta a punta, self-hosted o a través de un front-end.
Ninguno de estos es objetivamente "mejor". Son superficies de control diferentes construidas para trabajos diferentes. Elige el que sea cuya superficie de control coincida con el brief que escribiste, no el que todos están tomando screenshots en X esta semana porque pasó a clavar un output de suerte.
Vale la pena decir claro: cambiar de modelo mid-proyecto porque un output te decepcionó es la forma más rápida de terminar con una carpeta de estilos desfasados y sin hilo conductor. Decide el modelo basado en el brief, ejecuta el mismo brief por tres o cuatro seeds antes de que juzgues el modelo mismo, y solo cambia herramientas si la superficie de control genuinamente no puede hacer lo que el brief pide.
El Vocabulario de Iluminación que Mata el AI Look
Aquí la solución más rápida para renders que gritan "generated": nombra la fuente de luz y su dirección. No "good lighting", que es una frase con cero información. Una fuente, una cualidad, una dirección.
"Luz baja filtrando bambú, sombras duras barriendo a la izquierda" le da al modelo una configuración física para simular, como un gaffer iluminando un set. "Nice lighting" no le da nada, así que defaults al look plano, sin sombras, sobre-iluminado que se ha convertido en el tell inconfundible de un prompt apresurado escrito en treinta segundos.

Toma prestado del vocabulario de iluminación real en lugar de inventar el tuyo: iluminación Rembrandt para un pequeño triángulo de luz en la mejilla en sombra, rim light para separación del fondo, volumetric fog para atmósfera con verdadera profundidad. Estas no son palabras decorativas elegidas para sonar elegantes. Cada una le dice al modelo que simule una configuración física específica en lugar de adivinar qué quisiste decir.
Agrega "RAW photo" o "unprocessed" al slot técnico si el over-smoothing de piel plástica es tu problema recurrente. Es una pequeña frase que hace un trabajo desproporcionado contra el look sobre-renderizado que cada modelo defaults cuando el prompt le deja espacio para adivinar.

Cinco Prompts que Puedes Robar Ahora
Testamos estos entre los tres modelos arriba. No son arte terminado, son puntos de inicio construidos sobre la estructura de seis slots. Cambia el sujeto, mantén los huesos intactos.
Retrato editorial: "Three-quarter portrait, low-angle, 35mm lens, Rembrandt lighting from camera left, muted autumn palette, quiet and resolved expression, film grain, RAW photo."
Bodegón tipo producto: "Overhead flat lay on raw concrete, single hard-edged shadow from window light, one object slightly off-center, desaturated tones, unprocessed."
Arquitectura brutalista: "Wide shot, symmetrical concrete facade, overcast diffused light, no people in frame, cold color grade, 24mm lens, documentary framing."
Estudio de texturas riso-print: "Two-color riso print aesthetic, visible registration offset, flat color blocks, halftone dot pattern, visible paper grain."
Landscape mood: "Wide shot, low sun filtering through fog, cool color temperature, long shadows, minimal color palette, cinematic composition."
Drop cualquiera de estos en Flux para fotorrealismo o Midjourney para atmósfera, y observa cuál slot se rompe primero cuando el output te decepciona. Ese es usualmente el slot exacto que necesitas apretar la próxima ronda, no una razón para reroll ciegamente.
Construye una Librería de Prompts, No un Cementerio de Screenshots
La "colección de prompts" de la mayoría es cuarenta screenshots enterrados en una Notes app, ninguno etiquetado, ninguno reutilizable seis semanas después cuando realmente necesites exactamente ese setup de iluminación otra vez. Eso no es una librería, es un cementerio que nunca excavarás.
Una librería funcional etiqueta por slot, no por vibra. Archiva un prompt bajo "lighting: hard side light" y "style: riso print", no bajo "cool one" o "the fox thing". Cuando necesites un setup de iluminación específico un mes después, lo encuentras en diez segundos en lugar de scrollear un camera roll esperando reconocer un thumbnail.

Este es también donde Are.na gana su lugar en el workflow, no como un nice-to-have sino como el paso antes del paso. Are.na-iza tus referencias antes de escribir un solo prompt: bloquea el ADN visual (luz, textura, paleta) en un canal primero, luego traduce ese canal en los seis slots. Es más lento que tipear directo en un modelo, pero los outputs dejan de verse intercambiables con los de todos los demás.
Cuando Iterar Más Solo Empeora las Cosas
Fija el seed. Cambia un slot por ronda. Esa es toda la disciplina, y casi nadie la hace.
El instinto cuando un output te decepciona es reroll diez veces y esperar que el seed aleatorio te salve. Lo que realmente funciona: mantén el seed fijo, cambia exactamente una variable a la vez, iluminación primero, luego composición, luego mood, y evalúa el resultado contra el brief que escribiste originalmente, no contra si personalmente te gusta la vibra hoy. "¿Esto coincide con lo que pedí?" vence "¿me gusta?" cada vez, porque la segunda pregunta no tiene endpoint y quemarás cien generaciones persiguiendo un sentimiento en lugar de una spec.
Si has cambiado cuatro cosas a la vez y aún estás rerolling sin mejora, el brief estaba incompleto desde el inicio. Vuelve a los seis slots. Algo está vacío, y ninguna cantidad de reroll lo soluciona.
Para control técnico más profundo en el lado del fotorrealismo, Black Forest Labs documenta el comportamiento de adherencia de prompt y guidance-scale de Flux en más detalle que la mayoría de guías de terceros se molestan, vale la pena quince minutos si estás empujando más allá del uso casual.
¿Entonces En Cuál Modelo Realmente Ejecutas Esto Primero?
Flux 1.1 Pro si el brief se lee como una fotografía. Midjourney v7 si se lee como un mood. SD3.5 si necesitas poseer el pipeline de punta a punta y apilar LoRAs personalizadas sobre un modelo base.
No hay respuesta universal aquí, y cualquiera que te venda una es te está vendiendo un pack de templates, no un método. Escribe el brief de seis slots primero, decide qué tipo de imagen realmente describe una vez esté en la página, y solo entonces elige el modelo que coincida. Roba los cinco prompts arriba, rómpelos, reconstruyelos para tu propio sujeto y tu propio stack de referencias. Ese es el trabajo real, y es un mejor uso de una tarde que scrollear el feed de showcase de alguien más por la centésima vez.