Escribir un buen prompt es la diferencia entre una imagen genérica que descartas en segundos y una que parece salida de un estudio profesional. Aprender cómo escribir buenos prompts para generar imágenes con IA no requiere talento artístico ni conocimientos de diseño: es una habilidad que se construye entendiendo cómo «piensa» cada modelo y practicando con intención. En esta guía vas a encontrar técnicas concretas, no consejos vagos.

Cada generador tiene su propia lógica. Lo que funciona de maravilla en Midjourney puede dar resultados mediocres en DALL-E, y Stable Diffusion abre posibilidades que los otros dos ni siquiera ofrecen. Por eso no basta con «describir lo que quieres»: hay que hablarle a cada herramienta en su idioma.

Vamos a ir de lo básico a lo avanzado. Primero, la anatomía de un prompt que sirve para cualquier modelo; después, los trucos específicos de las tres plataformas más usadas; y al final, los errores que repiten casi todos los principiantes y cómo corregirlos.

Qué es un prompt de imagen y por qué importa tanto

Un prompt es simplemente la instrucción de texto que le das al modelo para que produzca una imagen. Pero detrás de esa frase ocurre algo importante: la IA no «entiende» lo que pides como lo haría una persona, sino que traduce tus palabras en patrones visuales aprendidos de millones de imágenes. Si quieres entender mejor esa mecánica de fondo, ayuda repasar cómo funciona la IA generativa, porque el principio es el mismo que detrás de los generadores de texto.

La consecuencia práctica es clara: las palabras que eliges pesan muchísimo. «Un perro» y «un golden retriever cachorro corriendo en la playa al atardecer, fotografía con teleobjetivo» producen resultados que no tienen nada que ver. Cuanto más concreto y ordenado sea tu lenguaje, menos tendrá que adivinar el modelo.

La anatomía de un buen prompt (sirve para cualquier modelo)

Antes de meternos en trucos por plataforma, conviene dominar una estructura base. No es una fórmula rígida, pero sí un orden mental que te evita olvidar lo esencial. Piensa en cinco bloques:

  • Sujeto: qué o quién es el protagonista. Sé específico: no «una mujer», sino «una mujer de unos 60 años, cabello canoso recogido».
  • Acción o pose: qué está haciendo o cómo está dispuesto el sujeto.
  • Entorno: dónde ocurre la escena, el fondo, los objetos alrededor.
  • Iluminación y atmósfera: luz de atardecer, luz dura de mediodía, contraluz, ambiente brumoso.
  • Estilo y técnica: fotografía, acuarela, render 3D, ilustración plana, tipo de lente o película.

Un ejemplo que une todo: «Retrato de un pescador anciano reparando una red, en un muelle de madera al amanecer, luz dorada suave, fotografía con lente de 85mm, fondo desenfocado». Fíjate que cada palabra aporta algo. No hay relleno.

Una regla que uso siempre: empieza por lo más importante. La mayoría de los modelos da más peso a las primeras palabras del prompt. Si el estilo fotográfico es lo que más te importa, ponlo al principio; si es el sujeto, arranca por ahí.

Técnicas específicas para Midjourney

Midjourney tiene fama de dar las imágenes más estéticas «de fábrica», y es cierto: tiende a embellecer todo. Eso tiene una contracara —a veces ignora detalles concretos a favor de que la imagen «se vea bonita»—. Para controlarlo, conviene conocer sus parámetros. Si todavía no lo has probado, la guía sobre qué es Midjourney y cómo generar buenas imágenes desde cero cubre la puesta en marcha.

Estos son los parámetros que más vas a usar, se escriben al final del prompt:

  • –ar define la proporción. --ar 16:9 para horizontal, --ar 2:3 para retrato vertical, --ar 1:1 para cuadrado.
  • –stylize (o --s) controla cuánto «interpreta» el modelo. Valores bajos respetan tu prompt al pie de la letra; valores altos añaden su propio criterio artístico.
  • –no excluye elementos: --no texto, marcas de agua.
  • –chaos aumenta la variedad entre las cuatro imágenes que genera. Útil cuando buscas inspiración y no sabes bien qué quieres.

Midjourney responde bien a un estilo de redacción compacto, por palabras clave más que por frases completas. En lugar de «quiero una fotografía que muestre una ciudad futurista durante la noche con muchas luces de neón», funciona mejor: «ciudad futurista nocturna, luces de neón, calles mojadas con reflejos, estilo cyberpunk, fotografía cinematográfica, –ar 16:9». Separa los conceptos con comas y deja que cada bloque haga su trabajo.

Un truco avanzado: los prompts de imagen. Midjourney permite pegar la URL de una imagen de referencia al inicio del prompt para que tome de ahí la composición o la paleta. Combinado con texto, da un control muy fino sobre el resultado.

Técnicas específicas para DALL-E

DALL-E —el generador integrado en ChatGPT— juega en otra liga conceptual. Está pensado para entender lenguaje natural, así que puedes describir la escena como si se la explicaras a una persona. Frases completas, instrucciones encadenadas y hasta pedir correcciones en una conversación: todo eso lo maneja con soltura.

Su gran ventaja es que interpreta bien pedidos complejos con varios elementos y relaciones espaciales («un gato naranja sentado a la izquierda de una taza azul, sobre una mesa de madera»). Donde Midjourney a veces mezcla los elementos, DALL-E suele respetar mejor el «quién está dónde».

Algunas recomendaciones para sacarle partido:

  • Describe en oraciones claras, no en listas de palabras sueltas. Al modelo le va mejor «una ilustración infantil de un zorro leyendo bajo un árbol» que «zorro, árbol, libro, infantil».
  • Pide el estilo explícitamente al final: «en estilo acuarela», «como fotografía de producto», «ilustración vectorial plana».
  • Aprovecha la conversación. Como funciona dentro de ChatGPT, puedes decir «ahora hazla más oscura» o «cambia el fondo a un bosque» sin reescribir todo. Si recién empiezas con ese entorno, la guía para usar ChatGPT desde cero te orienta.
  • Para texto dentro de la imagen (un cartel, un logo con palabras), DALL-E suele acertar más que sus competidores, aunque ninguno es perfecto todavía.

Una limitación a tener en cuenta: DALL-E aplica filtros de contenido más estrictos y no ofrece el nivel de control técnico de parámetros que tienen Midjourney o Stable Diffusion. Es la opción más cómoda, no la más configurable.

Técnicas específicas para Stable Diffusion

Aquí cambia el paradigma. Stable Diffusion es de código abierto, lo que significa que puedes ejecutarlo en tu propia computadora, instalar interfaces como AUTOMATIC1111 o ComfyUI, y usar modelos entrenados por la comunidad para estilos muy específicos. A cambio de esa libertad, pide más conocimiento técnico.

Su rasgo distintivo es el prompt negativo: un campo separado donde escribes lo que NO quieres ver. Es la herramienta más poderosa para limpiar defectos. Un negativo típico incluye términos como «manos deformes, dedos extra, baja resolución, borroso, marca de agua, texto». Esto reduce muchísimo los errores clásicos de anatomía.

Otras particularidades que conviene dominar:

  • Pesos de palabras: puedes dar más énfasis a un término con paréntesis, por ejemplo (bosque:1.3) para que el bosque domine la escena. Es un nivel de control que ni Midjourney ni DALL-E ofrecen.
  • Modelos y LoRAs: la comunidad comparte miles de modelos afinados para anime, fotorrealismo, estilos de ilustración concretos. El mismo prompt rinde distinto según el modelo base que cargues.
  • Parámetros de generación: pasos de muestreo, escala CFG (cuánto obedece al prompt) y semilla (seed) para reproducir o variar resultados.

Si buscas máximo control y no te asusta configurar software, Stable Diffusion es imbatible. Para comparar las tres plataformas con más detalle y decidir cuál te conviene, revisa la comparativa entre Midjourney, DALL-E y Stable Diffusion.

Paso a paso: cómo construir un prompt desde cero

Veamos el proceso completo con un objetivo concreto: generar la foto de portada para un artículo sobre café artesanal.

  1. Define el objetivo real. ¿Para qué es la imagen? Una portada necesita espacio para texto y una composición limpia. Eso ya condiciona la proporción (horizontal) y la complejidad (mejor simple).
  2. Escribe el sujeto principal. «Una taza de café recién servido con espuma de leche con arte latte».
  3. Añade el entorno. «Sobre una mesa de madera rústica, junto a granos de café esparcidos».
  4. Especifica la luz. «Luz natural suave entrando desde un lateral, ambiente cálido de mañana».
  5. Define el estilo técnico. «Fotografía gastronómica, enfoque selectivo, fondo desenfocado».
  6. Agrega parámetros o negativos según el modelo. En Midjourney, --ar 16:9; en Stable Diffusion, un negativo con «sobreexpuesto, colores saturados, baja calidad».
  7. Genera, evalúa e itera. Casi nunca sale perfecto a la primera. Mira qué falló y ajusta UNA cosa a la vez para entender el efecto de cada cambio.

Ese último punto es el más importante y el que más gente ignora. Cambiar cinco palabras a la vez no te enseña nada; cambiar una sí. La iteración controlada es la verdadera técnica.

Palabras clave que elevan tus prompts

Hay términos que actúan como «palancas» de calidad porque el modelo los asocia con imágenes bien producidas. No son magia, pero orientan el resultado. Algunos ejemplos por categoría:

  • Iluminación: hora dorada, luz de contraluz, iluminación de estudio, luz tenue, claroscuro.
  • Cámara y lente: primer plano, plano general, lente macro, teleobjetivo, gran angular, profundidad de campo reducida.
  • Estilo artístico: acuarela, óleo, arte lineal, render 3D, ilustración editorial, estilo isométrico.
  • Atmósfera: minimalista, nostálgico, dramático, onírico, melancólico.

Un consejo de criterio: no apiles diez palabras de calidad esperando que la imagen sea diez veces mejor. «Obra maestra, ultra detallado, 8K, premiado, hiperrealista» todo junto suele diluir el efecto y, a veces, empeora la coherencia. Elige dos o tres términos que de verdad apunten a lo que buscas.

Errores comunes al escribir prompts (y cómo evitarlos)

Después de miles de generaciones, los tropiezos se repiten con una regularidad casi cómica. Los más frecuentes:

  • Instrucciones contradictorias. Pedir «minimalista» y «lleno de detalles ornamentales» en la misma frase confunde al modelo. Decide qué quieres.
  • Demasiados sujetos. Cuantos más personajes u objetos protagonistas metas, más se degrada la coherencia. Si necesitas una escena compleja, divídela o usa una imagen de referencia.
  • Esperar texto legible. Aunque los modelos mejoraron, el texto largo dentro de la imagen sigue siendo poco fiable. Para carteles o logos con tipografía, conviene generar la base con IA y rematar el texto en un editor.
  • Ignorar la proporción. Generar en cuadrado algo que vas a usar en formato horizontal te obliga a recortar y perder parte de la composición. Define el aspecto desde el inicio.
  • No revisar derechos ni marcas. Pedir el estilo de un artista vivo o personajes con copyright entra en terreno delicado. Para uso comercial, mejor describir estilos de forma genérica.

Un tema aparte, cada vez más relevante: la gente aprende a distinguir imágenes sintéticas. Si te interesa saber qué delata una imagen hecha con IA —y, por tanto, qué defectos pulir en tus propios prompts—, esta guía sobre cómo detectar imágenes generadas con IA da pistas muy prácticas.

De la teoría a la práctica: consejos finales de flujo de trabajo

Guarda tus mejores prompts. Suena obvio, pero casi nadie lo hace al principio y luego lamenta haber perdido esa combinación que funcionó perfecto. Un documento con tus «recetas» probadas vale oro y acelera todo tu trabajo futuro.

Otra costumbre que paga: estudia los prompts de imágenes que admiras. En las galerías públicas de Midjourney o en comunidades de Stable Diffusion puedes ver exactamente qué texto generó cada resultado. Es la mejor escuela gratuita que existe. Y si quieres profundizar en la lógica general de redactar instrucciones para IA —no solo de imagen—, la guía sobre cómo escribir prompts efectivos complementa bien lo que viste aquí.

Preguntas frecuentes

¿Cuál es la diferencia entre un prompt para Midjourney y uno para DALL-E?

DALL-E entiende bien frases largas en lenguaje natural, casi como una instrucción conversacional. Midjourney responde mejor a descripciones más compactas con palabras clave de estilo y parámetros propios como –ar o –stylize.

¿Qué es un prompt negativo y cuándo conviene usarlo?

Es una lista de elementos que no quieres en la imagen, muy útil en Stable Diffusion para evitar manos deformes, texto borroso o fondos saturados. Midjourney lo maneja con el parámetro –no y DALL-E no lo usa de forma directa.

¿Necesito escribir los prompts en inglés para obtener mejores resultados?

No es obligatorio, pero el inglés suele dar resultados más precisos porque la mayoría de los modelos se entrenó con datos en ese idioma. Puedes redactar en español y traducir los términos de estilo clave.

¿Cuánto detalle debe tener un buen prompt?

El suficiente para describir sujeto, entorno, iluminación y estilo, sin saturarlo. Un exceso de adjetivos contradictorios confunde al modelo; es mejor iterar y ajustar que amontonar palabras.

Dominar los prompts de imagen es, al final, una cuestión de práctica deliberada más que de memorizar fórmulas. Empieza con la estructura de cinco bloques, elige una sola herramienta para familiarizarte con su lógica, y guarda cada prompt que te funcione. En pocas semanas vas a notar que tus resultados dejaron de ser cuestión de suerte y pasaron a ser algo que controlas.