- Blog
- Generar imágenes con GPT Image 2: seis errores comunes y cómo corregirlos
Generar imágenes con GPT Image 2: seis errores comunes y cómo corregirlos
Una guía de diagnóstico de los seis errores que provocan bucles de repetición al generar imágenes con GPT Image 2, cada uno con el patrón de prompt corregido que debes usar en su lugar.

Generar imágenes con GPT Image 2 rara vez falla porque el modelo sea débil. Falla porque el prompt le deja al modelo una decisión que no pretendías cederle: la superficie sobre la que se apoya un producto, el color de una chaqueta entre dos ediciones, el tamaño de las palabras de un póster. La propia guía de OpenAI señala dónde GPT Image 2 todavía necesita ayuda: prompts largos y complejos, colocación precisa del texto, personajes recurrentes y elementos de marca que se desvían entre generaciones separadas, y composiciones en las que los elementos deben caer en un punto exacto. Cada uno de esos puntos es una decisión, y todos se resuelven con un hábito de prompting más que con el modelo. Esta guía nombra los errores que convierten una petición clara en una ronda de repeticiones, y empareja cada uno con el patrón corregido que puedes pegar en la herramienta GPT Image 2 de KOOX AI.
Error 1: describir una atmósfera en lugar de un entregable
El fallo más común ocurre antes de que el modelo dibuje nada: el prompt describe una sensación, no un recurso. «Un altavoz futurista y molón, cinematográfico, con todo lujo de detalles» le dice a GPT Image 2 lo que te gusta, no lo que está construyendo. La guía de prompts de PixVerse llama a la solución «nombra el trabajo antes que el estilo»: empieza por el tipo de resultado, como un anuncio de producto, un póster, una hoja de personaje, una pantalla de interfaz o un primer fotograma para vídeo, porque un prompt armado solo con adjetivos de estilo deja indefinido el criterio de éxito.
Compara los dos briefs:
Un altavoz futurista y molón, cinematográfico, con todo lujo de detalles.
Crea un anuncio de producto premium para un altavoz inalámbrico negro mate. Debe funcionar como banner de campaña 16:9 con el producto a la derecha, una breve zona de titular a la izquierda, espacio negativo limpio y bordes nítidos en el producto.
El segundo prompt le dice al modelo cómo se juzgará el resultado: por su composición y su usabilidad, no solo por su belleza. La guía de PrompTessor señala lo mismo desde el lado de la redacción: empieza con una definición de recurso aceptado, porque «imagen cinematográfica premium» es una sensación, mientras que «fotografía de producto 4:5 para redes de pago con una zona libre para texto» es una especificación.
Error 2: nombrar el cambio pero no la lista de lo que se conserva
Los prompts de edición fallan cuando describen solo lo que debe cambiar. Una lista de lo que se conserva puede importar tanto como el cambio solicitado, porque sin ella el modelo es libre de volver a dibujar todo lo que decida que está relacionado. La guía de prompting de Felo lo empaqueta como la fórmula de solo el cambio: indica el cambio y luego enumera lo que debe permanecer.
Sustituye el coche aparcado por una bicicleta vintage. Conserva exactamente la casa, la valla, la entrada, el ajardinamiento, la dirección de la luz, el ángulo de cámara y la hora del día. Iguala la escala, la sombra de contacto y la perspectiva de la bicicleta a las de la escena existente.
Tres frases, tres funciones: la edición, el bloqueo y el realismo físico. La misma estructura sirve para la herramienta de imagen a imagen de KOOX, donde una instrucción de escena y conservación mantiene fijo el sujeto mientras cambia el entorno.
Error 3: subir imágenes de referencia sin asignarles un rol
Cuando entran varias imágenes, el modelo necesita saber para qué sirve cada una. «Usa las referencias» le da margen a GPT Image 2 para mezclarlo todo; asignar un rol a cada imagen elimina esa ambigüedad. Esta es la regla de manejo de referencias que la guía de Felo resume como roles, no intuiciones, y que PrompTessor muestra en la práctica:
Imagen 1: identidad principal del producto. Conserva la geometría, la etiqueta, la forma del tapón, los materiales y las proporciones.
Imagen 2: solo referencia de iluminación. Usa su fuente suave y su contraste de sombras controlado. No copies su sujeto.
Imagen 3: solo referencia de composición. Usa su colocación ponderada a la izquierda y su proporción de espacio negativo. No copies sus colores ni su texto.
Hay un error más silencioso que acompaña a este: construir un conjunto de referencias de una imagen en una. La guía de GPT Image 2 de Flick advierte de que los prompts separados se desvían, y de que un lote coherente —generado de una vez a partir del mismo bloque de invariantes— produce una hoja que concuerda consigo misma en lugar de ocho intentos casi acertados.

Error 4: confiar en la prosa para reproducir texto exacto
El texto es donde un prompt deja de ser descriptivo y se convierte en un recurso bloqueado. Si las palabras deben aparecer, entrecomíllalas, di cuántas veces deben aparecer y di qué no debe añadirse. «Un eslogan sobre la velocidad» invita al modelo a inventarse el texto; una línea entrecomillada con una instrucción de colocación no. La guía de PixVerse recomienda nombrar el titular palabra por palabra y añadir restricciones como «solo el texto exacto», «sin palabras adicionales» y «sin texto duplicado», y señala los casos que hay que tratar con revisión en lugar de con el prompt: la reproducción exacta de un logotipo de marca, el texto minúsculo de cumplimiento normativo y las tipografías propietarias. Las notas del modelo de Morphic confirman por qué: OpenAI sigue incluyendo la colocación y la claridad del texto entre sus limitaciones conocidas, así que un bloque denso de letra pequeña debe revisarse al tamaño final de visualización en vez de darlo por bueno a partir de una miniatura.
Error 5: cambiar varias cosas a la vez
La iteración es donde la deriva se acumula. Si un intento cambia a la vez la iluminación, el fondo y el texto, no puedes saber qué instrucción funcionó, y la siguiente ronda parte de una imagen cuyas diferencias no elegiste tú. Las reglas de edición de Felo son tajantes: cambia una sola cosa por turno y vuelve a introducir el resultado aprobado anteriormente en lugar de describir la escena de nuevo desde cero. La guía de Flick añade la segunda mitad del hábito: repite los invariantes cada vez, porque un prompt que dice «cazadora bomber azul marino» una vez y «chaqueta azul» después invita al modelo a tratarlos como objetos distintos. Los modelos se desvían cuando se dejan de repetir las restricciones.
Error 6: dejar el tamaño, la calidad y el fondo en el prompt
Pedir «4K» o «alta calidad» en prosa es una sugerencia; ajustar el parámetro es una garantía. La guía de Felo reserva una sección aparte para los ajustes que no deberían vivir en la frase, y el consejo de PrompTessor es mantener las elecciones de modelo, calidad, tamaño, fondo y formato de salida separadas de la prosa. De ahí se sigue una regla práctica: describe en el prompt lo que debe contener la imagen y expresa cuán grande, cuán nítida y con qué fondo debe ser a través de los controles. La misma disciplina evita el problema inverso: inflar la prosa con lenguaje de parámetros que el modelo lee como una petición estética en lugar de técnica.
Por qué las regiones idénticas píxel a píxel necesitan composición, no un prompt
Hay un límite que merece decirse sin rodeos, porque explica toda una clase de ediciones decepcionantes. Las ediciones repetidas pueden cambiar detalles que pretendías conservar, y cuando una región tiene que permanecer idéntica píxel a píxel, la guía documentada es componer la edición aprobada de vuelta sobre el original en lugar de confiar en el prompt. No es un defecto de tu redacción; es la frontera de lo que puede prometer una edición generativa. Si un logotipo, una línea legal o la etiqueta de un producto tienen que ser exactos, colócalos con un editor determinista después de generar en lugar de pedirle al modelo que los mantenga.

Una lista de comprobación antes de generar
Pasa estas seis preguntas por cualquier prompt de GPT Image 2 antes de gastar una generación:
- Entregable: ¿la primera línea nombra el tipo de resultado y dónde se usará?
- Lista de lo que se conserva: en una edición, ¿está escrito todo elemento que no debe cambiar?
- Roles de las referencias: ¿tiene cada imagen subida una función, y se excluyen los rasgos no transferibles?
- Bloqueo de texto: ¿está el texto requerido entrecomillado, colocado, contado y acotado con exclusiones?
- Una sola variable: si es una iteración, ¿cambia exactamente una cosa respecto a la última imagen aprobada?
- Ajustes: ¿están el tamaño, la calidad y el fondo en los controles en lugar de en la frase?
Seis preguntas, seis oportunidades de evitar una repetición. El patrón que hay detrás de todas ellas es el mismo: cada frase ambigua es una decisión que el modelo tomará por ti, y una decisión que no especificaste es una que probablemente rechazarás.
Pon las soluciones a trabajar
Empieza con un recurso que de verdad necesites —un fotograma de producto, un póster, una hoja de personaje— y redacta el brief en el orden anterior. Genera un borrador, audítalo contra las seis comprobaciones, cambia una casilla y compara. Cuando el bucle ya te resulte rutinario, la misma estructura sirve para las herramientas vecinas: crea un fotograma con el generador de texto a imagen, refínalo con imagen a imagen y conserva cada paso aceptado como entrada del siguiente. Un prompt que se lee como un brief y no como un deseo es la diferencia entre una generación y seis.