Générer des images avec GPT Image 2 : six erreurs courantes et leurs corrections

Un guide diagnostique des six erreurs qui provoquent des boucles de reprise lorsque vous générez des images avec GPT Image 2, chacune accompagnée du modèle de prompt corrigé à utiliser à la place.

Générer des images avec GPT Image 2 : six erreurs courantes et leurs corrections

Générer des images avec GPT Image 2 échoue rarement parce que le modèle est faible. Cela échoue parce que le prompt laisse au modèle une décision que vous ne vouliez pas lui confier : la surface sur laquelle repose un produit, la couleur d'une veste entre deux retouches, la taille des mots sur une affiche. Les propres recommandations d'OpenAI nomment les points sur lesquels GPT Image 2 a encore besoin d'aide — les prompts longs et complexes, le placement précis du texte, les personnages récurrents et les éléments de marque qui dérivent entre des générations distinctes, et les mises en page où les éléments doivent tomber à un endroit exact. Chacun de ces points est une décision, et chacun se règle par une habitude de prompt plutôt que par le modèle. Ce guide nomme les erreurs qui transforment une demande claire en une série de reprises, et associe à chacune le modèle corrigé que vous pouvez coller dans l'outil GPT Image 2 sur KOOX AI.

Erreur 1 : décrire une ambiance au lieu d'un livrable

L'échec le plus courant se produit avant même que le modèle ne dessine quoi que ce soit : le prompt décrit une sensation, pas un livrable. « Une enceinte futuriste cool, cinématographique, très détaillée » indique à GPT Image 2 ce qui vous plaît, pas ce qu'il est en train de construire. Le guide de prompt de PixVerse nomme la solution « nommer la tâche avant le style » — commencez par le type de résultat, comme une publicité produit, une affiche, une planche de personnage, un écran d'interface ou une première image de vidéo, car un prompt assemblé à partir de seuls adjectifs de style laisse indéfini le critère de réussite.

Comparez les deux briefs :

Une enceinte futuriste cool, cinématographique, très détaillée.

Créez une publicité produit haut de gamme pour une enceinte sans fil noir mat. Elle doit fonctionner comme une bannière de campagne en 16:9, avec le produit à droite, une courte zone de titre à gauche, un espace négatif soigné et des bords de produit nets.

Le second prompt indique au modèle comment le résultat sera jugé — sur la mise en page et l'utilisabilité, pas seulement sur la beauté. Le guide de PrompTessor fait le même constat du côté de la rédaction : commencez par une définition d'un livrable accepté, car « image cinématographique haut de gamme » est une ambiance, tandis que « photographie produit 4:5 pour réseaux sociaux payants avec une zone sûre pour le texte » est une spécification.

Erreur 2 : nommer le changement sans la liste de préservation

Les prompts de retouche échouent lorsqu'ils ne décrivent que ce qui doit bouger. Une liste de préservation peut compter autant que le changement demandé, car sans elle le modèle est libre de redessiner tout ce qu'il estime lié. Le guide de prompt de Felo présente cela comme la formule du changement seul — énoncez le changement, puis listez ce qui doit rester.

Remplacez la voiture garée par un vélo vintage. Préservez exactement la maison, la clôture, l'allée, l'aménagement paysager, la direction de la lumière, l'angle de caméra et le moment de la journée. Faites correspondre l'échelle, l'ombre de contact et la perspective du vélo à la scène existante.

Trois phrases, trois rôles : la retouche, le verrouillage et le réalisme physique. La même structure se transpose à l'outil image-to-image de KOOX, où une instruction de scène-et-préservation garde le sujet fixe pendant que l'environnement change.

Erreur 3 : téléverser des images de référence sans leur attribuer de rôle

Quand plusieurs images sont fournies, le modèle doit savoir à quoi sert chacune. « Utilisez les références » laisse à GPT Image 2 la latitude de tout mélanger ; attribuer un rôle à chaque image supprime cette ambiguïté. C'est la règle de gestion des références que le guide de Felo résume par « des rôles, pas des impressions », et que PrompTessor montre en pratique :

Image 1 : identité principale du produit. Préservez la géométrie, l'étiquette, la forme du bouchon, les matériaux et les proportions.
Image 2 : référence d'éclairage uniquement. Utilisez sa source douce et son contraste d'ombres maîtrisé. Ne copiez pas son sujet.
Image 3 : référence de composition uniquement. Utilisez son placement décalé à gauche et son ratio d'espace négatif. Ne copiez pas ses couleurs ni son texte.

Une erreur plus discrète accompagne celle-ci : construire un ensemble de références une image à la fois. Le guide GPT Image 2 de Flick avertit que des prompts séparés dérivent, et qu'un lot cohérent — généré d'un seul coup à partir du même bloc d'invariants — produit une planche cohérente avec elle-même plutôt que huit quasi-échecs.

Une carte unie seule, légèrement à l'écart d'une pile bien ordonnée de cartes vierges sur une surface neutre

Erreur 4 : compter sur la prose pour rendre un texte exact

Le texte est le point où un prompt cesse d'être descriptif et devient un livrable verrouillé. Si des mots doivent apparaître, citez-les entre guillemets, indiquez combien de fois ils doivent apparaître et précisez ce qui ne doit pas être ajouté. « Un slogan sur la vitesse » invite le modèle à inventer un texte ; une phrase citée avec une instruction de placement ne le fait pas. Le guide de PixVerse recommande de nommer le titre mot pour mot et d'ajouter des contraintes telles que « texte exact uniquement », « aucun mot supplémentaire » et « pas de texte en double », et il signale les cas à traiter par une validation humaine plutôt que par le prompt : la reproduction exacte d'un logo de marque, les mentions légales en tout petits caractères et les polices propriétaires. Les notes de modèle de Morphic confirment pourquoi — OpenAI liste encore le placement et la clarté du texte comme une limitation connue, de sorte qu'un bloc dense de petits caractères doit être vérifié à la taille d'affichage finale plutôt que supposé à partir d'une vignette.

Erreur 5 : changer plusieurs choses à la fois

L'itération est le moment où la dérive s'accumule. Si une tentative modifie à la fois l'éclairage, l'arrière-plan et le texte, vous ne pouvez pas savoir quelle instruction a fonctionné, et le tour suivant part d'une image dont les différences n'ont pas été choisies par vous. Les règles de retouche de Felo sont sans détour : changez une seule chose par tour, et réinjectez le résultat précédemment approuvé au lieu de redécrire la scène depuis zéro. Le guide de Flick ajoute la seconde moitié de l'habitude — répétez les invariants à chaque fois, car un prompt qui dit « blouson bleu marine » une fois puis « veste bleue » plus tard invite le modèle à les traiter comme des objets différents. Les modèles dérivent quand les contraintes cessent d'être réénoncées.

Erreur 6 : laisser la taille, la qualité et l'arrière-plan dans le prompt

Demander « 4K » ou « haute qualité » dans la prose est une suggestion ; régler le paramètre est une garantie. Le guide de Felo consacre une section distincte aux réglages qui ne doivent pas figurer dans la phrase, et le conseil de PrompTessor est de garder le choix du modèle, de la qualité, de la taille, de l'arrière-plan et du format de sortie en dehors de la prose. Une règle pratique en découle : décrivez dans le prompt ce que l'image doit contenir, et exprimez sa taille, sa netteté et son arrière-plan par les contrôles. La même discipline évite le problème inverse — gonfler la prose avec un vocabulaire de paramètres que le modèle lit comme une demande esthétique plutôt que technique.

Pourquoi les zones identiques au pixel près exigent un compositing, pas un prompt

Une limite mérite d'être énoncée clairement, car elle explique toute une catégorie de retouches décevantes. Des retouches répétées peuvent modifier des détails que vous vouliez préserver, et lorsqu'une zone doit rester identique au pixel près, la recommandation documentée est de recomposer la retouche approuvée dans l'original plutôt que de compter sur le prompt. Ce n'est pas un défaut de votre formulation ; c'est la frontière de ce qu'une retouche générative peut promettre. Si un logo, une mention légale ou une étiquette de produit doit être exact, placez-le avec un éditeur déterministe après la génération au lieu de demander au modèle de le maintenir.

Une carte vierge seule posée sur une surface neutre propre, à côté d'un petit échantillon de couleur uni

Une liste de vérification avant de générer

Passez ces six questions au crible pour tout prompt GPT Image 2 avant de dépenser une génération :

  1. Livrable — la première ligne nomme-t-elle le type de résultat et l'endroit où il sera utilisé ?
  2. Liste de préservation — pour une retouche, chaque élément qui ne doit pas changer est-il écrit ?
  3. Rôles des références — chaque image téléversée a-t-elle une fonction, et les traits non transférables sont-ils exclus ?
  4. Verrouillage du texte — le texte requis est-il cité, placé, compté et encadré par des exclusions ?
  5. Une seule variable — s'il s'agit d'une itération, modifie-t-elle exactement une chose par rapport à la dernière image approuvée ?
  6. Réglages — la taille, la qualité et l'arrière-plan sont-ils dans les contrôles plutôt que dans la phrase ?

Six questions, six occasions d'éviter une reprise. Le schéma qui les sous-tend est le même : chaque phrase ambiguë est une décision que le modèle prendra à votre place, et une décision que vous n'avez pas spécifiée est une décision que vous rejetterez probablement.

Mettez les corrections au travail

Commencez par un livrable dont vous avez réellement besoin — une image produit, une affiche, une planche de personnage — et rédigez le brief dans l'ordre ci-dessus. Générez une ébauche, auditez-la par rapport aux six vérifications, modifiez un seul élément, puis comparez. Une fois que la boucle devient une routine, la même structure se transpose aux outils voisins : créez une image fixe avec le générateur text-to-image, affinez-la avec image-to-image, et conservez chaque étape acceptée comme entrée de la suivante. Un prompt qui se lit comme un brief plutôt qu'un souhait, c'est la différence entre une génération et six.

Informations sur l'article

Publié le
Générer des images avec GPT Image 2 : six erreurs courantes et leurs corrections