- Blog
- Afbeeldingen genereren met GPT Image 2: zes veelgemaakte fouten en hun oplossingen
Afbeeldingen genereren met GPT Image 2: zes veelgemaakte fouten en hun oplossingen
Een diagnostische gids voor de zes fouten die herhaallussen veroorzaken wanneer je afbeeldingen genereert met GPT Image 2, elk voorzien van het gecorrigeerde promptpatroon dat je in plaats daarvan kunt gebruiken.

Het genereren van afbeeldingen met GPT Image 2 mislukt zelden omdat het model zwak is. Het mislukt omdat de prompt het model een beslissing laat nemen die je niet wilde overdragen: het oppervlak waarop een product staat, de kleur van een jas tussen twee bewerkingen, de grootte van de woorden op een poster. OpenAI's eigen richtlijnen benoemen waar GPT Image 2 nog hulp nodig heeft — lange complexe prompts, nauwkeurige tekstplaatsing, terugkerende personages en merkelementen die tussen afzonderlijke generaties afwijken, en lay-outs waarin elementen op een exacte plek moeten landen. Elk daarvan is een beslissingspunt, en elk ervan wordt beslecht door een promptgewoonte in plaats van door het model. Deze gids benoemt de fouten die van een duidelijk verzoek een reeks herdoen maken, en koppelt aan elk ervan het gecorrigeerde patroon dat je kunt plakken in de GPT Image 2-tool op KOOX AI.
Fout 1: een sfeer beschrijven in plaats van een concreet resultaat
De meest voorkomende fout gebeurt voordat het model iets tekent: de prompt beschrijft een gevoel, niet een concreet materiaal. "Een coole futuristische speaker, cinematisch, veel detail" vertelt GPT Image 2 wat je mooi vindt, niet wat het bouwt. De promptgids van PixVerse noemt de oplossing "noem de opdracht vóór de stijl" — begin met het type output, zoals een productadvertentie, een poster, een character sheet, een UI-scherm of een eerste frame voor video, omdat een prompt die alleen uit stijlachtige bijvoeglijke naamwoorden is samengesteld, de norm voor succes ongedefinieerd laat.
Vergelijk de twee opdrachten:
Een coole futuristische speaker, cinematisch, veel detail.
Maak een premium productadvertentie voor een matzwarte draadloze speaker. Deze moet werken als een 16:9 campagnebanner met het product rechts, een kort headlinegebied links, schone negatieve ruimte en scherpe productranden.
De tweede prompt vertelt het model hoe het resultaat zal worden beoordeeld — op lay-out en bruikbaarheid, niet alleen op schoonheid. De gids van PrompTessor maakt hetzelfde punt vanuit de schrijfkant: begin met een definitie van een geaccepteerd materiaal, want "premium cinematische afbeelding" is een sfeer, terwijl "4:5 productfoto voor betaalde social met een tekstveilige zone" een specificatie is.
Fout 2: de wijziging benoemen maar niet de behoudlijst
Bewerkingsprompts mislukken wanneer ze alleen beschrijven wat moet veranderen. Een behoudlijst kan net zo belangrijk zijn als de gevraagde wijziging, want zonder zo'n lijst mag het model alles opnieuw tekenen waarvan het vindt dat het erbij hoort. De promptinggids van Felo vat dit samen als de alleen-de-wijziging-formule — benoem de wijziging en som daarna op wat moet blijven.
Vervang de geparkeerde auto door een vintage fiets. Behoud het huis, het hek, de oprit, de beplanting, de lichtrichting, de camerahoek en het tijdstip van de dag exact. Stem de schaal, contactschaduw en het perspectief van de fiets af op de bestaande scène.
Drie zinnen, drie taken: de bewerking, de vergrendeling en het fysieke realisme. Dezelfde structuur gaat ook op voor KOOX' image-to-image-tool, waar een scène-en-behoud-instructie het onderwerp vast houdt terwijl de omgeving verandert.
Fout 3: referentieafbeeldingen uploaden zonder rollen toe te wijzen
Wanneer er meerdere afbeeldingen ingaan, moet het model weten waarvoor elke afbeelding dient. "Gebruik de referenties" geeft GPT Image 2 de ruimte om alles door elkaar te mengen; aan elke afbeelding een rol toewijzen haalt die dubbelzinnigheid weg. Dit is de regel voor het omgaan met referenties die de gids van Felo samenvat als rollen, geen vibes, en PrompTessor laat het in de praktijk zien:
Afbeelding 1: primaire productidentiteit. Behoud de geometrie, het label, de vorm van de dop, de materialen en de verhoudingen.
Afbeelding 2: alleen lichtreferentie. Gebruik de zachte lichtbron en het gecontroleerde schaduwcontrast. Kopieer het onderwerp niet.
Afbeelding 3: alleen compositiereferentie. Gebruik de links-gewogen plaatsing en de verhouding van negatieve ruimte. Kopieer de kleuren of tekst niet.
Een stillere fout gaat hiermee gepaard: een referentieset één afbeelding tegelijk opbouwen. De GPT Image 2-gids van Flick waarschuwt dat afzonderlijke prompts afwijken, en dat een coherente batch — samen gegenereerd vanuit hetzelfde invariante blok — een blad oplevert dat met zichzelf overeenstemt in plaats van acht bijna-raak-missers.

Fout 4: erop vertrouwen dat de lopende tekst exacte tekst weergeeft
Tekst is het punt waarop een prompt ophoudt beschrijvend te zijn en een vergrendeld materiaal wordt. Als er woorden moeten verschijnen, citeer ze dan letterlijk, zeg hoe vaak ze moeten verschijnen en zeg wat er niet mag worden toegevoegd. "Een slogan over snelheid" nodigt het model uit om zelf tekst te verzinnen; een geciteerde regel met een plaatsingsinstructie doet dat niet. De gids van PixVerse raadt aan de headline woord voor woord te benoemen en beperkingen toe te voegen zoals "alleen exacte tekst", "geen extra woorden" en "geen dubbele tekst", en markeert de gevallen die als review-afhankelijk in plaats van prompt-afhankelijk moeten worden behandeld: exacte reproductie van een merklogo, kleine compliance-tekst en propriëtaire lettertypen. De modelnotities van Morphic bevestigen waarom — OpenAI noemt tekstplaatsing en helderheid nog steeds als een bekende beperking, dus een dicht blok kleine letters moet op de uiteindelijke weergavegrootte worden gecontroleerd in plaats van te worden aangenomen op basis van een thumbnail.
Fout 5: meerdere dingen tegelijk veranderen
Iteratie is waar afwijking zich opstapelt. Als één poging de belichting, de achtergrond en de tekst tegelijk verandert, kun je niet zien welke instructie werkte, en de volgende ronde begint met een afbeelding waarvan je de verschillen niet zelf hebt gekozen. De bewerkingsregels van Felo zijn bot: verander één ding per keer, en voer de eerder goedgekeurde output weer in in plaats van de scène opnieuw vanaf nul te beschrijven. De gids van Flick voegt de tweede helft van de gewoonte toe — herhaal de invarianten elke keer, want een prompt die één keer "navy bomber" zegt en later "blue jacket" nodigt het model uit ze als verschillende objecten te behandelen. Modellen wijken af zodra de beperkingen niet meer worden herhaald.
Fout 6: grootte, kwaliteit en achtergrond in de prompt laten staan
In gewone tekst vragen om "4K" of "hoge kwaliteit" is een suggestie; de parameter instellen is een garantie. De gids van Felo houdt een aparte sectie voor de instellingen die niet in de zin thuishoren, en het advies van PrompTessor is om keuzes voor model, kwaliteit, grootte, achtergrond en uitvoerformaat gescheiden te houden van de lopende tekst. Daaruit volgt een praktische regel: beschrijf in de prompt wat de afbeelding moet bevatten, en geef via de bedieningselementen aan hoe groot, hoe scherp en met welke achtergrond. Dezelfde discipline voorkomt het omgekeerde probleem — het opblazen van de tekst met parameterjargon dat het model leest als een esthetisch verzoek in plaats van een technisch.
Waarom pixelidentieke gebieden compositing vereisen, geen prompt
Eén beperking verdient een duidelijke vermelding, want ze verklaart een hele klasse van teleurstellende bewerkingen. Herhaalde bewerkingen kunnen details veranderen die je wilde behouden, en waar een gebied pixelidentiek moet blijven, luidt de gedocumenteerde richtlijn dat je de goedgekeurde bewerking terug in het origineel compositeert in plaats van op prompting te vertrouwen. Dat is geen gebrek in je formulering; het is de grens van wat een generatieve bewerking kan beloven. Als een logo, een juridische regel of een productlabel exact moet zijn, plaats het dan na generatie met een deterministische editor in plaats van het model te vragen het vast te houden.

Een checklist met oplossingen voordat je genereert
Loop deze zes vragen langs elke GPT Image 2-prompt voordat je een generatie uitgeeft:
- Resultaat — noemt de eerste regel het type output en waar het wordt gebruikt?
- Behoudlijst — staat bij een bewerking elk element dat niet mag veranderen opgeschreven?
- Referentierollen — heeft elke geüploade afbeelding een taak, en zijn niet-overdraagbare eigenschappen uitgesloten?
- Tekstvergrendeling — is de vereiste tekst geciteerd, geplaatst, geteld en omheind met uitsluitingen?
- Eén variabele — verandert dit, als het een iteratie is, precies één ding ten opzichte van de laatst goedgekeurde afbeelding?
- Instellingen — staan grootte, kwaliteit en achtergrond in de bedieningselementen in plaats van in de zin?
Zes vragen, zes kansen om een herdoen te vermijden. Het patroon erachter is in alle gevallen hetzelfde: elke dubbelzinnige formulering is een beslissing die het model voor jou neemt, en een beslissing die je niet hebt gespecificeerd is er een die je waarschijnlijk zult afkeuren.
Zet de oplossingen aan het werk
Begin met één materiaal dat je echt nodig hebt — een productstill, een poster, een character sheet — en schrijf de opdracht in de hierboven beschreven volgorde. Genereer een concept, toets het aan de zes controles, verander één slot en vergelijk. Zodra de lus routine voelt, gaat dezelfde structuur over op de aangrenzende tools: bouw een still met de text-to-image-generator, verfijn die met image-to-image en gebruik elke geaccepteerde stap als input voor de volgende. Een prompt die als een opdracht leest in plaats van als een wens is het verschil tussen één generatie en zes.