Generare immagini con GPT Image 2: sei errori comuni e come correggerli

Una guida diagnostica ai sei errori che causano cicli di rifacimento quando generi immagini con GPT Image 2, ciascuno accompagnato dal modello di prompt corretto da usare al loro posto.

Generare immagini con GPT Image 2: sei errori comuni e come correggerli

Generare immagini con GPT Image 2 raramente fallisce perché il modello è debole. Fallisce perché il prompt lascia al modello una decisione che non volevi delegargli: la superficie su cui poggia un prodotto, il colore di una giacca tra due modifiche, la dimensione delle parole su un poster. La guida di OpenAI stessa indica dove GPT Image 2 ha ancora bisogno di aiuto — prompt lunghi e complessi, posizionamento preciso del testo, personaggi ricorrenti ed elementi di brand che cambiano tra generazioni separate, e layout in cui gli elementi devono cadere in un punto esatto. Ognuno di questi è un punto decisionale, e ognuno viene risolto da un'abitudine nel prompt più che dal modello. Questa guida indica gli errori che trasformano una richiesta chiara in una serie di rifacimenti, e per ciascuno propone il modello corretto che puoi incollare nello strumento GPT Image 2 su KOOX AI.

Errore 1: descrivere un'atmosfera invece di un deliverable

L'errore più comune avviene prima che il modello disegni qualsiasi cosa: il prompt descrive una sensazione, non un asset. "Un altoparlante futuristico e cool, cinematografico, molto dettagliato" dice a GPT Image 2 cosa ti piace, non cosa sta costruendo. La guida ai prompt di PixVerse chiama la soluzione "dai un nome al lavoro prima dello stile": inizia dal tipo di output, come un annuncio di prodotto, un poster, un character sheet, una schermata UI o il primo fotogramma di un video, perché un prompt composto solo da aggettivi di stile lascia indefinito il criterio di successo.

Confronta i due brief:

Un altoparlante futuristico e cool, cinematografico, molto dettagliato.

Crea un annuncio di prodotto premium per un altoparlante wireless nero opaco. Deve funzionare come banner di campagna in 16:9 con il prodotto a destra, una breve area per il titolo a sinistra, spazio negativo pulito e bordi del prodotto nitidi.

Il secondo prompt dice al modello come verrà giudicato il risultato — in base al layout e all'usabilità, non solo alla bellezza. La guida di PrompTessor fa lo stesso punto dal lato della scrittura: parti da una definizione di asset accettato, perché "immagine cinematografica premium" è un'atmosfera, mentre "fotografia di prodotto 4:5 per social a pagamento con una regione sicura per il testo" è una specifica.

Errore 2: indicare la modifica ma non l'elenco di ciò che va preservato

I prompt di modifica falliscono quando descrivono solo ciò che deve cambiare. Un elenco di ciò che va preservato può contare quanto la modifica richiesta, perché senza di esso il modello è libero di ridisegnare tutto ciò che ritiene correlato. La guida ai prompt di Felo racchiude questo concetto nella formula della sola modifica: indica la modifica, poi elenca ciò che deve restare.

Sostituisci l'auto parcheggiata con una bicicletta vintage. Preserva esattamente la casa, la recinzione, il vialetto, il paesaggio, la direzione della luce, l'angolazione della camera e l'ora del giorno. Abbina la scala, l'ombra di contatto e la prospettiva della bicicletta alla scena esistente.

Tre frasi, tre compiti: la modifica, il blocco e il realismo fisico. La stessa struttura si applica allo strumento image-to-image di KOOX, dove un'istruzione di scena-e-preserva mantiene fisso il soggetto mentre cambia l'ambiente circostante.

Errore 3: caricare immagini di riferimento senza assegnare ruoli

Quando si inseriscono più immagini, il modello deve sapere a cosa serve ciascuna. "Usa i riferimenti" lascia a GPT Image 2 spazio per fondere tutto insieme; assegnare un ruolo a ogni immagine elimina quell'ambiguità. È la regola di gestione dei riferimenti che la guida di Felo riassume con "ruoli, non sensazioni", e che PrompTessor mostra in pratica:

Immagine 1: identità principale del prodotto. Preserva geometria, etichetta, forma del tappo, materiali e proporzioni.
Immagine 2: solo riferimento di illuminazione. Usa la sua fonte morbida e il contrasto controllato delle ombre. Non copiare il suo soggetto.
Immagine 3: solo riferimento di composizione. Usa il suo posizionamento spostato a sinistra e il rapporto di spazio negativo. Non copiare i suoi colori o il suo testo.

Un errore più silenzioso accompagna questo: costruire un set di riferimenti un'immagine alla volta. La guida di Flick su GPT Image 2 avverte che prompt separati si discostano, e che un batch coerente — generato insieme dallo stesso blocco di invarianti — produce una tavola coerente con se stessa invece di otto quasi-somiglianti.

Una singola carta semplice leggermente staccata da una pila ordinata di carte bianche su una superficie neutra

Errore 4: affidarsi al testo discorsivo per rendere un testo esatto

Il testo è il punto in cui un prompt smette di essere descrittivo e diventa un asset bloccato. Se delle parole devono apparire, mettile tra virgolette, indica quante volte devono apparire e specifica cosa non va aggiunto. "Uno slogan sulla velocità" invita il modello a inventare il testo; una riga tra virgolette con un'istruzione di posizionamento no. La guida di PixVerse consiglia di indicare il titolo testualmente e di aggiungere vincoli come "solo testo esatto", "nessuna parola in più" e "nessun testo duplicato", e segnala i casi da trattare come soggetti a revisione invece che a prompt: la riproduzione esatta di un logo di marca, il testo di conformità minuscolo e i caratteri tipografici proprietari. Le note sul modello di Morphic confermano il perché: OpenAI elenca ancora il posizionamento e la chiarezza del testo come limite noto, quindi un blocco denso di caratteri piccoli va verificato alla dimensione finale di visualizzazione invece che dato per scontato da una miniatura.

Errore 5: cambiare più cose contemporaneamente

L'iterazione è il punto in cui la deriva si accumula. Se un tentativo cambia insieme l'illuminazione, lo sfondo e il testo, non puoi capire quale istruzione ha funzionato, e il giro successivo parte da un'immagine le cui differenze non hai scelto tu. Le regole di modifica di Felo sono nette: cambia una cosa per volta e reintroduci l'output approvato in precedenza invece di descrivere di nuovo la scena da zero. La guida di Flick aggiunge la seconda metà dell'abitudine: ripeti ogni volta gli invarianti, perché un prompt che dice "bomber navy" una volta e "giacca blu" più avanti invita il modello a trattarli come oggetti diversi. I modelli derivano quando i vincoli smettono di essere ribaditi.

Errore 6: lasciare dimensione, qualità e sfondo nel prompt

Chiedere "4K" o "alta qualità" in prosa è un suggerimento; impostare il parametro è una garanzia. La guida di Felo dedica una sezione separata alle impostazioni che non dovrebbero stare nella frase, e il consiglio di PrompTessor è di tenere scelte come modello, qualità, dimensione, sfondo e formato di output separate dalla prosa. Ne segue una regola pratica: descrivi nel prompt cosa deve contenere l'immagine ed esprimi quanto grande, quanto nitida e con quale sfondo tramite i controlli. La stessa disciplina previene il problema inverso: gonfiare la prosa con un linguaggio da parametri che il modello legge come richiesta estetica invece che tecnica.

Perché le regioni identiche a livello di pixel richiedono il compositing, non un prompt

Un limite merita di essere detto chiaramente, perché spiega un'intera classe di modifiche deludenti. Modifiche ripetute possono alterare dettagli che intendevi preservare, e quando una regione deve restare identica a livello di pixel, la guida documentata è di ricomporre la modifica approvata nell'originale invece di affidarsi al prompting. Non è un difetto della tua formulazione; è il confine di ciò che una modifica generativa può promettere. Se un logo, una riga legale o un'etichetta di prodotto devono essere esatti, posizionali con un editor deterministico dopo la generazione invece di chiedere al modello di mantenerli.

Una singola carta bianca posata su una superficie neutra pulita accanto a un piccolo campione di colore semplice

Una checklist di correzioni prima di generare

Verifica queste sei domande su qualsiasi prompt per GPT Image 2 prima di spendere una generazione:

  1. Deliverable — la prima riga indica il tipo di output e dove verrà usato?
  2. Elenco di ciò che va preservato — per una modifica, ogni elemento che non deve cambiare è scritto?
  3. Ruoli dei riferimenti — ogni immagine caricata ha un compito, e i tratti non trasferibili sono esclusi?
  4. Blocco del testo — il testo richiesto è tra virgolette, posizionato, contato e delimitato con esclusioni?
  5. Una sola variabile — se questo è un'iterazione, cambia esattamente una cosa rispetto all'ultima immagine approvata?
  6. Impostazioni — dimensione, qualità e sfondo sono nei controlli invece che nella frase?

Sei domande, sei occasioni per evitare un rifacimento. Lo schema che le accomuna è lo stesso: ogni frase ambigua è una decisione che il modello prenderà per te, e una decisione che non hai specificato è una che probabilmente respingerai.

Metti al lavoro le correzioni

Inizia con un asset di cui hai davvero bisogno — uno still di prodotto, un poster, un character sheet — e scrivi il brief nell'ordine indicato sopra. Genera una bozza, verificala con le sei domande, cambia uno slot, poi confronta. Una volta che il ciclo diventa routine, la stessa struttura vale per gli strumenti vicini: costruisci uno still con il generatore text-to-image, perfezionalo con image-to-image e mantieni ogni passo accettato come input per il successivo. Un prompt che si legge come un brief invece che come un desiderio è la differenza tra una generazione e sei.

Informazioni post

Pubblicato il
Generare immagini con GPT Image 2: sei errori comuni e come correggerli