- 博客
- 用 GPT Image 2 生成图像:六个常见错误及其修正方法
用 GPT Image 2 生成图像:六个常见错误及其修正方法
一份诊断指南,梳理用 GPT Image 2 生成图像时导致反复返工的六个错误,并为每一个错误配以应当改用的修正提示词模式。

用 GPT Image 2 生成图像很少是因为模型太弱而失败。它失败,是因为提示词留给模型一个你本不打算交出去的判断:产品摆在什么表面上、两次修改之间夹克是什么颜色、海报上文字有多大。OpenAI 自己的指南指出了 GPT Image 2 仍需帮助的地方——冗长复杂的提示词、精确的文字摆放、在不同次生成之间会走样的重复角色与品牌元素,以及元素必须落在精确位置上的版式。这些每一条都是决策点,而每一条都不是靠模型、而是靠提示词习惯来解决的。本指南列出那些会把一个清晰的请求变成一轮返工的错误,并为每一个错误配上一个可以贴进 KOOX AI 的 GPT Image 2 工具 的修正写法。
错误 1:交代的是一种氛围,而不是一个交付物
最常见的失败发生在模型还没开始画之前:提示词描述的是一种感觉,而不是一个素材。“一台酷炫的未来感音箱,电影感,高细节”告诉 GPT Image 2 的是你喜欢什么,而不是它要造出什么。PixVerse 的提示词指南把修正办法称为“先点明任务,再谈风格”——从产出类型写起,比如产品广告、海报、角色设定图、UI 界面,或视频的第一帧,因为仅由风格形容词拼成的提示词,没有给“成功”下定义。
对比这两条需求简述:
一台酷炫的未来感音箱,电影感,高细节。
为一台哑光黑色无线音箱制作一张高端产品广告。它必须能用作 16:9 的营销横幅:产品位于右侧,左侧留出一小块标题区域,负空间干净,产品边缘锐利。
第二段提示告诉模型结果将如何被评判——看版式和可用性,而不只是看美感。PrompTessor 的指南从写作角度讲了同样的道理:先给“合格素材”下定义,因为“高级电影感图像”是一种氛围,而“带文案安全区的 4:5 付费社媒产品照”才是一份规格说明。
错误 2:只说明要改什么,却没说保留清单
修改类提示词之所以失败,是因为它们只描述了该动的地方。保留清单可能与所要求的改动同样重要,因为没有它,模型就可以随意重绘任何它认为相关的东西。Felo 的提示词指南把它总结成“只写改动”公式——先说明改动,再列出必须保持不变的东西。
把停着的那辆汽车换成一辆复古自行车。精确保留房屋、栅栏、车道、景观、光照方向、机位和一天中的时段。让自行车的比例、接触阴影和透视与现有场景一致。
三句话,三项任务:改动、锁定、物理真实感。同样的结构也适用于 KOOX 的 图生图工具:用“场景 + 保留”的指令,在环境改变的同时把主体固定住。
错误 3:上传参考图却没有分配角色
当输入多张图时,模型需要知道每一张是干什么用的。“用好这些参考图”会让 GPT Image 2 有空间把所有东西混在一起;给每张图分配一个角色就能消除这种含糊。Felo 的指南把这条处理参考图的规则概括为“要角色,不要感觉”,而 PrompTessor 展示了它在实践中的样子:
图 1:产品的主要身份。保留几何形状、标签、瓶盖形状、材质和比例。
图 2:仅作布光参考。使用它柔和的光源和受控的阴影对比。不要照搬它的主体。
图 3:仅作构图参考。使用它偏左的布局和负空间比例。不要照搬它的颜色或文字。
还有一个不那么显眼的错误常与它相伴:一张一张地拼参考集。Flick 的 GPT Image 2 指南提醒,分开的提示词会走样,而一批连贯的图像——由同一段不变量一起生成——产出的设定图内部一致,而不是八张各自差一点的近似品。

错误 4:指望用散文把文字精确渲染出来
文字是提示词从“描述”变成“锁定素材”的地方。如果必须出现某些字,就把它们加引号写出来,说明它们该出现几次,并说明不许添加什么。“一句关于速度的标语”会诱使模型自己编文案;而一句带摆放说明的引文不会。PixVerse 的指南建议把标题逐字写出,并加上诸如“仅限指定文字”、“不要多余的字”、“不要重复文字”之类的约束,它还标出了那些应当靠人工审核、而不是靠提示词来把关的情况:精确复刻品牌标识、极小的合规说明文字,以及专有字体。Morphic 的模型说明印证了原因——OpenAI 仍把文字摆放和清晰度列为已知局限,所以一大片密集的小字应当在最终显示尺寸下检查,而不是凭缩略图想当然。
错误 5:一次改动好几个地方
迭代会让偏差不断累积。如果一次尝试同时改了布光、背景和文案,你就分不清是哪条指令起了作用,而下一轮又会从一张其差异并非你选定的图像出发。Felo 的修改规则很直白:每次只改一处,并且把上一版通过的输出重新喂回去,而不是从头再描述一遍场景。Flick 的指南补充了这个习惯的另一半——每次都要重复那些不变量,因为一段先写“藏青色飞行员夹克”、后面又写“蓝色夹克”的提示词,会诱使模型把它们当成不同的东西。一旦约束不再被重申,模型就会走样。
错误 6:把尺寸、质量和背景留在提示词里
在散文里要求“4K”或“高质量”只是一种建议;把参数设好才是一种保证。Felo 的指南专门单列了一节,讲那些不该待在句子里的设置,而 PrompTessor 的建议是把模型、质量、尺寸、背景和输出格式的选择与正文分开。由此得出一条实用的规则:在提示词里描述图像应该包含什么,而用控件来表达它多大、多锐利、背景是什么。同样的纪律还能避免相反的问题——用参数语言把正文灌得过满,让模型把它读成一种审美诉求,而不是技术要求。
为什么像素级一致的区域需要合成,而不是提示词
有一条局限值得直说,因为它解释了一整类令人失望的修改结果。反复修改可能改变你本想保留的细节,而当一个区域必须保持像素级一致时,官方给出的指导是把通过的修改合成回原图,而不是依赖提示词。这不是你措辞上的缺陷,而是生成式修改所能承诺的边界。如果某个标识、某条法律声明或某个产品标签必须分毫不差,那就别让模型去保住它,而应在生成之后用确定性的编辑器把它放上去。

生成前的修正清单
在花掉一次生成之前,用这六个问题过一遍任何 GPT Image 2 提示词:
- 交付物——第一行是否点明了产出类型以及它将在哪里使用?
- 保留清单——如果是修改,每一个必须不变的元素是否都写下来了?
- 参考图角色——每张上传的图是否都有明确用途,不可迁移的特征是否已排除?
- 文字锁定——必需的文案是否加了引号、说明了位置和次数,并用排除项圈定?
- 单一变量——如果这是一次迭代,它是否相对上一张通过的图只改了一处?
- 设置——尺寸、质量和背景是否放在控件里,而不是写在句子里?
六个问题,就是六次避免返工的机会。它们背后的规律是一样的:每一个含糊的措辞,都是模型替你做出的一个决定;而一个你没有明确说明的决定,多半就是你会否掉的决定。
把这些修正用起来
从一个你真正需要的素材开始——一张产品静物、一张海报、一张角色设定图——然后按上面的顺序写需求简述。生成一版草稿,用那六项检查审一遍,改动一个环节,再做对比。等这个循环变得顺手之后,同样的结构也能用到相邻的工具上:用 文生图生成器 造出静物,再用 图生图 把它完善,并把每一个通过的步骤作为下一步的输入。一段读起来像需求简述而不是许愿的提示词,就是一次生成与六次生成之间的差别。