- 博客
- 用 AI 提示词编辑图像:一套减少返工的四阶段工作流
用 AI 提示词编辑图像:一套减少返工的四阶段工作流
用 AI 提示词编辑图像,采用四阶段工作流:准备源图、撰写受约束的需求说明、对照清单审视,并每次只精修一个变量。

最令人失望的 AI 图像编辑,往往不是模型的失败,而是需求描述的失败。你把一张在混合光线下用手机随手拍的照片丢进去,输入"让它看起来更专业",然后拿一个从未被明确目标的结果去评判模型。用 AI 提示词编辑图像,奖赏的是一种不同的习惯:把模型当成一位技艺娴熟的精修师,他需要一份精确的指令——哪些应该改变、哪些必须保留,以及新像素该如何与原有像素贴合。
本指南把可靠的图生图编辑拆解为四个阶段:准备输入、把编辑写成一份受约束的需求说明、用固定的检查清单审视每一个结果,以及每次只调整一个变量。无论你是在清理产品图、替换背景,还是重塑一张人像的风格,这套循环都适用,而你可以借助一款通用编辑器,比如 KOOX AI 上的 AI 图生图工具,从头到尾把它跑一遍。
第一阶段:在动手写提示词之前,先准备好输入
再好的提示词也跑不赢它的源图。最有效的准备步骤,是从你手里最清晰、光线最好的那一版图片出发,并保留一份未经改动的副本作为参照。如果你打算替换背景,一张干净、简洁的原图会让这项编辑容易得多;如果你打算保留人脸,一张正面、光照均匀的画面能给模型更多可发挥的空间——现代编辑模型专门为这类多步骤工作内置了面部与身份保持能力(OpenAI 的 GPT Image 提示词指南)。
在写提示词之前做一点清理工作,能为之后省下大量重复尝试。裁剪成你真正想要的构图,解决源图中任何明显的曝光或色彩问题,并删掉你早已知道要去除的东西,这样模型就不必再和原图较劲。如果这次编辑依赖清晰的文字——产品标签、招牌、图像里的一行短标题——先确认源图中的文字是可辨认的,因为清晰的源图能给模型一个准确的对象去保持。尽量以最高分辨率工作,并提前决定输出的宽高比,而不是事后再去裁剪结果(Let's Enhance 提示词指南)。
在动笔写哪怕一个字的提示词之前,先回答三个问题,并把答案写下来:
- 哪些绝不能改变? 身份、产品标签、标志的位置、相机角度和光线方向,通常是那些不变的项。现在就点明它们,才能阻止模型去"改进"某个你需要保留的东西。
- 你真正想要的那一处改动是什么? 替换背景、更换材质、色调偏移、添加一个物体。每一轮只做一处主要改动,能让需求说明保持清晰可读。
- 你需要什么样的输出形态? 宽高比、分辨率和格式应当属于计划的一部分,而不是临时补救。
第二阶段:把编辑写成一份需求说明,而不是一个愿望
文生图和图生图对提示词的要求并不相同。全新的生成是从零开始,而编辑则从一张真实图像出发,因此提示词必须同时描述改动和约束。一个有用的基础结构,是 BRIA 的编辑文档所推荐的:目标 + 改动 + 不变量 + 融合线索。它给出的例子——"把瓶盖替换为拉丝铝材质。保持瓶身形状、标签文字、相机角度和背景不变。让反光和接触阴影与原影棚灯光相匹配"——展示了这四个部分如何同时发挥作用(BRIA 图像编辑最佳实践)。
Google 把同样的思路表述为一份可以逐条填写的简短清单:主体、构图、动作、位置、风格,以及——专门针对编辑——诸如"把男子的领带改成绿色"或"移除背景里的汽车"这样的直接编辑指令(Google 的 Gemini 图像提示词技巧)。
两个习惯能让需求说明更精准。第一,用完整的句子写出不变量,而不是指望模型自行推断;反复重申"保持相机角度、保持标签、保持光线",正是防止在多次迭代中出现缓慢漂移的关键。第二,把提示词当作一份创意需求说明,而不是一堆关键词:具体是好事,堆砌则不然,因为满篇自相矛盾的细节,和一个含糊的单字请求一样会让编辑陷入混乱(Cloudinary 的图像提示词指南)。

对于应当保持局部的编辑——一个物体、一种材质、一处颜色——蒙版或区域选择就是那把精确的工具。被蒙版覆盖的区域是被重新生成,而非被精修,所以让选区比物体边缘稍大一些,尤其是在头发、玻璃、布料和接触点周围,给模型留出融合的余地(BRIA)。专用的窄用途工具往往能让你直接达成目标:用生成式填充来扩展或修复某个区域,用物体移除来消除一个干扰元素,或者当只有颜色需要改动时,用局部改色。
第三阶段:对着检查清单审视,而不是凭感觉
用"它看起来好不好看"来评判结果,会掩盖掉在实际工作中最要紧的那些失败。改用固定的一组问题来审视,按这个顺序来:
- 你要求改动的那处东西,真的改变了吗? 把结果直接与那份未改动的参照图对比。
- 不变量守住了吗? 逐项检查标签文字、身份、几何结构和光线方向。
- 新内容在物理上融合了吗? 阴影、反光、透视和比例都应与画面其余部分一致——这正是需求说明中"融合线索"的那一半。
- 还有其他东西被改动了吗? 模型可能在不经意间改动产品的细微之处,因此在商业图像上,批准之前要仔细检查颜色、形状和材质(Cloudinary)。
把参照副本打开,与结果并排放在一起。一张单独看毫无瑕疵的编辑图,仍可能悄悄偏移了色相、柔化了一条边缘,或者裁掉了一个标志,而唯一可靠的捕捉方式就是直接对比。以完整尺寸审视同样重要:在缩略图里消失的瑕疵,往往在图像于大屏幕上观看或被打印出来的那一刻重新浮现,所以要放大查看人脸、手部、产品边缘,以及任何模型不得不凭空创造的区域。

第四阶段:每次只精修一个变量
结果不理想时,大多数人会重写整段提示词,而这并不会告诉他们究竟是哪个词起了作用。正确的做法是每轮只改一处——光线那一句、相机距离、材质,或者蒙版——然后重新生成。这种单变量原则,是几乎每一份编辑指南最终都会给出的建议,也正是它让你建立起对该工具可用的心智模型,而不是攒下一堆靠运气的提示词(Let's Enhance)。
另一个值得点明的变量,是模型各自的特性。对话式编辑器偏爱完整的段落和多轮打磨,偏重风格的生成器更喜欢简短、高信息量的短语,而结构化的扩散模型则对带权重的关键词有反应。在其中一个上奏效的提示词,未必能在另一个上奏效,所以要让需求说明保持可迁移,只调整措辞。如果某个工具开放了随机种子,在你打磨措辞或蒙版时就把它锁定,只有在编辑规格本身已经正确之后,再去改动种子(BRIA)。
在你重写任何东西之前,有两种精修值得一试。如果改动发生漂移,就把不变量更明确地重申一遍,而不是添加新的指令。如果模型不断凭空造出你不想要的元素,就把它更精确地描述成你确实想要的样子,而不是依赖一长串否定项——大多数现代模型对清晰的正面需求说明反应更好(Let's Enhance)。
让实践保持干净
负责任地编辑是工作流程的一部分,而不是事后才想到的补充。不要上传你没有使用权的源图,也不要以你无权采用的方式,为真实可辨认的人物、受保护的角色或品牌产品生成提示词。当一张图片要交付给客户、发布到平台或面向公众时,要披露它经过 AI 编辑,并且不要抹除或歪曲来源元数据。一份精确的需求说明是编辑的计划,而不是进行编辑的许可。
一套可以重复的循环
一张看起来"像是生成出来的"编辑图和一张看起来"有意为之"的编辑图,其差别通常在于准备和审视,而不在于什么魔法咒语。准备好你能得到的最干净的源图,写下一处改动,连同它的不变量和融合线索,对着固定的检查清单审视,然后每次只精修一个变量。把这一循环跑起来,模型就不再靠猜了。
打开AI 图生图工具,从一张好源图开始,写下你的第一份受约束的需求说明。