- 博客
- 如何控制 AI 图像转换而不丢失原图
如何控制 AI 图像转换而不丢失原图
一套五步 AI 图像转换工作流:准备源图、选择转换档位、撰写与之匹配的需求说明,然后锁定随机种子、每次只迭代一个变量。

大多数令人失望的 AI 图像转换结果并不是模型失败,而是“旋钮”设置失当。你上传一张自己本来就喜欢的照片,描述想要的风格转换,工具回给你的要么是一张几乎一模一样的副本、只是加了一层滤镜,要么是一张完全不同的画面,把你的构图当成随便一个建议。这两种结果都源于同一个被忽略的决定:源图应该保留多少。
图生图(image-to-image)工具把这个决定明确摆到台面上。它们从你的图片出发,而不是从噪点出发,朝你的提示词走的距离更短,因此比全新生成能更好地保持构图、姿态和布局。Kling 的评测者把这种区分讲得很直白:文生图根据文字描述构建画面,而图生图以一张已有的图片加上指令作为起点,所以源图决定着主体、构图、风格和整体方向(Kling,最佳 AI 图像生成器)。控制这段距离有多短的参数有好几个名字——去噪强度(denoising strength)、图像权重(image weight)、创意度(creativity)、强度(strength)——有意识地设定它,才能把一次可用的转换和一次必须重做的转换区分开来。接下来是一套五步工作流,从准备源图一直到审查导出结果。
为什么源图到结果的距离才是真正的控制点
图生图流程中的一切都取决于一个数字。AI Horde 的参数文档直接说明了这一点:去噪强度控制起始画面被替换掉多少——接近 0 时源图基本被保留,处于中间时提示词可以重新设定图像风格而主体依然存活,接近 1 时源图几乎没有实际影响,而典型的运行值大约在 0.75(AI Horde,去噪强度)。
这个范围里有若干可用档位。一家教建筑师渲染自己模型的设计工作室把低档位定在 0.2–0.35,此时工具几乎不碰图像本身,只是添加材质和光线,同时保留每一条线;把高档位定在 0.7–0.9,此时只有松散的构图还能存活,其余部分都被重新创造(Studio Matrx,img2img 与 ControlNet)。它推荐用于建筑工作的中间设置大致是 0.35–0.5,并指出强度选错是 AI 渲染图看起来不像原来那栋建筑的最常见单一原因。
并非每个工具都会把这个数字交给你。OpenArt 关于控制输出与参考图相似程度的官方 FAQ 指出:Stable Diffusion 前端会提供一个强度滑块,Midjourney 使用图像权重参数,而 FLUX Kontext、GPT Image 2 这类上下文编辑模型完全没有滑块——因此必须在提示词里写明需要保留什么,例如“同时保持相同的面部特征和发型”(OpenArt,图生图指南)。你的“旋钮”可能是一个数字、一个滑块,也可能是一句话。其背后的决定完全相同。
第 1 步——准备源图并列出必须保留的内容
任何转换都无法恢复源图中不存在的信息,因此成本最低的质量提升发生在打开工具之前。Runway 的教程给出了务实的做法:如果你是从一张已有的照片或草图起步,就把它上传并描述你想要的转换,而不是从零开始构建(Runway,如何制作 AI 图像)。从真实画面起步,正是你能获得可靠构图控制力的原因。
准备工作不过是几分钟的整理。裁剪成你真正想要的取景范围,修正明显的曝光和色彩问题,并把任何你早就知道不想要的东西移除,这样模型就不会和原图较劲。现在就决定输出的宽高比,而不是事后再裁剪;同时保留一份未经改动的源图副本,因为每一步你都要拿它做对比。如果有精细的内容必须保留——产品标签、织物纹理、一张脸——在要求做保留它的转换之前,先确认源图足够清晰、承载得起这些细节。
然后在敲下任何提示词之前,先写下三个答案:
- 什么绝对不能改变? 身份特征、几何结构、标签文字、logo 位置和光线方向通常是恒定项。
- 你想要的唯一改动是什么? 每一轮只做一个主要改动,能让需求说明和审查都保持可控。
- 输出是什么形状? 分辨率、宽高比和格式应当写进计划里,而不是留到最后抢救。
第 2 步——在写提示词之前先选好转换档位
根据必须保留的东西来选档位,而不是根据你今天有多想冒险。三个档位足以覆盖大部分工作:
- 微调(约 0.15–0.35)。 几何结构、边缘和构图保持不变;提示词负责提供材质、光线和最终修饰。这个档位适合给产品图重新打光、添加颗粒感,或者整理一个主体本来就衬得很好的背景。
- 风格重塑(约 0.35–0.6)。 主体和布局保持不变,而表面、色板和氛围被重建——上面那家工作室推荐用它把粗糙的 3D 视图变成体块关系完好的精致渲染图。
- 重构(约 0.7–1.0)。 你保留的是一个想法,而不是一张图像。构图会漂移,细节会消失,任何你确实需要保留的东西都必须被刻意重新加回来。
有两条规则让这个选择保持诚实。如果客户或审查者会注意到某个元素的改变,那它就属于需要保留的一组,并把你推向更低的档位。而且要向上调整,而不是向下:从低于你以为需要的值开始,只有当结果回过来过于保守时才升高它。从一次过于保守的风格重塑中恢复,只需要多做一轮;而从被毁掉的构图中恢复,通常意味着重新开始。

第 3 步——撰写与档位匹配的需求说明
在低档位下,恒定项成为提示词中最长的部分,而改动描述很短。在高档位下则相反:你描述目标场景,并接受源图只是氛围上的参考。无论哪种情况,有一种结构能让需求说明保持可读——写明目标、描述改动、重申恒定项,然后补充融合提示,说明新像素应如何与旧像素衔接。
中间档位的一个例子:“把这张厨房照片重塑为温暖的北欧日光。只改变表面和光线:浅色橡木橱柜、柔软的亚麻织物、来自左侧的漫射日光。保持房间几何结构、相机角度、窗户位置和电器摆放不变。让阴影柔和度与反射与原始拍摄一致。”
OpenArt 自己的教程同样落到这两项义务上:写一段描述最终图像的提示词,并说明哪些必须保持不变(OpenArt)。Runway 补充了顺序上的建议——图像模型往往更看重靠前的词,所以把最重要的细节放在前面(Runway)。在实践中,正向描述也比否定清单更有效:告诉模型表面应该是什么样,比罗列它绝不能添加的一切更可靠。
第 4 步——锁定随机种子,每次只迭代一个变量
一旦档位和需求说明相匹配,就不要再把所有内容重写一遍。AI Horde 的建议是逐步改变数值并比较结果,它公布的示例都来自同一个提示词、同一个模型和同一个种子,只让所讨论的那项设置发生变化(AI Horde)。这就是值得照搬的纪律:锁定种子,每轮只改一个子句或一个档位步长,其余需求说明保持完全一致,这样你才能判断是哪一处编辑起了作用。
Luma 关于修订的指导方向相同——只改动需要改的部分,让已经通过的基础保持不变(Luma,AI 图像提示词指南)。有两类行为在多轮迭代中值得留意。如果结果偏离了你的恒定项,就把它更明确地重申一遍,而不是添加新指令。如果模型不断生成你不想要的元素,就更加精确地描述你确实想要的东西,而不是把禁止清单越写越长。当某一轮达到效果时,把确切的提示词文本和设置保存下来;这一行现在就是这个主体的预设。
第 5 步——限制改动范围,然后按原始尺寸审查
转换数值是全局性的:AI Horde 明确指出,它不会识别哪些对象或特征会被改变,而蒙版才是用来限制作用区域的工具(AI Horde)。结构控制更进一步。ControlNet 从你的输入中提取结构图——边缘、深度或姿态——并强制每一个生成的像素服从它,而提示词只负责提供风格;上下文编辑模型则完全不需要蒙版,只改变你指定的区域(Studio Matrx)。当任务确实很窄时,专用工具比通用工具更快:用生成式填充修复或扩展某个区域,用物体移除去掉干扰物,当只有颜色需要变动时用局部改色,而当取景本身必须改变时用图像扩展。在物体边缘周围留一点余量,让工具有空间把新像素融入旧像素。

然后认真审查,与未改动的源图并排、按原始尺寸查看,并依次问四个问题:我要求的改动真的发生了吗?恒定项是否守住了?新内容相对于原图的光线和透视是否摆放正确?还有别的东西动了吗?缩略图恰恰会掩盖真正要紧的缺陷——偏移的色相、被软化的边缘、悄悄挪动的 logo。对工具不得不凭空创造的部分,放大细看。
发布前值得了解的限制
有三项限制让这套工作流保持诚实。模型之间不能互换:排名会随任务变化,同样的措辞在另一个生成器里表现不同,所以在一个工具里好用的提示词,并不能保证在下一个工具里同样好用(OpenArt)。反复编辑会累积损伤:FLUX Kontext 的开发者 Black Forest Labs 记录到,同一张图片连续编辑六次之后会出现可见的画质退化,这很好地说明了为什么应该保持短链条和干净的源图(OpenArt)。而权利不会随像素一起转移:不要转换你无权使用的图像,不要以未被允许的方式提示生成可识别的人物或受保护的角色,并且在你的受众或平台期望时披露 AI 编辑。
今天就跑一遍这套工作流
一次看起来像“生成”的转换和一次看起来是有意为之的转换之间的差别,很少取决于什么魔法咒语。准备一份尽可能干净的源图,事先决定什么必须保留,选择能保护它的档位,撰写与档位匹配的需求说明,然后锁定种子、每次只动一个变量,最后按原始尺寸审查。跑起这个循环,强度数值就不再是一场抽奖。
打开 KOOX AI 图生图工具,载入你最好的源画面,并从比你以为需要低一档的位置开始。当你想要的改动是全画面的风格重塑时,这个工具就是正确的选择;当改动只涉及一个区域或一个属性时,把任务交给更窄的专用效果,让图像其余部分保持原样。