AI用图修图是什么?垫图修图的正确姿势和坑
参考图是拐杖:能帮你站稳,也能让你忘了自己本来会走路。AI用图修图的功夫在选图和给权重,不在堆参考图。动手前先想清楚你要抄的是风格、构图还是光线,一次只抄一样。
第一次接触AI用图修图,几乎所有人都会犯同一个错:把参考图当成答案整张照抄。我的判断很直接——参考图只负责定方向,成片好坏取决于你怎么选图、怎么调权重,这两件事比提示词写得花不花重要得多。
垫图修图的原理:AI抄的是感觉,不是像素
垫图是把参考图喂给AI当视觉锚点,AI提取它的色彩、构图和质感,再结合你的文字指令重新生成,并不是把参考图贴上去改两笔。
拿我常用的 Midjourney 举例:把参考图链接贴在提示词最前面,AI 会先给这张图算一个「视觉特征」,包括色调倾向、画面结构、材质感觉,然后跟你的文字描述做融合。文字说「黄昏、暖光」,参考图是冷蓝夜景,两个信号就在打架,最后听谁的,看权重怎么给。
打个比方,参考图像你给厨师看的一道成品菜的照片。厨师看的是火候、摆盘和配色思路,端上来的还是你点的那道菜,不是把照片里那盘直接端给你。想通这一点,你对垫图的期待值就对了。
我今年3月刚上手时完全没搞懂这个,垫了一张莫兰迪色调的室内图,提示词里写「阳光下的咖啡馆」,出来四张全是灰扑扑的,气得我直接关掉页面。后来才明白,参考图那边的灰调特征被带进来了,文字里的「阳光」没打赢。
参考图怎么选、权重怎么给才不跑偏
选图挑单主体、光线干净、色彩不超过三种的;权重从默认值起步,风格不稳就小幅上调,细节糊了再降回来,每次只动一档。
选图我有一套挑法,练了一年基本成了肌肉记忆:
- 主体只有一个。参考图里塞三个物体,AI 会分不清你要抄哪个,混着来。
- 背景别抢戏。纯色墙、大留白的图最稳,我自己存了一个 40 多张的素材夹,全是窗光静物。
- 色彩克制。三色以内、明暗对比适中的图,垫出来最不容易脏。
权重方面,Midjourney 的 --iw 我常驻 1.25,这个值文字指令和参考图大概五五开。风格想再贴一点,一次加 0.25,加到 1.5 我就停手了。玩 --sref 锁色调时,--sw 我从 150 起步,最高没超过 400。要说保人脸,--cref 配 --cw 100 基本够用,想放点变化就降到 80。
翻车也翻过。有一次我把 --iw 直接拉到 3,想看看上限是什么样,结果出来的画面跟参考图几乎一模一样,我写的文字指令完全没参与,等于白写。AI用图修图里「权重给满」听起来很稳,其实是把方向盘交了出去。提示词那边不知道怎么配合的,可以看这篇AI修图描述怎么写,垫图和文字是搭着来的,缺一边都不行。
7月底我还专门做了一轮对比测试,同一张图、同一句提示词,只动 --sw:0、150、400、800 各跑两组。400 往上,参考图的颗粒感就开始往画面里钻;800 那两组,八张里六张的纹理跟参考图一个模子。从那以后我的 --sw 上限就定死在 400,测试花掉的快门次数大概二十多次,值。
参考图为什么会「污染」你的照片?
污染多半是参考图权重过高、风格太强势,AI把它的色调、材质甚至人脸特征混进了你的画面,降权重、换图或加负面描述都能救。
说个我印象最深的惨案。今年5月,朋友开茶馆,让我帮他修一组探店照。我脑子一热,垫了张赛博朋克的城市夜景做「氛围参考」,--iw 给到 2。出来的图,茶杯边缘泛着霓虹紫光,朋友的脸侧还有一道蓝色反光。他看完在微信里给我发了一串问号,配一句「我这是茶馆还是夜店」。
重跑三版才救回来。最终方案:把赛博朋克那张直接扔掉,换一张窗光下的茶具静物只当光线参考,--iw 降到 0.75,色调用 --sref 单独锁,--sw 给 120。提示词里明确写「自然光、原木色调」。8月底他那批新照片我又用这套流程跑了一次,20 张里 14 张能直接用,成片率比之前瞎垫的时候高出一大截。
污染这个事,说白了就是参考图里有什么,AI 就往你图里掺什么,它不懂「只要氛围不要霓虹」。你自己不替它做减法,它就全给你。跑题说一句,我现在连给家里猫拍照都习惯先翻素材夹找光线参考,职业病没救了。话说回来,这套减法思路在正经修图上确实一直好使,前提是你得清楚参考图每一处特征都可能渗进来。
后来我养成了一个体检查毒的习惯:每次垫新图,先用低权重跑四张小样,专看边角——杯子边缘、皮肤高光、阴影里最容易被污染。干净,再往上调;脏了,立刻换图,不心疼。这个两分钟的小动作,帮我省下的重跑次数早就数不清了。
绕了一圈,回到开头那句话:参考图是拐杖。拐杖选对了,走路的姿态稳很多;但你不能指望拄着拐跑出成绩。选单主体、干净光线的图,权重小步调,时刻盯着参考图在往你画面里掺什么——这三件事做到位,垫图才算真帮你。剩下的,多跑几次比看什么都管用。
常见问题
一次垫几张参考图比较合适?
建议两张以内。Midjourney 一条提示词里贴多张图链接是允许的,我最多同时垫过三张,结果是三张图的风格互相稀释,出来一种谁都不像的中间态。想同时锁光线和色调,更稳的做法是一张当光线参考、另一张挂到 --sref,各管各的。
垫图和把原图喂给AI重绘有什么区别?
垫图抽的是特征,重绘动的是像素。垫图模式下AI只参考风格、构图这类抽象信息,画面内容由文字重新定义,自由度高但不像原图;重绘(比如局部重绘、重打光)是在原图基础上修改,保真度高但改动范围有限。修自己的照片用重绘,做风格化输出用垫图,别拧着用。
手机上能玩垫图吗?
能。Midjourney 网页版、即梦这类工具都支持手机上传参考图,流程和电脑端一致。差别在于手机端权限滑块藏得深,比如 MJ 网页版的风格化强度要进设置面板二层才能看到,我第一次找了好几分钟。建议正式跑图前先在手机上跑一两张试试水,确认参数面板都能碰到再批量。
垫别人的图当参考,商用有风险吗?
有,而且容易忽略。垫图后AI生成的画面带了参考图的风格特征,如果参考图本身是受版权保护的作品,商业项目里用出来可能惹麻烦。我的习惯是只用自己拍的、免版权素材站的图,或者自己先跑一张无版权风格的图再拿它当参考,套一层「自产自销」。