照片转化为AI绘画怎么搞?风格迁移实测
简单说:照片转AI绘画靠的不是一键转换,而是ControlNet卡结构、IP-Adapter喂风格,权重0.6到0.8最稳,先SDXL再局部重绘。照着做不翻车。
有没有试过把自己拍的照片转化为AI绘画?老实讲,第一次我以为是按个按钮的事,结果出图人脸糊成马赛克,整整调了一下午。后来才弄明白,照片转AI绘画不是"一键魔法",它本质是让AI照着你的参考图重画一遍——结构你给、风格AI出。所以你光丢张图进去没用,得告诉AI"参考到什么程度、风格往哪走"。这点搞清楚,后面就顺了。
这篇不讲虚的,我把自己踩过的坑和实测参数都摆出来。想从零补基础的,可以先看什么是AI绘画的原理入门,再回来看这篇会顺很多。
先搞清楚三条路,别上来就图生图
照片转AI绘画有三条路——ControlNet卡线稿、IP-Adapter搬风格、图生图直接喂。前两者稳,图生图最快但最容易跑偏。我个人觉得新手最容易踩的坑就是只用图生图,结果出图跟原图"像又不像",怪得很。
三条路里,图生图(img2img)就是丢张照片进去,给个提示词让AI重画,重绘幅度一般开0.3到0.5。开低了像原图加了滤镜,开高了人脸直接换人。它快,但控制力最差。
ControlNet是另一种思路,它先用预处理器把你的照片拆成线稿、深度图这些"骨架",再让AI照骨架重画。结构锁得死,风格随便换。
IP-Adapter更偏风格——你给它一张参考画,它把那张画的色调笔触"借"过来,套在你的照片结构上。和ControlNet搭配是绝配。
三件套搞明白,你就能去读如何画AI绘画的完整入门那种基础文了,思路接得上。
ControlNet才是主力,canny加depth双控
做人像转换我最常用canny线稿锁轮廓加depth深度图锁体积,两个ControlNet叠一起,权重都开0.6到0.7,人脸基本不崩。这套是我反复试出来的,单用canny容易平面化,单用depth轮廓会飘。
预处理器选canny(边缘检测)锁外形,depth(深度图)锁前后关系。两个ControlNet叠在ComfyUI或WebUI里,canny权重0.65、depth权重0.6,CFG开5.5,步数28,采样器用DPM++ 2M Karras——这是我现在的人像标配。出图约15秒一张,4060Ti上。
说个翻车事:最早我把canny权重开到1.0想"锁死点",结果整张图像被线框框死,AI一点发挥空间没有,画出来跟描红一样死板。后来降到0.65才平衡。ControlNet权重不是越高越好,留点余地给AI发挥反而自然。
还有个坑:canny对低光照片不友好,黑乎乎的夜景canny出来全是噪点线。这种情况换lineart或者depth独挑大梁更靠谱。
IP-Adapter决定风格,但权重别开太大
风格靠IP-Adapter喂参考图,权重0.55到0.75区间最稳,开到1.0以上人脸就糊成油画笔触——这是我翻车最多次的地方。
IP-Adapter的玩法是丢一张你想要的风格参考图进去(比如梵高星空、二次元插画、赛博朋克霓虹),它把这张画的色调和笔触借过来,套在ControlNet锁好的结构上。
我建议先用IP-Adapter plus版(不是基础版),细节还原好一截。做人像的话可以再加个IP-Adapter FaceID,专门稳脸。
参考图选片有讲究。别选太抽象的画当风格参考,AI会跟着乱。我自己最爱用那种"色彩明确、笔触清晰、构图简单"的画,比如莫奈风景或者新海诚那种干净天空。复杂构图参考图会让IP-Adapter抓不到重点。
想看更宽的创作方法论,可以翻翻从灵感到成片的创作方法,这篇偏整体流程,跟本篇的"转照片"互补。
模型选错全白搭,SDXL甩SD1.5一截
转照片我用SDXL系底模,推荐realvisxl或juggernautXL,出片率和细节都甩SD1.5一条街,尤其皮肤质感差距明显。SD1.5不是不能用,但转人像照片,SDXL明显更"真"。
根据 Civitai 社区模型库的下载和评分数据,SDXL系写实模型的平均评分比SD1.5时代头部模型高出一截,新手直接从SDXL起步少走弯路。SD1.5更适合做特定风格(比如老二次元模型),写实人像不是它的强项。
模型下载回来放models/Stable-diffusion目录,重启WebUI刷新就能看到。如果显存不够(8G以下),开xformers或者用--medvram参数能救一救。实在跑不动SDXL,SD1.5里realistic vision V5也能凑合,权重降低点。
模型加载这块如果操作卡壳,可以去 Hugging Face 模型站搜模型名,下载页一般有作者写的使用说明,比C站有时候还详细。
提示词别偷懒,负面词比正面词还重要
照片转AI绘画时负面词写deformed, blurry, extra fingers, bad anatomy基本能挡掉80%的崩图,正面词反而几句话够用。
正面词不用写小说。我的人像转绘正面词就一句:a portrait of a person, soft lighting, detailed skin texture, cinematic,再加风格描述词(比如oil painting style或者anime style)。够用了。
负面词才是大头。除了上面那几个万能词,转照片我还会加lowres, bad hands, missing fingers, mutated, ugly, watermark, jpeg artifacts。这一串加上去,崩图率明显降。
权重用法:关键词后面加括号和数字调权重,比如(masterpiece:1.2)是加强,(blurry:0.8)是减弱。别一上来全开1.5,容易过曝。我个人觉得权重1.1到1.3是甜区。
局部重绘救翻车,别整张从头来
眼睛画歪、手多根指头,别整张重画,用局部重绘(inpaint)框出来单独刷,5到8次内基本能修好。这是省时间的关键,整张重画等于赌运气,局部重绘才精准。
WebUI里切到img2img的inpaint标签,把出问题的区域涂蒙版,提示词单独写要修的部分(比如"left hand with five fingers"),重绘幅度0.5到0.6,只刷蒙版区域开(Only masked)。
有个小技巧:蒙版边缘羽化开大点(mask blur给4到8),修出来的边缘不会硬。刷完不满意就再刷一次,AI每次出图都不一样,多试几次总能挑到好的。
我个人觉得新手最容易在这步放弃。修一次不行就放弃了,其实再刷两三次大概率就成了。耐心值钱。
更多关于怎么从手绘草图转AI成图的思路,可以参考手绘转AI绘画的草图到成图流程,思路类似,都是结构先行。
常见问题
照片转化为AI绘画会侵权吗?
看你怎么用。你自己拍的照片转成画,自用没事。但如果拿别人的照片(尤其明星、网红)去转再公开发布,涉及肖像权。商业用更要谨慎,模型本身也有许可协议,SDXL商用要看 Stability AI 的许可条款,别想当然。
没有显卡能用在线版做吗?
能。在线版比如 civitai 的在线生图,以及一些基于SDXL的网页工具,都能跑ControlNet和图生图,速度慢点但能用。免费额度有限,重度用还是得上本地显卡。
ControlNet和IP-Adapter必须一起用吗?
不必须,但强烈建议一起。只ControlNet能锁结构但风格还得靠提示词硬写,难精准。只IP-Adapter有风格但结构会跑。两个一搭,结构风格都有了,出图成功率最高。新手可以先单独试IP-Adapter找感觉,再上ControlNet。
人脸总是崩怎么办?
三步排查:一是底模换SDXL写实系,SD1.5人像天生弱;二是加IP-Adapter FaceID模块,专门稳脸;三是canny权重降到0.6给AI发挥空间。还不行就inpaint局部重绘人脸区域,单独刷。我个人经历里,FaceID加上之后崩脸率从三成降到一成以内。
觉得有用的话分享给朋友吧。