AI绘画怎么训练AI?垫图喂图和真训练是两码事

AI绘画怎么训练AI?垫图喂图和真训练是两码事
AI绘画怎么训练AI:垫图与风格训练的对照示意

我的判断是:你想要的"训练AI",九成其实是垫图,剩下九成里的九成是LoRA微调,真正的模型训练轮不到普通人。我拿二十张钢笔手稿做了垫图对照,风格能延续,细节会漂。先分清三件事,再决定花不花那个功夫。

AI绘画怎么训练AI,这个问题我在群里被问过不下十次,问的人想做的多半不是训练,是"让AI画得像我"。目标没错,但路子得选对——垫图、风格参考、模型微调是三件成本差着数量级的事。

我拿自己的老钢笔速写做了轮实验,把三条路都踩了一遍,哪条路走到哪一步、花多少钱、出什么效果,这篇一次说清。

你以为的训练其实是三件事

让AI贴近某个风格有三条路:垫图即时生效、风格词零成本、LoRA训练稳定复现,成本和稳定性依次递增。按需选择就行,多数人停在垫图这一层就够了。

做法成本见效速度风格稳定度
垫图零成本,几张图当场生效单张有效,换图就散
风格词零成本当场生效看词的精度,五五开
LoRA训练几十张图加训练时长训练完长期复用最稳,能批量复现

这张表是我踩完三条路之后的总结。垫图像给画师看一眼参考:这张照着这个味来,下一张你没给,它就忘了。LoRA则像把画师进修三个月,出来之后风格长在它身上。

二十张手稿的垫图对照实验

垫三张同风格手稿,出图的风格延续率大约七成,排线习惯和画面气质能跟住,透视习惯会漂。垫图选图比数量要紧,三张精挑的胜过十张乱塞的。

实验素材是我前年的老速写:二十张老城区门头,钢笔排线,透视普遍偏仰。我挑了三张构图最干净的当垫图,同一句提示词跑了两组各十张——一组带垫图,一组不带。

不带垫图那组全军覆没地"好看":圆润的卡通房子,明快的配色,跟我的钢笔画没半点关系。垫图组十张里有七张跟住了味道,排线的密度、黑白灰的节奏都在,拿给朋友看能认出是一个路数。漂掉的三张问题出在透视,我手稿的仰视习惯它没学全,出了两张平视一张俯视。

选图的经验也顺手记下:垫图三张里至少两张要和目标构图接近。我第二轮回试时换了一张俯视的图进去,出来的透视立刻乱套,垫图是引路的,路标歪了它跟着歪。

真想训练模型要备什么

训练一个风格LoRA,门槛是三十到六十张同风格图、几十分钟的训练时长和几块到几十块的费用。数据集的质量决定一切,风格统一比数量堆砌有用得多。

我后来在一个训练平台上真跑了一次LoRA,素材就是我那二十张速写,不够,又补画加扫描凑到三十六张。训练四十多分钟,费用折下来不到十块钱。出来的LoRA画门头确实一耳朵像我,画人物就露馅了——数据集里压根没有人。

这次训练教会我的三件事:素材风格必须统一,混进两张风格漂的图整个就毁了;场景要多样,全是同一个角度它就只会那个角度;想画什么就喂什么,它不会举一反三。

还有条规矩得放前面:训练用的必须是自己作品的图,或者拿到授权。拿别人的画风训练再拿去卖图,这事平台在查,圈子里更容不下。风格可以学,署名的便宜不能占。

风格词这条路别小看

把自己的风格特征翻译成描述词,零图零成本也能出三分味道,还是训练打标签的基本功。练的是观察:你的画到底有什么可识别的特征,得先说得出才写得出。

我为自己的钢笔画写了这么一串:钢笔排线,高对比黑白,建筑速写,仰视透视,线条密而干燥。出图大概有三分我的味道,垫图当然比它强,可这串词的真正价值在别处——训练LoRA打标签时,用的就是同一套语言。

换个场景说它更实际:作品没有电子版、懒得扫描的人,风格词是唯一轻量的选择。周末在纸上画了两张,晚上想出同风格的图,翻手机拍照垫图也行,写词也行,看你手边有什么。

实验跑完,我把二十张速写重新扫描归档,垫图三张、训练素材三十六张,分两个文件夹存好。三条路我都走过了,现在的心得浓缩成一句:先垫图试试水,不够用再训练,别一上来就冲着"训练"两个字去——那两个字听着唬人,多数时候你要的只是一次聪明的参考。

常见问题

垫图张数越多效果越好吗?

不是。我的经验是三到五张精选就到顶了,再多反而互相打架。关键是垫图之间风格要一致,构图最好有梯度。

训练LoRA需要会写代码吗?

现在不需要,训练平台把流程做成了填表:传图、打标签、点开始。难点全在准备素材那一环,那一步没法偷懒。

为什么训练出来的模型只会画一种场景?

数据集太窄。喂了三十张同角度的门头,它就只会门头。想让LoRA泛用,素材的场景、角度、光线都要拉开。

垫图和LoRA可以一起用吗?

可以,加载自己训练的LoRA再垫图,相当于风格长在它身上又临时给了张参考。我出系列图时就这么干,一致性比单用哪一种都好。

延伸阅读