AI绘画怎么训练AI?垫图喂图和真训练是两码事
我的判断是:你想要的"训练AI",九成其实是垫图,剩下九成里的九成是LoRA微调,真正的模型训练轮不到普通人。我拿二十张钢笔手稿做了垫图对照,风格能延续,细节会漂。先分清三件事,再决定花不花那个功夫。
AI绘画怎么训练AI,这个问题我在群里被问过不下十次,问的人想做的多半不是训练,是"让AI画得像我"。目标没错,但路子得选对——垫图、风格参考、模型微调是三件成本差着数量级的事。
我拿自己的老钢笔速写做了轮实验,把三条路都踩了一遍,哪条路走到哪一步、花多少钱、出什么效果,这篇一次说清。
你以为的训练其实是三件事
让AI贴近某个风格有三条路:垫图即时生效、风格词零成本、LoRA训练稳定复现,成本和稳定性依次递增。按需选择就行,多数人停在垫图这一层就够了。
| 做法 | 成本 | 见效速度 | 风格稳定度 |
|---|---|---|---|
| 垫图 | 零成本,几张图 | 当场生效 | 单张有效,换图就散 |
| 风格词 | 零成本 | 当场生效 | 看词的精度,五五开 |
| LoRA训练 | 几十张图加训练时长 | 训练完长期复用 | 最稳,能批量复现 |
这张表是我踩完三条路之后的总结。垫图像给画师看一眼参考:这张照着这个味来,下一张你没给,它就忘了。LoRA则像把画师进修三个月,出来之后风格长在它身上。
二十张手稿的垫图对照实验
垫三张同风格手稿,出图的风格延续率大约七成,排线习惯和画面气质能跟住,透视习惯会漂。垫图选图比数量要紧,三张精挑的胜过十张乱塞的。
实验素材是我前年的老速写:二十张老城区门头,钢笔排线,透视普遍偏仰。我挑了三张构图最干净的当垫图,同一句提示词跑了两组各十张——一组带垫图,一组不带。
不带垫图那组全军覆没地"好看":圆润的卡通房子,明快的配色,跟我的钢笔画没半点关系。垫图组十张里有七张跟住了味道,排线的密度、黑白灰的节奏都在,拿给朋友看能认出是一个路数。漂掉的三张问题出在透视,我手稿的仰视习惯它没学全,出了两张平视一张俯视。
选图的经验也顺手记下:垫图三张里至少两张要和目标构图接近。我第二轮回试时换了一张俯视的图进去,出来的透视立刻乱套,垫图是引路的,路标歪了它跟着歪。
真想训练模型要备什么
训练一个风格LoRA,门槛是三十到六十张同风格图、几十分钟的训练时长和几块到几十块的费用。数据集的质量决定一切,风格统一比数量堆砌有用得多。
我后来在一个训练平台上真跑了一次LoRA,素材就是我那二十张速写,不够,又补画加扫描凑到三十六张。训练四十多分钟,费用折下来不到十块钱。出来的LoRA画门头确实一耳朵像我,画人物就露馅了——数据集里压根没有人。
这次训练教会我的三件事:素材风格必须统一,混进两张风格漂的图整个就毁了;场景要多样,全是同一个角度它就只会那个角度;想画什么就喂什么,它不会举一反三。
还有条规矩得放前面:训练用的必须是自己作品的图,或者拿到授权。拿别人的画风训练再拿去卖图,这事平台在查,圈子里更容不下。风格可以学,署名的便宜不能占。
风格词这条路别小看
把自己的风格特征翻译成描述词,零图零成本也能出三分味道,还是训练打标签的基本功。练的是观察:你的画到底有什么可识别的特征,得先说得出才写得出。
我为自己的钢笔画写了这么一串:钢笔排线,高对比黑白,建筑速写,仰视透视,线条密而干燥。出图大概有三分我的味道,垫图当然比它强,可这串词的真正价值在别处——训练LoRA打标签时,用的就是同一套语言。
换个场景说它更实际:作品没有电子版、懒得扫描的人,风格词是唯一轻量的选择。周末在纸上画了两张,晚上想出同风格的图,翻手机拍照垫图也行,写词也行,看你手边有什么。
实验跑完,我把二十张速写重新扫描归档,垫图三张、训练素材三十六张,分两个文件夹存好。三条路我都走过了,现在的心得浓缩成一句:先垫图试试水,不够用再训练,别一上来就冲着"训练"两个字去——那两个字听着唬人,多数时候你要的只是一次聪明的参考。
常见问题
垫图张数越多效果越好吗?
不是。我的经验是三到五张精选就到顶了,再多反而互相打架。关键是垫图之间风格要一致,构图最好有梯度。
训练LoRA需要会写代码吗?
现在不需要,训练平台把流程做成了填表:传图、打标签、点开始。难点全在准备素材那一环,那一步没法偷懒。
为什么训练出来的模型只会画一种场景?
数据集太窄。喂了三十张同角度的门头,它就只会门头。想让LoRA泛用,素材的场景、角度、光线都要拉开。
垫图和LoRA可以一起用吗?
可以,加载自己训练的LoRA再垫图,相当于风格长在它身上又临时给了张参考。我出系列图时就这么干,一致性比单用哪一种都好。