伯纳德ai绘画项目:让同一个角色在50张图里长一张脸
我的判断是:角色一致性这件事,纯提示词扛不住,别硬扛。我给原创角色伯纳德做了五十张系列图,实测下来垫图能把同脸率拉到六成,训练LoRA之后稳在九成以上。先把角色卡写死,再谈出图。
伯纳德是我三月开始画的一个原创角色:圆框金属眼镜,浅棕色络腮胡,脖子上永远系一条姜黄色围巾,人设是个总在赶路的植物学家。计划给他出五十张系列插画,画到第八张我就发现了「伯纳德ai绘画」这类项目绕不开的问题——每张图的脸都在微妙地换人。这篇把这个项目的方法和数字完整复盘一遍,你要做连载角色、绘本主角,路线基本就这一条。
纯提示词的天花板,比想象中低
只靠提示词保持同一张脸,实测同脸率不到两成,写得再细也没用。提示词锁得住「特征清单」,锁不住五官的排列组合,这是两个层面的东西。
我一开始不信邪。把伯纳德的外貌写了一大串:圆框金属眼镜、浅棕络腮胡、姜黄围巾、绿色粗呢外套,连眉毛粗细都写了。跑五十张,翻来覆去看,眼镜形制大体在线,可脸型一会圆一会方,鼻子忽高忽低,有五张直接换了个人种。真算下来,能一眼认出「这是同一个伯纳德」的不到十张。
最气人的是配件漂移。姜黄色围巾,出着出着就变成军绿色、米白色,有张图干脆只剩围巾别针。模型对颜色的记忆是概率性的,你写死它也不认账。所以纯提示词这个阶段,我给它定性成「找感觉」:用来探索角色长什么样,而不是用来量产。
垫图和LoRA,差在哪一截
垫图是拿参考图压着模型画,省事但细节会漂;LoRA是给模型专门补课,前期费劲,之后又稳又快。两者不是二选一,我是垫图选稿、LoRA量产这么接力的。
| 方案 | 前期成本 | 同脸率 | 适合阶段 |
|---|---|---|---|
| 纯提示词 | 零 | 不到两成 | 前期找感觉 |
| 垫图 | 挑一张好底图 | 六成上下 | 定稿前的选型 |
| LoRA | 整理三十张图加四十分钟训练 | 九成以上 | 正式量产 |
垫图那段时间,我拿第八张里最满意的伯纳德当参考图,把相似度压在中等偏上,一张一张抽。三十张里挑出十八张像样的,进步明显,但代价是姿态被参考图拴住了,伯纳德永远微微侧身,想让他正面大笑就走形。
真正解决战斗的是LoRA。我从五十张里挑了三十张角度、光线上够干净的,打标整理花了两个晚上,训练本身四十分钟就跑完了。训练完的第一感觉是踏实:连出二十张,伯纳德就是伯纳德,左眉那道小疤都在它该在的位置。训练的具体步骤这篇不展开,我当时是照着LoRA训练入门那篇一步步来的,流程照搬就行。
数据集这边还有个反面教训值得记一笔。我起初贪多,把二十张早期光头版本的草图也塞了进去,结果首批出图里伯纳德时不时露顶。剔掉那二十张重训一遍,四十分钟,问题消失。数据集宁缺毋滥,这个道理训练前人人都懂,训练后才算真懂。
我给伯纳德定的角色卡
角色卡只写「不易漂移的锚点」:形制类特征写死,颜色和长度类特征交给参考图。一张卡加一套固定负面词,是我这套流程里最值钱的资产。
踩了几次坑之后,我把提示词里的外貌描述砍掉一半。像「络腮胡」「圆框金属眼镜」这种形制特征,模型记得住,留着;「姜黄色」「胡长三厘米」这种精确颜色和尺寸,模型记不住,删掉,交给垫图去压。每个场景固定挂同一套负面词:眼镜变色、围巾缺失、面部细节变化、多人。
还有个笨办法,特别好用:给每张图编号存档,伯纳德八号、九号这么排,隔十张就把新旧图摆一起对比一次。漂移是渐进的,单张看不出来,摆一起一眼假。我第三十多张的时候就是靠这么对比,才逮住他胡子悄悄变深棕的问题。
角色的三视图和表情设定怎么从零开始立起来,这篇AI角色设计教程写得更成体系,适合还在设计阶段的朋友。
第五十张上周交了,是伯纳德蹲在雨林里给一株蕨类拍照。那一批我一张没返工,四十分钟出完,剩下的时候都在修图调色。回头看三月那晚对着五十张废图发呆的自己,当时缺的不是运气,是一套流程。
常见问题
角色卡里的外貌描述,具体写多少条合适?
我的经验是五条上下,全是形制类锚点,比如眼镜形制、胡子类型、标志性配饰。写满一屏幕那种角色卡,模型反而每个特征都只画个大概。
没有显卡,也能训练自己的角色LoRA吗?
能,云端训练平台按小时收费,伯纳德那次四十分钟的训练换算下来也就几块钱。数据集整理的功夫才是大头,训练本身是最不费心的一步。
垫图用的参考图,用AI出的还是自己画的好?
都行,关键是够干净、特征清晰。我用的是AI出图里挑的一张正侧面,自己不会画画的,从AI图里选反而更快,注意别用别人的成品角色。
像伯纳德这样的原创角色,出图能商用吗?
角色是你自己设计的,商用主要看所用模型和平台的服务条款,训练数据集也必须全是自己的图。商用前把条款过一遍,别用别人的角色形象打底。