AI绘画人模怎么用?人物模型出图的提示词

AI绘画人模怎么用?人物模型出图的提示词
AI绘画人模教程,人物模型参考模板与姿势控制出图

简单说:AI绘画人模的核心痛点是"换个姿势脸就变",解法是用LoRA锁定长相+ControlNet锁定姿势,配合人物模型参考图做图生图,才能画出同一个角色的多角度多姿势。

画AI绘画人模最让人抓狂的事,就是第一张画得特别满意,第二张想让角色换个姿势,结果出来的完全是另一个人。脸变了、身材变了、发型都变了。这个问题困扰了我好几个月,后来才搞明白"人模"这事儿得用LoRA和ControlNet组合解决。这篇就把我的完整流程讲清楚。

为什么AI画人模"换姿势就变脸"

纯文生图每次出图都是独立采样,AI不记得"上一张"长什么样,所以同一串提示词出图的角色长相也会随机波动,必须用LoRA或参考图给AI一个"长相锚点"。

这个原理搞懂了你就明白为什么不能靠提示词锁脸。我做过测试,同一个提示词"1girl, black hair, blue eyes, school uniform"连出10张,眼睛颜色从浅蓝到深蓝到偏紫都有,脸型也长短不一。提示词只能描述"类别",锁不住"个体"。

要锁个体,得给AI一个具体参考。两条路:一是训练这个角色的LoRA,把长相"焊"进模型;二是用图生图+参考图,每张图都拿原图当底。两种方法各有适用场景,下面分开讲。

LoRA训练:锁定角色长相

LoRA是用20-30张角色参考图微调出的小模型,权重0.6-0.8调用,能让这个角色的五官在各类姿势和场景里保持一致,是做角色连载的标准方案。

训练LoRA的流程:准备20-30张角色清晰图(不同角度、不同表情、不同光照)→用tagger自动打标→用Kohya脚本训练(建议学习率1e-4,dim 16-32)→得到一个几十MB的safetensors文件。调用时在提示词里写"",权重0.7是甜点值。

训练数据质量决定LoRA质量。我第一次训LoRA用的图全是同一个角度的大头照,结果训出来的LoRA只能画那个角度,侧脸和全身全崩。后来我学聪明了,30张图里至少包含5张全身、5张半身、5张侧脸、5张不同表情、10张多角度,训出来的LoRA才通用。训练好的LoRA可以传到Civitai模型库分享,也能下载别人训好的。

ControlNet:锁定姿势与表情

ControlNet是给SD加的"骨架控制器",用OpenPose锁定身体姿势、用Depth锁定深度、用Canny锁定线稿,能让角色摆出你指定的任何动作而不崩形。

ControlNet是人模控制的另一大利器。用法是:找一张你想让角色摆的姿势参考图(可以是真人照片、可以是3D模型截图)→用OpenPose提取骨架→喂给ControlNet→AI就按这个骨架出图。角色长相由LoRA定,姿势由ControlNet定,两者叠加就是"同一个角色摆指定姿势"。

我画一个角色的连续动作(比如走路、转身、坐下)就是这套流程:LoRA锁脸+OpenPose锁姿势,五张图同一个角色不同动作,连贯看就是个小动画的分镜。这个思路在AI绘画角色动作那篇讲得更细,想深入可以翻翻。

图生图+参考图的轻量方案

不想训LoRA的轻量方案是图生图——拿一张满意的角色图当底图,Denoising开0.3-0.5,改提示词换姿势/换衣服,能保持七成长相相似,适合一次性需求。

训LoRA费时费力,如果你只是临时要让一个角色出几张不同图,图生图够了。操作:把满意的角色图丢进图生图,Denoising开0.4左右(太低不变样,太高换人),提示词写新姿势或新服装,出来的图会保留原图约七成特征。

这个方法的局限是相似度上限不够高,出个三五张还行,出十张以上角色会逐渐"漂移",越画越不像原图。所以做长期项目(比如漫画连载、IP角色)依然得训LoRA,图生图只适合临时用。关于图生图的参数细节,AI画不出修复那篇有讲Denoising怎么调。

人物模型出图的提示词结构

人模出图提示词=LoRA调用+人物基础描述+姿势词+服装词+场景词+质量词,其中人物基础描述要写具体特征(发型颜色长度、眼色、肤色、身材),不能含糊。

给你一个我常用的完整模板:, 1girl, long black hair with side ponytail, deep blue eyes, fair skin, slender figure, wearing red dress, standing in flower garden, hands behind back, looking at viewer, soft natural light, masterpiece, best quality。其中LoRA调长相,后面描述补充细节,姿势词"standing、hands behind back、looking at viewer"锁定动作。

人物基础描述这块越具体越好。"black hair"太笼统,"long black hair with side ponytail、blunt bangs、hair reaches waist"这样写,AI才知道你要的发型长什么样。我个人觉得人模提示词的功夫一半在描述具体性上。

实测参数与翻车案例

人模出图我推荐参数Steps 28、CFG 7、Sampler DPM++ 2M Karras、Hi-res fix开2倍放大,LoRA权重0.6-0.8,低于0.5像得不够,高于0.9会过拟合出伪影。

LoRA权重是个玄学值。我做过对比:0.5时角色只像五成,0.7时九成像,0.9时像过头了开始出训练图里的瑕疵(比如训练图背景的杂物被画进新图)。所以0.7是我反复试出来的甜点,新手先用这个值。

翻车案例:我有次LoRA权重开0.9,结果新图里角色背景出现了一片莫名的草地——因为我训练图里有几张是草地背景的,LoRA把背景也"学进去了"。解决办法是权重降到0.7,并且在negative prompt里加"outdoor background、grass"把多余背景压下去。根据Hugging Face上扩散模型的公开技术资料,LoRA过拟合确实会出现训练集特征泄漏,权重控制是关键。

还有个常见翻车是ControlNet和LoRA打架——ControlNet要角色摆A姿势,LoRA训练时角色都是B姿势,两者冲突出图就崩。解法是训练LoRA时姿势要多样化,别全是同一个姿势,这样LoRA不会和ControlNet冲突。关于本地部署跑SD和这些工具,可以看AI绘画电脑配置那篇,硬件跟不上跑不动。

常见问题

不训LoRA能画出一致角色吗?

能,但稳定性差。用即梦的"角色参考"功能或MJ的--cref参数,上传一张角色图做参考,后续出图会保持约六七成相似。适合临时用,做长期项目不够稳。

训练一个LoRA要多久?需要什么显卡?

用Kohya脚本训一个LoRA,30张图、2000步左右,RTX 3060 12G显存约需40-60分钟。显卡门槛不算高,但显存低于8G会比较吃力。云服务器租GPU也行,几块钱一小时,不想折腾硬件的可以走云端。

同一个角色能换不同风格画吗?

可以。用角色LoRA+不同风格LoRA叠加调用,比如", ",权重调好就能让同一个角色出油画风、水彩风、赛博朋克风等不同风格。这叫"风格迁移",是LoRA叠加的常见玩法。

人模出图脸总是歪怎么办?

用ControlNet的Face控制脸朝向,或者在图生图阶段先出一张脸正的,再用inpaint局部精修脸部。我个人习惯是文生图出大方向→挑脸正的→inpaint修脸,三步走脸基本不会歪。

人模这事儿,说白了就是给AI一个"长相记忆"。LoRA是长期记忆,ControlNet是姿势记忆,图生图是短期参考。三套工具配合好,画出同一个角色的百变图集不是难事。如果你这篇对你有用,欢迎转发给同样在折腾角色一致性的朋友,或者收藏起来慢慢练。下一篇咱们聊聊培训课值不值得报,敬请关注。