AI绘画多人美女构图技巧

AI绘画多人美女构图技巧
AI绘画多人美女群像构图与姿态控制

简单说:AI绘画多人美女最大的坑是全员撞脸,紧跟着是手脚乱成一团。解法不是堆人数,是用三角构图排位、用 ControlNet 锁姿态、用分区重画修脸,三招配合能稳定出三到五人群像。

AI绘画多人美女这事我去年栽得很惨。第一次生成四人合影,出来四个一模一样的脸,像四胞胎贴一起,再生成一次又变成六根手指互扯。折腾一个多月才摸出门道。这篇把我现在能稳定出多人图的方法拆给你。

为什么多人图这么难出

因为模型是按"单人脸"训练的,人数越多脸部一致性越崩。这不是提示词能解决的,是训练数据的天然局限。

单人图模型会把所有注意力放在一张脸上,细节拉满。一到多人,算力被分摊,每张脸拿到的资源就少,细节糊、五官挪位、表情复制粘贴全是这么来的。手部更惨,多人的手交错在一起,模型分不清哪只手是谁的,直接乱画。

所以多人图的核心思路不是"一口气生成一张完美群像",而是"先粗出再精修"。这个心态你得先有,不然会卡在反复抽卡的死循环里。涉及多人脸部的处理思路跟单人有共通处,AI绘画女生写真那篇讲过脸部精修,可一并参考。

三角构图是最稳的排位法

三人用正三角,五人用倒三角,别让人物排成一条直线。排成直线 AI 会默认把所有人画成一样高一样宽,看着像排队拍照,毫无美感。

三角构图的提示词写法是把位置说清楚:three women standing, one in center foreground, two slightly behind on left and right, forming a triangle composition。这个 forming a triangle composition 别省,加了模型真会把人往三角位上摆。

我做过对比,同样三个人的提示词,加三角构图指令的出片,人物间距和层次明显比不加的好。不加的那种三人挤一团,加了的自动拉开前后景。

构图这件事值得专门花时间抠,AI绘画大透视构图那篇把空间层次讲得透,多人图尤其受益。我自己看完那篇后才真正理解为啥我之前的图总是"挤"。

姿态怎么避免缠成一团

用 ControlNet 的 OpenPose 锁每个人的骨架,比纯靠提示词稳十倍。这是多人图最关键的技巧,没有之一。

纯提示词写 two women hugging, arms around each other,出来基本是四只手扭成麻花。换成 OpenPose,你先在参考图上画好两个骨架点位,模型按骨架走,手该在哪就在哪,错位的概率大幅降低。

具体操作:先找一张构图参考图(不用是美女,只要是姿态对的),丢进 OpenPose 预处理器生成姿态图,再配合你的提示词跑图。我一般 1024 分辨率,DPM++ 2M Karras,30 步,单张约 22 秒出图。多人因为 ControlNet 多一道处理,比单人慢 5 秒左右。

姿态参考图我常去 Civitai 模型库扒,那里有人专门传姿态参考包,省得自己摆拍。

撞脸问题怎么破

分区重画是终极解法,提示词只能缓解不能根治。撞脸这事光靠提示词写 different facial features 效果有限,模型照旧会偷懒画一样的脸。

我的流程是这样:先粗出一张整体构图满意的图,不管脸是不是一样。然后用图生图的局部重画,把每个人的脸框出来单独重画,重绘幅度 0.6 到 0.7,每次重画改一下提示词里的人种、发型、配饰。比如第一个人写 asian woman with long black hair,第二个人改 brown woman with curly hair,第三个人 blonde woman with ponytail。

这么操作下来,三张脸基本能拉开差异。代价是费时间,一张三人图我得花 15 分钟修脸,纯生成只要 22 秒。所以多人图接单我定价是单人图的 2.5 倍起步,不这么定价纯属亏本。

定价这块水深,AI绘画卖画变现那篇有具体的报价思路,接单前值得看。

提示词模板直接拿去用

下面这套是我反复验证过的三人合影模板,改改细节就能用。记好结构,比记词重要。

positive:
three beautiful young women friends, sitting together on a cafe sofa, woman on left wearing red sweater looking at camera, woman in center wearing white blouse laughing, woman on right wearing green cardigan looking at her phone, natural window light, warm cozy atmosphere, shot on 50mm lens, f2.0, shallow depth of field, candid moment

negative:
identical faces, cloned features, deformed hands, extra fingers, merged bodies, missing limbs, distorted faces, cartoon style, plastic skin

几个细节我专门调过。每个人单独写一句描述,包括衣服颜色和动作,这样模型才分得清谁是谁。identical faces 这个反向词必加,针对撞脸特效药。merged bodies 针对的是身体黏在一起的翻车,多人图高发。

四个人以上这套模板就不够用了,得换分层生成法——先画两人,再把另外两人用图生图加进去。这个我还在摸索,目前五人以上出片率不到三成。

光线一致性的隐藏坑

多人图的光必须从同一个方向来,否则脸花了你都不知道为啥。这个坑我踩过,三个人脸上三种光,像拼贴画。

提示词里光的方向写死一个:soft light from upper left window。别写 natural light 这种含糊词,模型会自己乱分配光向。多人场景里每个人脸朝向不同,光向不统一就必然有人脸花有人脸黑。

如果用的是摄影师参考图做图生图,注意原图的光向,提示词里光向跟原图一致才不违和。根据 Midjourney 官方社区的多人出图经验分享,光向一致是群像出片率提升的关键变量之一(参考 Midjourney 官网社区案例库)。

光向这事在单人图里影响不大,到了多人就是生死线。我现在的习惯是每张多人图先定光向再写别的,养成流程就不容易翻。

常见问题

多人图最多能稳定出几个人?

三个人最稳,四个人勉强,五个以上基本要靠后期拼接。我做过极限测试,五人纯生成出片率约 25%,六人降到 10%。所以接单时客户要五人以上群像,我会直接报"分层生成"的价,告诉客户周期长一点但能保证质量。

能不能让多个人有互动动作?

能,但必须上 ControlNet。纯提示词写两个人牵手、拥抱,出来的手基本是废的。用 OpenPose 锁骨架后,互动动作的出片率能从一成提到六成左右。复杂互动比如叠罗汉这种别想了,AI 现阶段搞不定。

多人图选什么模型好?

写实风选 SDXL 系底模型加写实 LoRA,二次元选 AnythingV5 或 Counterfeit 这类专门做人物的。多人图对模型的人物处理能力要求高,通用底模型容易出问题。我个人常用的是 SDXL 加一个写实脸部 LoRA,多人脸部细节比纯 SDXL 强一截。

出图后局部手部变形怎么修?

用图生图局部重画,框出手部区域,重绘幅度 0.5,反向词加强 deformed hands, extra fingers。一次修不好就多修几次,每次幅度微调。手是 AI 最难的部分,别指望一次到位,心态放平。

AI绘画多人美女这块确实比单人难一个量级,但掌握三角构图、ControlNet 锁姿态、分区修脸这三招后,出片率能稳定在六成以上。我自己也是从满屏四胞胎过来的,慢慢调出来的。你要是也在折腾多人图,欢迎把翻车图丢评论区,大家一起找问题。觉得有用的话转发给同样卡在多人构图的朋友,互相抄作业少走弯路。