AI绘画很多人同框怎么画?群像场景出图

AI绘画很多人同框怎么画?群像场景出图
AI绘画很多人同框的群像场景出图,几位姿态各异的人物在夜市街景中同框

简单说:ai绘画很多人同框的核心是控制人数在4到6人、用分组构图词和角色差异化描述,底模选SDXL写实或插画风。我实测CFG 5.5、步数32,人数一旦超过7就开始崩脸。

老实讲,我第一次画ai绘画很多人同框的场景,出来的就是六张一模一样的脸挤在一张图里,像复印件摞一块。群像这题材难就难在模型天生只会"复制"不会"差异化",你写five people它就给你复制五份。后来我花了小半个月专门调这个题材,才算摸出门道。

群像最容易出的几种崩

人脸串台、肢体融合、人数对不上,这三类占我早期群像翻车的八成以上。根子都在提示词太笼统。

你写a crowd of people in a street,模型大概率给你糊一团。我个人觉得这是新手最普遍的坑。群像要的不是堆"many""crowd"这种量词,是人数、分组、姿态差异化三件套分别写细。少一个,画面就垮。

人数是第一条生死线

4到6人是SDXL的甜区,超过7人脸就开始糊,超过10基本没法救。

我反复测过。3人以内模型处理得很轻松,每个人脸清晰可辨;4到6人稍微吃力但能稳住;7人是个坎,过了就开始出现两个脸长一起的恐怖画面。10人往上?放弃吧,那是另一个量级的工程。根据 Civitai 模型库 上多个群像LoRA的作者备注,SDXL底模在5人左右的角色一致性评分最高,再往上掉得很快。这跟我的体感对得上。

真要画大场面,别死磕一张图。我的做法是分块画完再用PS拼,比硬逼模型一次性出20人靠谱太多。构图原理不熟的,先过一遍 AI绘画建筑场景教程 把空间透视搞懂——群像本质就是把人塞进一个空间里,透视不对人再像也白搭。

分组构图词怎么写才有层次

把人拆成2到3组分别写位置和姿态,比如left group of three加right pair,比写one big group层次分明得多。

构图词是群像的命脉。我实测稳定的一组:a lively street scene, left foreground group of three friends laughing, right background pair of vendors talking, one cyclist passing through the middle, varied poses, depth of field, candid photography。关键是"left foreground group of three"这种带位置加数量加动作的写法,模型才会把人分散开,不会挤成一坨。

分组这事其实有摄影构图的老底子在。参考 维基百科视觉构图 讲的分组与视觉重量原则,把人想成画面里的色块去摆,比凭感觉乱塞有效。

角色差异化防止"复制粘贴"

每个人单独写外貌特征(发色、服装、年龄),用different people with distinct features这类总领词,比让模型自己分配强十倍。

这是我最痛的领悟。早期我写five friends in a cafe,出来五个黑发青年穿同款卫衣,像五个克隆人喝下午茶。后来改成five friends in a cafe, one blonde woman in red coat, one man with beard in green jacket, one elderly man with glasses, one young girl with braids, one teenager in yellow hoodie——差异化一写,画面立马活了。

服装颜色务必岔开。全黑或全白最容易让模型分不清谁是谁,红黄蓝绿这么岔,识别度立马上来。这点小细节往往决定一张群像是像插画还是像素材拼贴。想做原创角色练手,先看 AI绘画动漫角色怎么画 把单人刻画吃透,再来啃多人。

我实测稳定出图的提示词模板

按"场景加人数分组加每人特征加动作差异加氛围加画风"六段写,CFG 5.5、步数32、DPM++ 2M Karras,这组我跑了四十多张能当插画的过半。

摊开我那组:a bustling night market street, group of four friends walking together in the center, one tall man with short black hair wearing a grey hoodie looking at phone, one woman with long red hair in a yellow dress laughing, one man with curly brown hair and glasses in a denim jacket, one short girl with twin braids in a pink sweater holding a lantern, varied walking poses, warm lantern light, misty atmosphere, depth of field, candid cinematic photography, 8k。CFG 5.5、步数32、DPM++ 2M Karras,出图约18秒一张。

"varied walking poses"和"varied poses"这两个词我反复验证过,加上之后人物姿态不会雷同,不加就五个人一个姿势并排走,像团体操。想系统学多人场景的写法,参考 AI绘画合照咒语怎么写 那篇,多人构图拆得更细;双人构图则看 AI绘画情侣描述词怎么写,原理相通。

负面词和后期怎么救

负面词加merged faces、extra limbs、identical clones、fused bodies,后期用inpaint逐张修脸是群像出图的标配收尾。

负面词对群像尤其重要。identical clones(完全相同的克隆)和fused bodies(身体融合)是我必加的两个,专治复制粘贴和肢体粘一起。出图后大概率还得修——我一般用inpaint框住糊掉的脸单独重画,CFG调到7让它别太飘,一遍遍下来能救回大半。

这里说句实在话,群像题材别指望一次出图就完美。我每张成品背后平均扔掉3到4张废图,修脸修到眼花。这题材就是吃功夫的,没捷径。参考 DeviantArt 上画师的群像作品找姿态差异化的灵感,那边的人物互动画得很扎实。想做出能识别AI破绽的对比图练眼力,可以翻 AI古代战场绘画进阶,大兵团交战本质就是群像的极端形态。

常见问题

ai绘画很多人最多能画几个不崩?

我实测SDXL下4到6人最稳,7人是临界点,超过基本得靠分组加后期修脸硬撑。10人往上建议分块画再拼。

为什么我画的群像人脸都长得一样?

因为没给每个人单独写外貌特征。模型默认会复制,得用different people with distinct features总领,再逐人写发色服装年龄,差异化写足才不串脸。

群像能用同一个LoRA保证角色一致吗?

能但有限。单个角色LoRA画多人时一致性会下降,建议人数控制在3到4人以内,超过就别指望LoRA兜底,靠提示词差异化更实在。

画大场面人群比如集会游行怎么办?

别用单人精细化写法,改用a large crowd of hundreds加blurred figures in background加focus on foreground group把远景人群虚化处理,只刻画前景几个人,远景当氛围,这样既不崩脸又有大场面感。

觉得有用的话分享给朋友吧。