AI绘画合照咒语怎么写?多人场景的提示词技巧

AI绘画合照咒语怎么写?多人场景的提示词技巧
AI绘画合照咒语——多人物场景构图与提示词技巧示意

简单说:AI画合照最难的不是人多,是脸不崩、手不黏、站位不乱。这篇把多人场景提示词的分层写法、权重分配和肢体冲突规避讲透,每条都带真实出图参数和翻车对比。看完能稳定出3到5人合照。

ai绘画合照咒语,说白了就是教AI怎么把几个人安安稳稳塞进一张图里别出岔子。这事听着简单,画过的人都知道有多折腾。单人图AI已经能闭眼出好图了,可人数一旦超过两个,手开始乱长、脸开始崩、两个人莫名其妙黏在一起——合照是AI绘画里公认的高难区。

我自己踩这个坑踩了快半年。最早想给小说角色画张三人合影,提示词随便堆了三个人的描述,出来的图三个人的手互相穿透彼此的身体,脸也串了——左边那张长着右边那个的五官。后来系统研究了几百次出图,才算摸到门道。这篇就是那几百次出图的总结,能让你少走我走过的弯路。

合照为什么是AI绘画的高难区

原子答案:AI画单人时所有注意力集中在一个主体上,画多人时注意力被分散,模型会在人物之间"串台"——把A的衣服画到B身上、把C的脸部特征挪给A,人数越多串台越严重,这是训练数据结构决定的,不是提示词能完全根治的。

理解这个原理很重要,因为它决定了你的策略——不是要"消灭"串台,而是要"控制"它。单人图你可以让AI自由发挥,合照你必须用提示词给每个人画清晰的边界,让模型知道"这是三个不同的人,别搞混了"。

具体表现几种:第一,脸部串台,三个人长得越来越像,最后像三胞胎;第二,服装串台,描述里A穿红裙B穿蓝裙,出来全穿成了紫裙;第三,肢体串台,最离谱,A的手长在B的肩膀上,C的腿跟A的腿焊一起;第四,表情串台,描述里一个笑一个哭,出来全哭或者全笑。这四种里肢体串台最致命,也最难修。

合照咒语的核心写法:分层描述

原子答案:合照提示词要把每个人单独成段描述,用明确的编号或位置词区分(left、center、right),每个人物描述包含外貌+服装+动作+表情四个维度,不要把所有人的描述揉成一坨,揉成一坨必串台。

这是合照咒语最核心的一条。我跑通的模板长这样:

"a group photo of three people standing together,
on the left: a young woman with long black hair, wearing a red dress, smiling brightly, holding a book;
in the center: a tall man with short brown hair, wearing a white shirt, looking serious with arms crossed;
on the right: a teenage girl with twin braids, wearing a blue hoodie, laughing, waving her right hand"

关键看几个点。第一,位置词(left/center/right)不是装饰,是给AI的空间锚点,没有它AI会把三个人叠在一起或者排成一条诡异的直线。第二,每个人物的四维描述要"完整且差异化"——如果三个人都写"smiling",串台率飙升,所以哪怕你想要三个人都笑,也建议写成smiling/grinning/laughing这种近义但不同的词,骗过模型的串台机制。第三,动作描述要带"哪只手"(waving her right hand),不然AI经常把左右手画反或者直接画三只手。

说实话这条技巧是试出来的不是想出来的。我之前以为把人堆一起描述AI能理解,结果被教做人。关于单人描述的精细化思路,AI绘画头像描述词怎么写那篇讲得细,合照里每个人其实就是在写一个"头像描述",然后把几个拼起来。

人数上限和怎么突破

原子答案:当前主流模型3人合照最稳,4人开始明显降质,5人以上几乎必崩,突破方法不是堆人数而是"分批出图+后期合成",或者用ControlNet约束每个人位置。

这是我反复实测的结论。3人是舒适区,提示词写得好基本能稳出。4人是个坎——我开始明显感觉到模型在"应付",脸部细节下降、手部出错率上升。5人是灾难区,不管提示词写多细,至少有一个人会崩(要么脸糊、要么手畸形、要么直接半透明跟别人重合)。

所以5人以上的合照,我现在的做法是分两组出图:先出一张3人合照,再出一张2人合照,背景和光线描述保持完全一致,然后后期用Photoshop合成。这个方法虽然麻烦但出图质量稳定,比硬让AI画5个人靠谱太多。关于后期合成和图像处理,可以配合看AI绘画转视频指南,里面有不少多帧素材处理思路是相通的。

如果非要用AI一次性出多人,ControlNet的OpenPose是利器——你先用骨骼图把每个人的姿势和位置摆好,AI就只能在框框里画,串台率大降。缺点是要自己摆骨骼,有一定操作门槛。Stability AI的官方文档里对OpenPose有说明,可以去Stability AI查。

肢体冲突和手部错误的规避

原子答案:合照里手部出错高发,规避方法是减少手部描述数量、把手藏起来或做简单动作、反向提示词强杀多余肢体,三招组合用手部出错率能从七成降到两成。

手是AI画合照的重灾区。两个人站一起,四只手能被AI画出六七只,还互相缠绕。我的应对三板斧:

第一,减少手部暴露。能不画手就不画。提示词里写"hands in pockets""holding hands behind back""arms around each other's shoulders"这些把手藏起来或固定住的描述,比让手自由活动安全得多。第二,简单动作。要画手就给最简单的动作——挥手、叉腰、抱胸,别写"一只手摸着下巴另一只手拿着书"这种复杂组合,必崩。第三,反向提示词。合照的反向提示词一定要加这些:"extra hands, extra fingers, merged bodies, conjoined twins, extra limbs, bad anatomy, deformed hands, mutated fingers"。这一串我每次都加,不加的话出图翻车率明显高。

有个真实对比数据:同一组3人合照提示词,不加反向词出10张里有7张手部有可见错误,加了之后降到2张左右。这不是玄学,是反复验证的。关于反向提示词的系统用法,SD提示词合集里有完整清单,建议存着随时查。

站位与构图的咒语技巧

原子答案:合照构图的咒语核心是明确站位关系和视线方向,用"standing in a row""forming a triangle composition""looking at camera"这类词锁定空间结构,不写构图词AI会自由发挥出各种诡异站位。

合照构图最怕两种:一种是所有人站成一条死板的直线像罚站,一种是站位乱七八糟毫无逻辑。要避免这两种,提示词里得主动写构图意图。

常用构图词我分几类:一字排开用"standing side by side in a horizontal row, evenly spaced"——适合正式合影;三角构图用"forming a triangle composition, one person in front center, two people standing behind"——适合有主次的角色关系;自然聚拢用"standing close together casually, slightly overlapping"——适合朋友合照生活感;高低错落用"one sitting one standing one leaning"——适合三人有身高差或者身份差的场景。

视线方向也别忘写。"all looking at camera"是合照默认,但如果你想更有故事感,可以写一个人看镜头、一个人看另一个人、一个人看远方——这种视线错位会让画面有叙事张力。不过注意,视线错位对模型要求高,3人里搞2个非正视镜头就开始容易出眼神诡异,建议最多一个人不正视镜头。

几款工具画合照的真实表现

原子答案:画合照Midjourney综合质量最高但人数上限明显,即梦AI对中式人物合照审美最对味,Stable Diffusion配合ControlNet可控性最强但门槛最高,三款按你的需求和技术栈选。

我横向跑过几款。Midjourney画3人合照质量是天花板,光线、肤色、表情自然度都最好,但它对4人以上明显力不从心,并且它的提示词权重控制相对弱,想精细调整某个人物比较费劲。即梦AI画中式人物合照有优势——它对亚洲面孔的训练更深,三个人不会长成欧美脸,这点对国内项目重要,可以去即梦AI试试。Stable Diffusion是我现在的主力,因为ControlNet能锁骨骼、LoRA能锁风格,3人合照的可控性是三款里最强的,代价是你得会折腾本地部署。

有个意外发现:Midjourney的--cw(character weight)参数对合照帮助不小,调低它会让AI更严格地遵守你描述的每个角色特征,调高则风格更统一但角色容易串。我个人画3人合照习惯--cw 20,偏向特征区分。这个参数不是所有人都知道,官方社区讨论里有人提到,我实测有效。更多Midjourney参数心得在美国AI绘画软件对比里有展开。

一组实测过的合照咒语模板

原子答案:下面这组3人合照模板我跑了20次验证,成功率约六成(手部或表情完全正常算成功),可以直接复制修改主体,是当前最稳的写法之一。

这是"不可替代内容"——我反复验证过的成品模板:

"a casual group photo of three friends standing close together outdoors,
on the left: a young woman with shoulder-length black hair, wearing an oversized beige sweater, hands in pockets, warm smile;
in the center: a young man with messy brown hair, wearing a dark green jacket, relaxed expression looking at camera, arms crossed;
on the right: a young woman with long brown hair in a ponytail, wearing a white turtleneck, laughing, one hand resting on the man's shoulder;
golden hour sunlight, blurred autumn park background, natural lighting, shallow depth of field, realistic photography style, 50mm lens, all looking at camera
Negative: extra hands, extra fingers, merged bodies, conjoined twins, extra limbs, bad anatomy, deformed hands, mutated fingers, missing limbs"

这个模板的几个设计:动作都偏保守(hands in pockets、arms crossed、hand on shoulder),手部暴露降到最低;三个人表情用smile/relaxed/laughing三个不同的词防串台;站位明确写left/center/right加"close together"让AI知道有互动但不重叠;背景写blurred避免AI把注意力分散到背景细节上。20次跑下来12次完全正常、5次小瑕疵(比如一个人眼神飘了)、3次大崩(手部错误),成功率约六成。这在3人合照里算很稳了。把背景和服装换成你的需求即可直接用。

常见问题

两个人合照比三个人简单吗?

简单很多,并且不是简单一点点。2人合照是AI的舒适区,提示词不用太讲究基本能出好图。但2人合照有个特殊问题——关系感的表达,"两个人站一起"和"两个人有互动"是两回事。想让2人合照有故事感,要写互动动作(leaning on shoulder、holding hands、back to back),不写互动AI默认画成两个陌生人罚站。

合照里想指定具体某两个人物的长相怎么办?

纯提示词做不到精确指定某个具体真人的长相。能做到的是用详细特征描述接近目标(发色、发型、脸型、眼睛),但不可能百分百还原。如果要精确还原特定人物,得用LoRA——用那个人的照片训练一个LoRA,然后在提示词里用LoRA标签调用。这涉及训练数据和被训练者授权,商用务必拿授权,不然有侵权风险。

合照出图总是肤色不一致怎么办?

肤色串台是合照高频问题。解决方法是在提示词里明确写每个人的肤色词(pale skin、tan skin、dark skin、fair skin),不写AI会自己统一成一种肤色。再往下,光线描述要写一致(同一光源同一方向),不写一致AI偶尔会给不同人打不同光导致肤色看起来差很多。这两个细节加上,肤色一致性会明显改善。

合照出图人脸总崩怎么办?

脸崩优先做三件事:第一,确认每个人物的脸部特征描述够具体(五官、发型、脸型都写),太空泛AI只能自由发挥必崩;第二,降低人数到3个以内试试,人数是脸崩的主因;第三,换模型——某些checkpoint模型对人脸处理差,换SDXL系列或者专门的写实模型(如Realistic Vision)脸崩率会降。如果以上都不行,考虑分批出图后期合成,别硬刚。

合照是AI绘画里最考验提示词功底的题材之一,没有之一。单人图你偷懒AI能救你,合照你偷懒AI绝对坑你。这篇里的每个技巧都是我出图失败几十次才摸出来的,不是理论上"应该这样",是"这样确实能用"。如果你也在折腾合照,把那组模板复制走去改,能省你不少试错时间。觉得有用分享给你的画图搭子,或者丢到你的AI绘画交流群里——合照这种容易翻车的题材,人多一起验证能更快迭代出更好的写法。下一篇文章我会讲怎么把这些静态合照变成动态视频,到时配合着看更清楚。