AI绘画十个人同框怎么不乱?我用的分层笨办法

AI绘画十个人同框怎么不乱?我用的分层笨办法
AI绘画十个人同框:分层排布的毕业季群像插画

我先认个怂:AI真数不清十个人,你能控制的是画面的层次,不是人头数目。放弃"数够十个"的执念,改用前排、中排、后排三层分治,十人同框就从撞大运变成可复制的手艺。

AI绘画十个人同框这个需求,是2026年7月的一个毕业季订单砸到我头上的。客户要一张十人同学的群像插画,人名一个不能少,站位要有聚有散。接单时我还没意识到这题的分量——三人图我熟啊,十人不就是乘一乘?事实证明,十个人不是三人图的三倍难,是十倍难,还带平方。

十个人难在哪:错误不是叠加,是相乘

人数、遮挡关系、每张脸、每双手,四个出错面随人数平方级放大。模型连三个人都要靠命名法稳住,十个人直接写数量,它只能凭感觉给你一团"看起来人多"的东西。

我的第一版提示词相当天真:"十个学生站在教学楼前合影"。出来一张图,我数了三遍:九个。而且第九个和第八个的脸是连着的,中间的鼻梁共用。第二版把"十个"加重语气再写一遍,好家伙,十二个,多出来的俩站在最边上,笑得比谁都灿烂,客串感十足。

那一晚我算是认清了:数字词对模型就是个氛围词,"十个人"传达的只是"很多人"的 vibe,不是精确计数。你写一百它也是一堆人,写十它还是一堆人。想精确,路只有一条——别让它数,你替它把画面结构定好。

手是人数平方律的另一个受害者。三个人三双手,AI勉强能管好;十个人十双手,废图里一半倒在手上——有版图里后排某位同学一只手长了七根手指,还有版两只手在背地里十指相扣,可那两个人隔着半米远。从那以后我写群像必带一句负向词"畸形的手",治不了根,起码少了一类显眼包。

分层写法:把十个人切成三个世界

前排两三个人写足身份和动作,中排拆成两三个小群体写互动,后排直接交给"人群、剪影、虚化"。模型一次伺候不了十个人,但伺候得好三个层次。这是我能给出的最实在的方法。

具体写法给你看:前排写"前景三个学生并排,左边的抱着篮球,中间的女生举着学士帽,右边的比着剪刀手";中排写"中景两组学生互相搭肩交谈";后排写"背景若干学生的虚化剪影,散布在树下"。三层各自成立,模型每层只需要处理两三个焦点,错误率断崖式下降。毕业插画终稿就是这么出的:前排三人五官清晰,中排四人半身有神态,后排三人隐在树影里,加起来数目够了,画面还透气。

小群体是中排的灵魂。写"中排六个学生",必乱;写"中景两三人围成一组说笑",它就懂了——人对群的感知本来就是按小圈子来的,模型学人类社交图学得多,小群体它反而拿手。分层加分群,这两招下来,我前二十多版的废图率肉眼可见地降了。话说回来,这套笨办法说白了就是替模型当导演:它管不了全场,你就把全场切成它管得了的几块。

十个人,到底要不要都画清楚

不要。观者记住的从来是两三个焦点和整体气氛,全清晰反而散。前排给细节,后排给氛围,虚实对比既省成功率又出效果。这不是偷懒,是摄影和绘画共用的老规矩。

客户起初也有点不甘心,问能不能十个人都和前排一样清楚。我把两个版本并排给他看:全员清晰那版,眼睛不知道往哪儿落,每人五官还互相串味儿;分层那版,视线先落在举学士帽的女生身上,再自然滑向中排的说笑,最后扫过树影。他看完自己说了一句"还是这张像毕业照"。我特别想给他鼓掌——他一句话悟了我二十版才悟的事。

省下来的细节额度也别浪费,投给关键道具和光线。那单里我把"抛起的两顶学士帽、傍晚的暖金侧光"写得极足,帽子在空中定格的那一下成了整张图的高光时刻。人群图的高级感,一半来自虚实,另一半来自这点仪式感。

订单交付那天,客户把图发进了班级群,十个同学挨个认领自己,后排最糊的那个男生还抗议自己被分到了树影里,可见再糊的身份感也是身份。十人同框这道题,我做下来就剩三句话:别让AI数数,替它分层;别求全员清晰,让焦点说话;别省道具光线,气氛靠它们撑腰。

常见问题

直接写"一群人"不是更省事吗?

要氛围选它,要人数别选它。我试过"一群学生",出来的图人数全靠缘分,六到二十不等,而且群体越大单人脸越潦草。客户点名要十个人的场合,还是分层写法能交差。

十人场景用什么构图最稳?

横版广角加轻微俯视。横幅装得下横向排布的人墙,俯视让前后排错落不遮挡。竖版装十个人,基本只能叠罗汉,上层人物的腿脚经常不明不白地消失。

人数最多做过多少?再往上怎么办?

我自己做实过的是十二三个,再往上分层法也顶不住了,前排细节会被稀释。真正的几十人大场面,我建议拆成多张单层图再合成,或者干脆退一步写"广场上熙攘的人群",让数量感来自构图而不是计数。