单人AI绘画为什么比双人稳?三十组对照实测与场景呼应的调法
直接给结果:单人AI绘画的能用率大概是双人构图的三倍,我拿同一套提示词跑三十组对照,单人组十张能用六张,双人组十张里挑两张都费劲。想稳就先画单人,空缺感交给场景呼应去填,具体调法在下面。
单人AI绘画为什么比双人稳?我头一回注意到这事,是被一张情侣图气的:两个人的手在中间握在一起,握出了六根手指。后来留了心,把同一个模型、同一套画风提示词,掰成单人组和双人组各跑三十张,数据摆出来吓一跳,差距不是手感问题,是结构问题。一个人像的所有算力都花在一个人身上;两个人像,模型要同时伺候两套五官、四只手,还得编排他们之间的关系,崩点直接翻倍。
双人到底崩在哪:一次交互等于三个出错点
两个人只要发生互动,就会同时产生手部接触、视线朝向、身材比例三个崩点,任何一处失手整张作废。牵着的手、对视的眼神、身高差,这三样是双人图翻车榜的前三名。
手部接触最要命。牵手、递东西、搭肩,凡是肢体碰肢体的地方,手指就爱黏成一团,或者凭空多出一根。视线朝向是暗坑:你想让两人对视,模型经常让一个看镜头一个看别处,深情对望变成各想心事。身高差更隐蔽,单人图里身材比例错了顶多觉得人微胖,双人图里男生比女生矮半个头,违和感一下子就冒出来了。
我试过把互动关系拆掉,只让两个人并排站着、各看各的,崩点立刻少了一大半。不夸张地说,双人图里最危险的不是两个人,是两个字:交互。
三十组对照的数据:能用率差出三倍
同提示词同参数下,单人组三十张能用十八张,双人组三十张能用七张,差距主要来自手部和五官的连锁崩坏。对照组用的是同一模型、同一采样器,唯一变量就是人数。
条件交代清楚:DPM++ 2M Karras,CFG 7,重绘幅度0.5,画风词两组完全一致。判定标准也简单粗暴,五官不崩、手不多指、构图不歪,占一条就算不合格。单人组的十八张里,废图基本都是手部小瑕疵,裁一下还能救;双人组的废图则常常连着崩,脸崩带崩手,救都没处下嘴。
还有一个意外发现:单人组里出「神图」的比例也更高。十张里能撞到一张光线、表情、构图同时在线的,双人组跑了三轮都没撞上一张。模型把注意力全押给一个人时,细节完成度确实不一样。顺带一提,废图的死法也不一样:单人组的废图多半是手部小瑕疵,裁一下还能救;双人组的废图常常连着崩,脸崩带崩手,救都没处下嘴。
姿势库里挑姿势也有影响。站立正面对镜头这种「证件照姿势」,单人组照样十张九稳;换成坐姿加托腮,能用率掉到一半左右,因为托腮等于主动把手送到镜头前考验模型。双人组里我再怎么换姿势,天花板也就那样了。所以顺序很重要:先挑稳的姿势把底子打牢,再谈花活。
一个人不冷场:让场景接住她的视线
单人图怕空,解法不是加人,是给视线一个落点:窗外的街、桌上的猫、手里的信,场景一回应,画面就活了。这招比堆氛围词管用,还顺手解决了单人图常见的呆板问题。
老实讲,我最早画单人也呆,人往画面中间一杵,背景是糊的,像证件照。后来学了个笨办法:先问自己这个人在看什么、刚做完什么。看什么,就把东西画进她的视线方向;刚做完什么,就用道具和环境留痕迹。雨后路边一个回头看积水里倒影的姑娘,比站在花海正中央微笑的姑娘有味道得多。
构图上也别老居中。三分线放人,留出的那侧给视线落点,画面立刻有呼吸。想练这招,从「窗边」这个场景入手最快,窗光加一个眺望的侧脸,翻车率低,出效果快。我上个月用这个套路出的图里,自己最满意的一张是傍晚厨房:人在洗碗,水龙头的水汽里有一小截彩虹,就这么一个细节,点赞比平时翻了两倍。
那三十组对照的废图我到现在还留着一部分,双人组那几张六指牵手的名场面,偶尔翻出来还挺下饭。单人图练熟了再看双人,你会很清楚自己在跟什么较劲:不是跟模型,是跟交互关系。先把一个人的画面立住,再谈别的。
常见问题
提示词里加 solo 这个词到底有没有用?
有用,而且建议必加。单人图最烦人的是模型自作主张多画一个人影,solo、1girl 或 1man 这类数量词放在描述最前面,能明显压住多余的「路人」。我还习惯配 negative 里的 multiple people。
单人全身像和半身像哪个更好出?
半身像稳得多。全身像等于把手脚全暴露给模型,脚踝和鞋是仅次于手的重灾区。新手先从半身往上练,全身像留给精修轮次去跑。
两个人不互动、只是同框站着,翻车率会低吗?
会低不少,但也别指望回到单人水平。不互动省掉了手部接触这个大坑,视线朝向和比例问题还在。我的建议是同框双人图把距离拉开一点,中间留件道具,两个崩点都能缓和。