AI绘画组合实验:同一批词换顺序,出图差别有多大
我的判断是:词的排列不是玄学,是实打实的权重变量。同一组八个词,我做了六轮AI绘画组合实验,主体命中率从三成拉到九成,一个新词都没加。卡图的时候,先换排法,别急着堆词。
同一批词能出多少种画面?AI绘画组合这件事,我是被一次翻车逼着研究的。上上周给一家咖啡馆出海报,词都齐了:治愈系、木纹桌面、拿铁、午后阳光、胶片质感。结果十张里七张是建筑空镜,拿铁连个影子都没有。死马当活马医,我把"拿铁"挪到第一位,第一张就是拉花特写。那天我才意识到,手里攥着一副好牌,出牌顺序乱了照样输。后来我干脆把这套排列实验做成了固定流程,前后跑了三十多轮,这篇就算一期成果汇报。
六种排法实测:主体词的位置决定画面的心
越靠前的词分量越重;我固定下来的排法是主体打头、场景居中、风格垫底,实测主体命中率能到九成。实验很简单:八个词的词池不动,只换排列,每轮十张,同一个二次元模型、同一套采样参数。A组按我原先随手写的顺序出,主体命中3张;B组把"拿铁"提到最前,命中9张;C组反过来把"胶片质感"放最前,风格是浓了,可十张里八张成了空桌子,主体命中只剩2张。
剩下三组更有意思。D组把"拿铁"重复写两遍,结果出现了词义污染:桌面、盘子、连桌布都被染成了咖啡色。E组随机打乱,命中5张,忽好忽坏,最不稳定。F组是主体前置再加一层括号权重,十张十中,稳得不像话。F组里最稳的一张后来被我放大看了细节:俯视三十度,拉花是片叶子,木纹上斜着一道午后阳光,胶片颗粒不抢戏。同一组词,第一轮它还在"缺席",这轮已经当上了主角。
六个组跑完,我摸到一个规律:前三位基本决定这张图"画什么",中间几位负责"在哪画",最后两位更像滤镜,决定"用什么味道画"。拿铁放第四位和第一位,是完全不同的两幅画——第四位时它只是桌上的道具,第一位时整张图都围着这杯咖啡转。你翻翻自己最近的废片,很可能主体词就可怜巴巴地排在第五六位。
一句话记住:排座次比添新人重要。词池就那么大,先想想谁坐主位。至于一轮十张是不是太少,我的看法是对照实验求的是趋势不是运气,十张能看出方向,真要较真,锁定种子复跑一轮就够。
权重和括号:排列之外的另一层组合
括号加权等于给单个词涨工资:主体词1.2到1.3倍最稳,超过1.5画面容易发腻,高光糊到没法看。我用拿铁做了个梯度实验:1.1倍时主体偶尔还会跑;1.3倍时九成画面主体明确、质感正常;1.5倍开始奶油高光溢出,杯口一圈白得像烧过;1.8倍那轮我直接全废。所以别迷信"权重越高越听话",话筒递太近,声音是大了,破音也来了。
负面词的组合我也有个手感经验:把"模糊""多余手指"这类高频崩坏项分开单独写,比一锅炖进一长串效果利索。不过这块我没做严格对照,十轮都不到,姑妄听之,你按自己的废片类型调就好。顺带一提风格词降权:胶片质感压到0.8倍之后,画面反而更自然,风格词顶满就像做菜全放辣椒,只剩一个味。
我的试错流程:一次只动一个变量
定死词池、每轮十张、只改一处组合方式,三轮之内基本能锁定能打的排法,全程不超过二十分钟。流程四步:先把词池砍到十个词以内,写死;跑一轮基准,挑出前两张的种子记下来;改一处组合方式重跑,跟基准比主体、比风格、比废片类型;锁定之后再放种子回归验证。二十分钟,多数卡图的提示词都能救活。
中间岔一下。第三轮我手痒,顺手把画幅从竖版改成了横版,结果整轮数据全作废,重跑了一遍。变量控制这种事,纪律真比聪明重要,我吃过亏才敢这么讲。
流程里最容易被忽略的是记录这一步。每轮我用一行字记下改了什么、命中几张,三轮下来回头一看,规律自己会浮出来,比凭记忆靠谱得多。这套流程跑顺之后,我把结果都归进表格,配着词条库一起用,新词进来先试座次再入库,省得库里堆一堆没验证过的词。
那批咖啡海报最后定稿的,是主体前置加1.3倍权重的第二张。客户挑走它的时候不知道,我为这张图前前后后出了六十多张废片。词还是那八个词,一个没换。这套方法不挑模型也不挑题材,人像、静物、场景都适用,唯一的成本是你得忍住不加新词。你手里那张憋不出来的图,差的也许不是新词,是换个座次。
常见问题
不同模型对词序的敏感度一样吗?
我实测下来差别不小,有的模型换顺序命中率高出一大截,有的几乎无感。建议换个新模型时先跑一轮最简基准:同一组词正排反排各五张,一比就有数。
一条提示词放多少个词合适?
我控制在8到12个。超过15个,词之间开始互相打架,画面什么都想说什么都没说透。先做减法,再谈组合。
负面提示词也有顺序讲究吗?
影响比正面词小,但把最常崩的项放前面,我体感上压制得更干净。这个不绝对,按你自己的废片类型排就行。
做对照实验必须固定种子吗?
固定种子对照最干净,但我只固定前两张,剩下八张放开跑。全固定会错过模型本身的随机红利,有时惊喜就藏在放开的那些张里。