AI绘画贪婪式堆提示词,我翻车三次才学会做减法
先泼盆冷水:提示词不是堆得越多越好,主体词超过三个,画面就开始打架。我用同一主题跑了五组对照,五十个词那组二十张里只有一张能用。想少废图,先把词砍到十个上下再说。
玩AI绘画的第二个月,我干过一件现在想起来都脸红的事——ai绘画贪婪式堆提示词,一条词塞了三十八个英文单词,恨不得把脑补的画面全写进去。结果呢,出图里灯笼浮在半空,猫蹲在了不该蹲的房檐上,模特的手多出一根指头。那晚我盯着二十张废图到凌晨一点,才想明白一件事:这工具不认苦劳,它只认重点。
词塞太多,画面到底会怎么乱
提示词超过二十个,单个目标的权重被稀释,模型只能自行挑词乱配。主体错位、元素浮空、光影打架,基本都是这么来的。
不服气的我后来专门做了个实验。同一句主题词「雨天日式庭院,一只白猫蹲在石灯笼旁」,分别配上8个、15个、25个、38个、50个附加词,每组固定生成20张,一共一百张,跑了两个晚上。顺带交代环境:本地模型,8G显存,1024×1024一张约8秒,种子全部固定,唯一变量就是词数。这样得出的差距才有说服力,不然你只会怀疑是波动。
结果比我想的残酷。8词组二十张里十四张主体清晰、构图正常;15词组开始偶尔出现灯笼跑到画面边缘;25词组的白猫有五次直接消失,只剩个空庭院;38词组能用的只剩四张;50词组最惨,二十张里没有一张能看,其中三张还冒出了模特——等等,庭院图哪来的模特?模型自己加的。词多到一定程度,它已经开始替你创作了。
光影打架是另一种乱法。太阳明明落山了,影子却是正午的;雨下着,地面却干得反光。这种细节错没人第一时间说得出来,但图就是不干净,怎么看怎么别扭。词越多,这种自相矛盾出现得越频繁。
一张图留几个词,我的配比表在这
单主体图留8到12个词,双主体15个上下,超过20个就该动刀砍词。顺序是先定主体和构图,再补风格,最后才轮到氛围词。
把实验数据整理成表,你一眼就能看懂我为什么劝你做减法:
| 词数区间 | 20张里能直接用的 | 我的实际感受 |
|---|---|---|
| 8–12个 | 14张 | 主体稳,背景略寡淡,补一个氛围词正好 |
| 15–20个 | 10张 | 看运气,构图偶尔漂移,得挑 |
| 25–38个 | 4张 | 灯笼浮空、猫上房,全靠抽 |
| 50个往上 | 1张 | 那张是玄学,别指望复现 |
举个砍词的例子。原来那句38词的长句,砍完剩十个词:rainy japanese courtyard, white cat on stone lantern, soft evening light, cinematic composition。砍掉的全是「hyper detailed」「8k」「masterpiece」这类客套话,还有第三盏灯笼、第二把伞这种重复要求。客套词我砍得最狠——写了等于没写,白占权重。
权重写法也顺带说一句。我实测把主体词写成(white cat:1.2)并放在最前面,还原率比平铺高一截——模型对靠前的词就是更上心。但数字别超过1.5,我试过1.8,猫的脸直接油糊了,那也算我第三次翻车。
抽卡也别贪,一次生成几张最划算
一次生成五十张再慢慢挑,不如五张一批连跑十轮。每轮只根据上一批的毛病改一个词,命中率能翻一倍。
我干过更蠢的事:挂机一整晚生成三百张,第二天挑图挑到眼睛发花,最后用的居然是第七批里那张。三百张里三百种毛病,你根本不知道该改哪个词。那批图占了我4个G硬盘,全是无用数据。后来改成小批量迭代,每轮只改一处,两轮就能把猫请回石灯笼旁边。废图少了七成,总耗时反而更短。
挑图我有个三秒法则:一张图三秒内抓不住我,直接过。按这个标准,三百张里撑过三秒的不到十张,效率低得吓人;改成小批量那阵,五张里能留两张。差距就是这么拉开的。
所以你看,贪婪在AI绘画里处处是坑:词要贪多、图要贪量、出图要贪快,三样占全了,硬盘里就全是废图。
那晚三十八个词的失败现场我还留着,偶尔翻出来提醒自己。工具很听话,听话到你说一百句它只认真听三句。学会闭嘴,是学AI绘画的第一课,比任何参数都靠前。
常见问题
负面提示词也是越多越好吗?
不是。负面词堆多了会误伤,我见过有人把「模糊」写进负面词,结果整张图的景深全乱了。我一般控制在十个以内,只放真正出过问题的词。
(主体词:1.3)这种权重语法,数字越大越准吗?
不是。1.2到1.4是安全区,超过1.5画面容易过饱和、五官发糊。我的习惯是先写1.2,不够再加0.1,逐次试。
提示词写中文还是英文更怕堆砌?
都怕。中文模型对语序更敏感,句子一长重点就散;英文模型对堆砌的容忍度稍高一点,但超过二十个词一样崩。别指望换语言偷懒。
想画多人群像,怎么避免元素打架?
给每个角色固定一小段描述,控制在15词内,再配合参考图或分区重绘。一口气把五个角色的外貌全塞进一条提示词,我试过,出来的全是缝合怪。