让ai绘画听懂你的话:把脑内画面画出来的四个习惯

让ai绘画听懂你的话:把脑内画面画出来的四个习惯
让ai绘画听懂指令的主题插画,作者在四宫格草图前挑选迭代

长话短说:让AI绘画听话,靠三个习惯——把画面翻译成镜头语言,用负面词牵住缰绳,四宫格里挑着迭代。改掉"一句话赌一张"的习惯,废图率能从八成掉到三成。四个习惯按顺序来,一个也别跳过。

我在公司做行政,下班兼职画表情包,玩AI绘画快一年了。身边朋友最常问的就是"为什么它画不出我想要的",我以前的答案也是干着急,现在能给出具体方法了——因为我自己把这句话从抱怨改成了流程。这篇就讲怎么"让"AI画画:主动权怎么一点点拿回来的,全有实例。

先把脑子里的画面翻译成镜头语言

AI不懂"氛围"和"感觉",只认主体、动作、场景、光线、镜头五类具体词。出图前先把你想要的画面逐项填一遍,缺哪项补哪项。

我用表情包的例子说。最初我写"一只生气的猫",出来的猫十张十种怒法:有的张牙舞爪,有的画成了哈士奇。后来我改写镜头语言:a chubby orange cat, puffed cheeks, arms crossed, simple pastel background, front-facing close-up。主体、表情、动作、背景、景别,五项全给死,出来的怒就是我要的那种闷怒。你脑子里那句"感觉"必须拆成看得见的元素,拆得越碎,它画得越准。

景别是新手最容易漏的一项。要不要全身?半身还是特写?写与不写,构图完全是两个世界。我有段时间老抱怨主体太小,其实就是没写 close-up,它默认给我全景。还有光线,soft light 还是 hard shadow,决定整张图的脾气,这项也别省。

负面提示词是缰绳,专管跑偏

负面词负责排除你不想要的:多余肢体、杂乱背景、错位文字,五到八个就够,别堆几十个。写得越集中,权重越实在。

我见过有人负面词写了两百多个,像贴符咒,实际互相稀释,该崩还崩。我的常驻负面词就六个:extra fingers, deformed hands, blurry, cluttered background, text, watermark。表情包要配字,字我是后期贴的,所以text常年挂在负面栏里,让画面自动留白。跑一次就能感觉到,负面词减到六个之后,图面干净了一个档次。还有个暗坑要提醒:text挂在负面栏,画面留白就偏大,哪天想要满构图,记得把它临时摘下来,一加一减自己权衡。

再就是垫图和文字打架的问题。垫图给了构图参考,文字又描述了完全不同的场景,模型夹在中间两头讨好,出来四不像。我的原则是垫图管构图和角色,文字只补充垫图里没有的元素,比如"换一下背景色"。两边抢方向盘,车准翻。

别赌单张,四宫格里挑着迭代

每次出四张,挑最接近的一张做局部重绘或微调,两三轮就能逼近脑内的画面。单张重抽是赌博,迭代是解题,效率差着量级。

这是我从赌徒变成解题人的转折。以前一张不满意就重抽,二十张下去还在原点。现在固定四宫格:四张里总有一张构图凑合、一张表情到位,挑表情对的那张,圈住表情外的部分重绘,保住构图改表情。我统计过自己的数据,改成这个流程后,出一套16张的表情包,废图从平均十来张降到四五张,废图率从七成五压到一成七的完整复盘里那套记录方法我一直在用,账越记越清楚。

迭代时忍住别贪。每轮只改一个变量:这轮改表情,下轮改颜色。同时改三个变量,好了也不知道是谁的功,坏了也不知道该怪谁。慢就是快,这话在这儿是真的。

对了,角色一致性是表情包的命。我给自家那只橘猫角色建了固定词库:脸型、瞳色、腮红位置都写死存档,每次只动表情和动作的词。十六个表情发出去,粉丝没发现是AI画的,还问我是不是请了画师。

回想起刚入坑那会儿,我对着屏幕干瞪眼,觉得是模型不听话。现在明白,是我没把话说清楚。你脑内的画面越具体,它就越是世上最听话的画笔。今晚就试试把你要的那张图拆成五类词,填完再点生成,回来告诉我是不是不一样了。

常见问题

提示词写多长合适?

我的经验是四十个词以内。关键项五类覆盖到就行,太长会互相稀释权重,重点词反而被淹没。宁短勿长,短了可以迭代补。

为什么AI总画不出我要的构图?

多半是没写景别和主体位置,或者干脆没垫图。文字描述构图本来就不稳,重要构图直接垫一张手绘草图,比敲二十个词管用。

四宫格里没有一张能用怎么办?

说明根上的描述就偏了,回第一步检查五类词缺哪项,改完再出四张。连续两轮全军覆没,一般是两个词在打架,逐个删词排查。

角色怎么保持前后一致?

给角色建固定词库存档,脸型毛色配饰全写死,每张图只换动作和表情。角色戏份重的话,训一个小LoRA,一致性比词库再高一截。

延伸阅读