AI如何绘画出一张图?搞懂猜像素这件事,我的出图率翻倍
一句话版本:AI如何绘画的答案是猜像素——从噪点出发,按提示词一步步抹掉杂讯直到成形。但原理只有翻译成写词习惯才有用。这篇给你四条我实测过的翻译:写材质别写情绪、氛围词放前面、主体词越靠前权重越高、短句分层优于长句堆砌。
AI如何绘画出一张图,网上最流行的解释是「扩散模型,去噪」,对吧,然后呢?大部分人看完还是不知道为什么自己的图崩。我也崩过很久——同一个想法跑二十张,能看的三张,全靠运气硬堆。
转折是我把原理真的拆开想了一遍,再把每一条映射到写词上。改完之后同样二十张,能看的稳在八到十张,废图率砍半。这篇文章不讲数学,只讲我对着几百张图验证出来的四条习惯,每条都带你能直接抄的对照实验。
模型不认识情绪,只认识材质
写「孤独」模型一脸茫然,写「深夜空旷的公交站台、湿漉漉的反光」它秒懂。把情绪翻译成可拍的材质和场景,是第一位的写词习惯。
这事我是被一张图点醒的。我想画「黄昏的忧愁」,跑出来的全是橙红色天空加一个站立小人,怎么改都是明信片。后来我把「忧愁」删了,换成「背对镜头、风衣下摆被风掀起、路灯刚亮、地上有未干的积水」,第一张就有那味了。
道理在原理里:模型学的是图像和文字的对应关系,它见过无数张带积水的黄昏街道,没见过任何一张写着「忧愁」的像素。你给它画面素材,它去猜;你给它情绪标签,它只能瞎蒙。
后来我把这个翻译习惯做成了固定动作:想清楚情绪,再问自己「摄像机拍下来的是什么」。孤独是空座位,治愈是摊开的书和猫,怀旧是起了毛边的相册角。三个翻译一做,词就落地了。
我的对照实验:两组各跑二十张,一组用情绪词,一组用材质词。「有情绪」那组成图率两成,「有材质」那组五成五。从那以后我的词表里再没出现过「孤独」「治愈」「岁月感」这类词,全都换成了对应的画面翻译。
词序不是摆设:越靠前,嗓门越大
提示词的前段权重最高,氛围和风格放最前,主体随后,细节殿后。这不是玄学,是去噪过程中模型每一步都要参考你的整句词。
去噪有个特点:它是从整幅图的轮廓开始定调的。第一步抹噪点的时候,模型就得决定这张图整体是什么基调——所以放句首的风格、光线、镜头词,影响的是全图;塞在句尾的,只在局部起作用。
我踩过的坑很典型。有阵子我喜欢把「电影感」这种氛围词挂在句尾当装饰,出图平平。后来把它挪到句首,同样的画面描述,光影立刻重了三分。还有一次主体词被我埋在半句话中间,模型把背景里的次要物体画成了主角,那批图全部报废。
现在的固定语序是三段式:氛围和风格打头,主体和动作居中,材质细节殿后。改一个词库用了半年,稳定。
短句分层,比长句堆砌管用
把五十字长句拆成三四个逗号分隔的短语,优先级立刻清晰。模型对结构的理解,比对语法的理解好得多。
我曾经迷信长句,觉得描述越完整越好,写过一条八十多字的「史诗级提示词」——结果模型把所有元素揉成一锅粥,主体不清,光影打架。拆成「雨夜霓虹街道|红伞女孩回头|浅景深|路面反光」四段之后,第五张就出片了。
为什么短句有用?还是回到猜像素那件事:去噪的每一步,模型都在权衡你这句词里各部分的分量。逗号分层等于亲手把分量标好了,长句则让它自己做阅读理解——它阅读理解的水平,你懂的。
附赠一条从这条原理推出来的习惯:改词只改一处,别大改。既然每一步都依赖整句,你一口气改五个词,就不知道哪个改动立了功、哪个闯了祸。我现在的改词节奏是单变量,一次一改,进步虽然慢,方向从来不丢。
回头看「AI如何绘画」这个问题,答案是一句猜像素,但对你有用的部分藏在猜字里:它按你的词去猜,词就是它的全部线索。线索给材质它就有画面,给情绪它就只能蒙。我出图率翻倍的秘密,说穿了就是不再指望它读心。今晚你就可以拿两条旧词试试对照,数字不会骗人。
常见问题
写英文提示词真的比中文好吗?
早年确实有差距,现在主流平台对中文的理解已经不差。我的做法是概念性词汇用英文更稳,场景描述用中文更顺,混着来。
提示词越长是不是越精细?
超过一定长度收益归零,副作用倒是真的:主体被稀释。分层短句是更划算的写法,别恋战。
负向提示词也讲词序吗?
我实测排序影响不大,但内容要具体。「低质量」这类笼统词的作用有限,写明「六根手指」「模糊的边缘」反而立竿见影。
完全不懂原理,照抄别人的词行不行?
行,但只到平均分。懂了原理你才知道别人的词为什么好、坏在哪里能改——这一步之差,就是废图率和成图率的差距。