Ai绘画的原理技术拆开看:把出图过程当成一次作画

Ai绘画的原理技术拆开看:把出图过程当成一次作画
ai绘画的原理技术图解:一块画布从噪声到成山的五个去噪阶段

一句话版本:ai绘画的原理技术核心是两步,先让文本编码器审题,再让扩散模型从一团噪声里一遍遍去掉杂讯,直到画面成形。它像极了画手起稿到收形的过程。搞懂这点,步数、词序这些参数你就知道该怎么调了。

网上讲AI绘画原理的文章分两种,一种满屏公式,一种只说「AI很厉害」。都隔着一层。我是画画出身,后来折腾本地出图,把官方文档和社区帖啃了一圈之后发现,这套流程跟人画画惊人地像,用画画的语言讲一遍,十分钟就能通透。这篇就来干这件事,每个环节都配上我实测过的数字,能落地的才写。

出图那几十秒里发生了什么

扩散模型出图分两个环节:文本编码器先把你的提示词翻译成机器能懂的语义向量,然后模型从纯噪声开始,按步数一步步去掉杂讯,逼近一张完整的画。你可以把它想象成画手开工:第一笔铺的是大关系,乱、灰、没有细节,但构图已经埋在里面了;越往后收,形体越清楚。AI的每一步去噪,就是收一次形。我在自己的显卡上做过步数实测:同一组词,二十步出的图构图偏松,边缘发虚;三十步基本定型,七秒左右;五十步花了十二秒,跟三十步的差距小到要放大才看得出来。所以日常出图我把步数固定在二十八到三十二之间,只有放大印刷稿才舍得跑五十。省下来的时间够多试两组词,比堆步数划算得多。还有一个多数教程不提的环节:中间过程其实发生在一张缩小了八倍左右的「小稿」上,相当于画手先画巴掌大的草稿,定稿了再放大描细。这就是为什么放大到两倍尺寸之后,图会冒出些怪细节——放大那步是另一个专门模块补画的,补得快,也补得想当然。我的习惯是把关键主体放在画面中央区域,边缘留给天空、水面这类补起来不出错的东西。

提示词凭什么能指挥画面

提示词不是咒语,是给审题环节的题目描述:名词决定画什么,形容词只负责微调,权重天差地别。这个结论我踩过坑才信。刚入坑那阵我迷信网传的「魔法词」,一句提示词里塞了杰作、最佳画质、超高细节七八个形容堆叠,出图确实华丽,但主体经常被挤到角落。后来做了个对照实验:把那串修饰词全删掉,主体词原封不动,画面构图几乎没变,只是质感糙了一点;反过来把主体从「骑楼的猫」换成「雪原的狼」,画面天翻地覆。这下明白了,审题的功夫全花在名词和结构上。从那以后我写词的习惯改成:先定谁在哪干什么,再补两句质感,最后留位置放镜头角度。废图率从七成掉到三成左右。同画室的朋友用我这套写法,第一周就跟我说废图少了一半,这是原理换成生产力最直接的一次。

手指和文字为什么总是崩

手部崩坏是因为训练数据里手的姿态标注太稀疏,文字乱码是因为模型根本不「认字」,只是在模仿字形,两者都属于老毛病而不是玄学。弄清这点之后我对崩坏的态度平和多了:这不是它画不好,是它压根没学扎实。实测下来,修手最有效的路子不是往提示词里砸「完美的手」这种词——我砸过,十次里救回来两次——而是圈出手部区域让模型重画,重画一次通过率能到七八成。中文文字更惨,横竖撇捺的形它学得囫囵,四个字能对两个就谢天谢地,我的做法是生成时故意留白,字后期排版补上去。上个月给一家面馆出招牌图,图里四个字崩了三个,最后是排版软件救的场。这些翻车账记下来其实想说明一件事:知道病根在哪,你就不会把钱和时间砸在错误的药上。顺带说个细节:画面里要是出现格纹、网纹这类规律图案,局部重画时很容易把周围一起带崩,裁小重画范围再跑,稳得多。这套观察没有一条来自论文,全是废图堆里捡回来的,但管用。

原理说穿了不值钱:审题、起稿、收形,跟人画画一个道理。区别在于它收形的速度按秒算,而判断哪张形收得好,暂时还得靠人。这也是我到现在不肯全托管出图的原因——机器管手,眼睛归我。原理懂到这个份上就够用了,再往深挖是研究员的事,我们的时间还是留给出图吧。

常见问题

采样步数是不是越高画质越好?

不是线性的。三十步之后收益急剧缩水,五十步对比三十步我在本地几乎看不出差别,耗时却接近翻倍。日常出图二十八到三十二步够用,只有放大输出或者细节控才值得往上加。

为什么同样的提示词每次出的图不一样?

因为起点是一团随机噪声,种子不同,去噪的路径就不同,终点自然有差异。想复现某张图,把种子号固定住,同模型同参数下画面就能对上。

提示词写得越长越好吗?

不是。审题环节对超长文本的注意力会被稀释,我实测超过六十个字的描述,后半段经常被无视。写短句、按主次分行,比堆一整段强。

懂了原理对出图真的有帮助吗?

有,而且很实在。知道步数的边际效应,我省了近一半等待时间;知道名词主导画面,我的废图率从七成降到三成。原理不是装点门面的,是能换算成时间的。

延伸阅读