AI绘画怎么形成的?生成原理科普
简单说:AI绘画怎么形成的,核心是扩散模型把文字编码成向量、从纯噪声一步步去噪还原出图像,CFG值控制贴合提示词程度、步数控制去噪次数。我实测CFG 6.5、步数30出图最稳,懂原理后废图率能降一半。
搞懂ai绘画怎么形成的,其实没你想的那么玄。老实讲我第一次听人讲扩散模型也是一头雾水,后来用大白话一拆就明白了——AI画画不是"想"出来的,是从一团乱码噪声里一步步"擦"出来的。
AI绘画形成的三个核心步骤
第一步文本编码把你的提示词变成数字向量,第二步加噪把训练图加上噪声,第三步去噪采样从纯噪声一点点还原出图像。
这三步串起来就是AI绘画形成的全过程。文本编码用的是CLIP这类模型,它把"a girl with red hair"这种文字翻译成一组数字(向量),这组数字就是AI能理解的"指令"。加噪是训练阶段的事——拿真实图片一步步往上撒噪声,直到变成纯雪花屏,模型记住"从图到噪声"的过程。去噪是出图阶段——反过来,从纯噪声开始,模型凭训练时记的规律一点点把噪声"擦"掉,擦出一张新图。
这就解释了为啥AI出图有随机性——起点噪声是随机的,擦出来的图就不一样。同一个提示词换seed值出图不同,就是这个道理。想系统学AI绘画的,先看 AI与绘画的关系 把大背景搞懂。
文本编码:提示词怎么变成AI能懂的东西
提示词经CLIP文本编码器变成一组768或1024维的向量,这组向量就是AI理解画面意图的"数学指令"。
AI不认字,它只认数字。你写的"a red apple on a table",CLIP模型把它拆成token(词元),每个token映射到一个高维向量,整句拼起来就是一组描述画面的数学向量。这组向量决定了去噪过程往哪个方向"擦"——往苹果红、桌子、静物的方向擦,而不是往人脸、风景的方向擦。
这也解释了为啥提示词写太长会失效。CLIP对超长文本的理解能力有限,SD1.5的CLIP上限75个token,超了截断。SDXL用OpenCLIP扩到更长了,但也不是无限。我个人建议核心词放前面,权重高的词靠前写,靠后容易被模型"忽略"。
扩散模型:从噪声到图像的魔法
扩散模型分前向加噪和反向去噪两阶段,出图时模型从纯噪声开始,按文本向量指引反复去噪,每步去掉一点噪声直到还原出清晰图。
前向加噪是训练用的——拿真实图加噪声加到全雪花,模型学"噪声长啥样、图加噪后长啥样"。反向去噪是出图用的——从纯噪声开始,模型预测"这团噪声里哪部分是噪声、哪部分是图",把噪声去掉一点点,重复几十次就还原出图。根据 维基百科扩散模型词条,这种基于概率的去噪过程是2020年DDPM论文提出后火起来的,现在主流AI绘画工具几乎都用这套路子。
步数就是去噪次数。步数太少,噪声没擦干净图就糊;步数太多,擦过头边际收益递减还费时间。我实测30步是SDXL的甜点——20步以下明显糊,40步以上和30步肉眼几乎没差,但出图时间多三分之一。
CFG值到底在控制什么
CFG(Classifier Free Guidance)控制去噪过程贴合提示词的程度,值越高越听话但越死板,值越低越自由但越容易跑偏。
CFG本质是"模型在多大程度上顺着你的提示词走"。它比较"有提示词指引的去噪方向"和"无提示词指引的去噪方向"的差异,放大这个差异让图更贴合你的描述。CFG 1就是完全不听你的随机出图,CFG 7-9是常用范围,CFG 15以上画面会过饱和、细节发硬甚至崩坏。
我反复试过,数字插画题材CFG 6.5最稳——色彩饱和但不刺眼,主体贴合提示词但不僵硬。写实人像CFG 7-8更好,要的就是贴合度高。抽象艺术可以降到4-5,让模型自由发挥反而出意外之喜。这就是懂原理的好处——知道每个参数在干啥,调起来有方向不瞎试。
想做出能识别AI出图真假的,参考 AI与传统绘画结合 把AI出图的特征摸熟。
采样器选哪个有讲究
采样器决定每步去噪的算法,DPM++ 2M Karras在大多数题材上平衡最好,Euler a出图偏柔和适合艺术风,DDIM偏硬朗适合写实。
采样器就是"怎么算每步去噪方向"的具体算法。不同采样器出图风格有差别——Euler a偏柔,画面有种朦胧感,适合插画、艺术风;DPM++ 2M Karras平衡,细节和色彩都中规中矩,是我的默认选择;DDIM偏硬,线条锐利,适合写实人像和产品图。这些差别我自己跑了几十组对比图才摸出来,不是看文档背的。
有个冷知识:有些采样器(如Euler a)是"祖先采样",带随机性,同一个seed换采样器出图也不同。DPM++ SDE Karras也是这路。要出图稳定可复现,选非祖先采样器如DPM++ 2M,固定seed能复现。
LoRA和底模是怎么影响出图的
底模决定整体审美倾向和画风上限,LoRA是在底模基础上叠加的"风格补丁",微调特定元素如服饰、角色、画风。
底模型号选错了后面全白搭。SD1.5老但生态丰富LoRA多,SDXL新出图质量高但LoRA少。选底模就是选"基础画风数据库"。LoRA是叠在底模上的小模型,训练时只学特定元素——比如一个汉服LoRA只学汉服形制,用的时候叠在底模上,出图就带汉服特征。权重一般0.6-0.8,太高出图崩,太低特征不明显。
想系统了解AI绘画工具生态的,参考 Stability AI 官网 看底模的迭代脉络。国内AI绘画行业现状可以看 AI与传统绘画结合 那篇,把工具和创作的关系讲得细。
懂原理后怎么少出废图
提示词核心词靠前写、CFG按题材调(插画6.5写实7-8)、步数卡30、采样器固定DPM++ 2M Karras,这四条卡准废图率降一半。
懂原理最大的好处是调参有方向。出图糊了知道是步数不够或CFG太低,色彩崩了知道是CFG太高,跑偏了知道是提示词权重不对。不用每次出废图就重写提示词从头试。我个人经验——先固定参数跑一组,看哪里不对再针对性调,比每次全调效率高十倍。
零基础出图流程不熟的,先过一遍 AI绘画动漫角色怎么画 把出图流程跑顺,再回头看这篇原理就通透了。想抠提示词写法的,参考 AI绘画描述词怎么写 那篇的词库。
常见问题
AI绘画是凭空生成还是抄袭现有图?
都不是。它是从随机噪声出发,按训练时学到的图像规律去噪还原出新图,不是直接拼贴或复制训练图。训练阶段学的是规律不是存图,出图是生成不是检索。
同一个提示词为啥每次出图不一样?
因为起点噪声是随机的。去噪过程从不同噪声出发,擦出来的图就不同。固定seed值能复现同一张图,不固定就每次随机。
步数越多出图越好吗?
不是。步数到了一定值边际收益递减,30步和50步肉眼几乎没差,但50步出图时间多三分之二。SDXL 28-32步是性价比最高的区间。
AI绘画原理和ChatGPT那种大语言模型一样吗?
不一样。大语言模型是预测下一个token的Transformer,AI绘画主流是扩散模型,做的是从噪声去噪还原图像。原理不同,但都靠大规模数据训练学规律。
觉得有用的话分享给朋友吧。