AI绘画术语词典:从VAE到Checkpoint的完整概念解析手册

AI绘画术语词典:从VAE到Checkpoint的完整概念解析手册
AI绘画术语词典VAE到Checkpoint完整概念解析手册

AI绘画圈子有个不太好的风气——老手喜欢拽术语,新手听得一头雾水又不好意思问。什么"这个模型的正向clip跳过层设为2效果更锐""换个VAE吧你这个图的色彩空间不对"——听起来像在讨论火箭科学,其实每个概念拆开了都很简单。

我刚入坑SD的时候,被Checkpoint、VAE、LoRA、Embedding、Hypernetwork这些词搞得快疯了。每个教程都在用这些词,但没有一个教程解释这些词到底是什么。我花了三个月边用边查,终于把这些概念的关系理清楚了。这篇文章就是我当时最需要的那份"术语说明书"——用最直白的中文把AI绘画的技术黑话全部翻译一遍。不管你用的是Midjourney、Stable Diffusion还是DALL-E,这些概念迟早会出现在你的学习路径上。先看懂了再上手,事半功倍。想了解AI绘画的整体工具生态,AI绘画工具软件全面入门提供了很好的全景视角。

基础模型层:Checkpoint、VAE和CLIP的关系

把AI绘画模型想象成一个三层蛋糕:最底层是Checkpoint(主模型),它上面坐着VAE(图像解码器),旁边还有个CLIP(文本理解器)。三者各司其职。Checkpoint(主模型/大模型):这是AI绘画的"大脑",一个几GB的大文件,包含了AI学会的所有图像知识。当你用SD画图时,你选的那个"模型"就是一个Checkpoint。不同Checkpoint擅长不同的风格——有的擅长写实人像(如ChilloutMix),有的擅长二次元(如Anything),有的擅长建筑场景。它本质上是"去噪能力"的来源——从一团随机噪点中逐渐还原出有意义的图像。VAE(Variational Autoencoder,变分自编码器):它负责图像的"编解码"——把AI内部的数学表示翻译成你最终看到的PNG图片。换个VAE就像给同一段音乐换不同的音响——细节可能完全不一样。VAE主要影响图像的色彩饱和度、锐度和细节表现。CLIP(Contrastive Language-Image Pre-training):它负责理解你的文字prompt——把你写的"一只戴墨镜的猫"翻译成AI模型能理解的数学向量。CLIP是OpenAI开发的,几乎所有主流AI绘画工具(MJ、SD、DALL-E)的文本理解都基于CLIP。理解三者关系的最简单方式:你写prompt → CLIP翻译成向量 → Checkpoint根据向量去噪生成潜在表示 → VAE把潜在表示解码成图像。关于模型的基础知识,AI图像处理术语基础入门可以作为配套阅读。

微调模型层:LoRA、Embedding和Hypernetwork的区别

如果Checkpoint是一本通用百科全书,那LoRA就像你贴在上面的便利贴,Embedding像你夹在书里的书签,Hypernetwork像你套在书外面的一个导航壳。LoRA(Low-Rank Adaptation,低秩适配):目前最主流的微调技术,一个几MB到几十MB的小文件,贴在主模型上就能让模型学会特定的角色、风格或姿势。LoRA的优点是体积小、训练快(十几分钟到几小时)、可以叠加使用——你可以在一个人像模型上同时挂"汉服LoRA""水墨风格LoRA"和"特定面部LoRA"。Embedding(Textual Inversion,文本反转嵌入):比LoRA更轻量,只有几十KB。它的原理是"教会AI一个词"——比如训练一个叫"mycat"的Embedding,之后在prompt里写"mycat"就能生成你家的猫。Embedding的缺点是只能教"概念"(物体、人物),不能教复杂的风格或动作。Hypernetwork(超网络):比LoRA出现更早但现在已经较少使用。它是一个附加的小网络,通过修改主模型的注意力层来影响输出。体积比LoRA大,效果也不如LoRA稳定。Hypernetwork目前基本被LoRA取代了,除了在一些非常特定的ComfyUI工作流里还会用到。LyCORIS/LoCon/LoHa:这些是LoRA的变种,本质上是LoRA的不同数学实现方式,对普通用户来说可以粗暴地理解为"不同版本的LoRA"。

采样与生成层:Sampler、Steps和CFG Scale

这三个参数控制的是"AI画图的过程"——不是画什么,而是怎么画。Sampler(采样器):决定了AI从噪点还原图像时采用的数学算法。常见的有:Euler(速度快、画面干净);DPM++ 2M Karras(目前最推荐的通用采样器,速度和质量的最优平衡);DDIM(老一辈经典,风格偏柔和);UniPC(新秀,速度极快)。不同采样器产出的图在细节和色彩倾向上有微妙差异——同样的prompt用Euler和用DPM++出来的图可能判若两人。Steps(采样步数):AI画图像一个"逐步清晰化"的过程——从第一帧(纯噪点)到最后一帧(成品图),Steps决定了这个过程分多少步。20步是大多数采样器的"甜区"——低于15步画面开始糊,高于30步收益递减严重。CFG Scale(Classifier Free Guidance Scale,引导强度):控制AI对prompt的"听从程度"。低CFG(1-4):AI自由发挥,画面更自然但可能跑偏prompt。中等CFG(5-8,推荐区间):最平衡。高CFG(9-15):AI严格听从prompt,但画面可能变得"过饱和、过锐、不自然"。CFG Scale太高了画面会烧焦("fried"效果),太低了AI放飞自我。关于这些参数的实际调校经验,AI绘画提示词工程完全指南里有大量实操案例。

潜空间与控制层:Latent Space、ControlNet和IP-Adapter

这些是AI绘画的"高级操控台"——理解了它们,你就不只是"给AI下命令",而是能"手把手教AI画"。 Latent Space(潜空间):AI不直接处理像素图像——它把所有图像压缩到一个低维度的"潜空间"里运算,最后再解码回像素。这个潜空间维度通常是原图的1/8——也就是说一张1024×1024的图在AI内部被表示为128×128的潜变量矩阵。理解潜空间的概念,你就能理解为什么SD的生成速度这么快(大部分运算在低分辨率潜空间进行)。ControlNet:Stable Diffusion生态中最强大的控制工具,能让AI"按照你指定的姿势/线稿/深度图来画"。Canny模式用边缘检测线稿引导、OpenPose用人体骨骼引导、Depth用深度图引导空间关系。有了ControlNet,AI绘画从"抽卡"进化成了"精确绘图"。IP-Adapter(Image Prompt Adapter):让AI"参考一张图的风格或内容"来生成新图。比传统的img2img更智能——它不是简单的"在图A的基础上改",而是提取图A的"视觉概念"然后融进新的生成过程。这些高级工具的系统教程可以参考AI绘画风格控制与迁移AI绘画硬件配置指南

提示词工程层:Prompt、Negative Prompt和权重语法

写prompt不只是"描述你想画什么"——它是一门微型的编程语言,有自己的语法、运算符和最佳实践。Positive Prompt(正向提示词):告诉AI"画什么"。核心原则:重要的词放最前面、用逗号分隔概念单元、用具体的名词和形容词而非抽象的。Negative Prompt(反向提示词):告诉AI"不要画什么"。这是SD生态的专属功能(MJ没有显式的negative prompt),常用的negative prompt包括:"low quality, blurry, distorted face, extra fingers, bad anatomy, watermark, text"——这套模板几乎所有SD用户都背得出来。权重语法(Weight Syntax):在SD里用 (word:1.2) 表示提高该词权重20%,(word:0.8) 表示降低20%。括号可以叠加——((word))等价于 (word:1.21)。MJ里用 word::2 表示双倍权重。Prompt编辑(Prompt Editing,SD专属高级功能):可以在生成过程中动态切换prompt——比如前10步画"猫",后10步画"狗",产生的是一种猫狗融合的奇异效果。语法是 [cat:dog:0.5](在50%的步数时切换)。

图像到图像层:img2img、Inpainting和Outpainting

不光能从零生成——AI还能对已有图像进行修改、局部重绘和向外扩展。img2img(图生图):给AI一张参考图,让它在这张图的基础上按照你的prompt进行修改。关键是"Denoising Strength"(去噪强度)参数——0.1意味着只微调细节,0.8意味着几乎推倒重来。Inpainting(局部重绘):只修改图片中的选定区域。AI绘画的"修图神器"——脸画歪了?圈出来inpaint。手画多了手指?圈出来inpaint。背景太乱?圈出来inpaint。Outpainting(向外扩展):给图片四周增加内容,扩展画幅。比如把一张方图扩展成横图,AI会自动"脑补"出原图之外的内容。这些功能在商业修图工作流中的位置可以参考AI图像合成与修复技术

评估与优化层:Upscale、Face Restoration和美学评分

AI生成的图不是终点——后处理步骤往往决定了最终成品的可用性。Upscale(超分辨率放大):把AI生成的小图(如512×512)放大到可印刷的尺寸。主流工具:Real-ESRGAN(通用放大)、Upscayl(开源免费)、Topaz Gigapixel(商业软件,效果最好)。Face Restoration(面部修复):SD生态中专用于修脸的算法,如CodeFormer和GFPGAN。当AI画的人脸扭曲或模糊时,面部修复可以把它"拉回正常"。但注意:面部修复有时会让脸看起来"过于完美"而失真。Aesthetic Score(美学评分):某些模型训练过程中使用的一个自动化评估指标——AI自己给自己的图打分。但对普通用户来说,这个分数参考价值有限——AI的审美和人类的审美不完全重合。更多关于AI出图质量优化的讨论在Reddit的StableDiffusion社区有海量的实战经验分享。

文件格式层:.safetensors、.ckpt和.pt的区别

下载模型文件时你会看到这些后缀——它们的区别不是学术问题,而是安全问题。.safetensors(安全张量格式,强烈推荐):Hugging Face设计的模型文件格式,最大的优点是"不包含可执行代码"——也就是说一个.safetensors文件不可能包含病毒。目前主流模型都提供这个格式。.ckpt(Checkpoint格式,已过时但有风险):Python的pickle序列化格式,可以包含任意可执行代码。理论上一个恶意的.ckpt文件可以在你加载模型时执行病毒代码。现在大部分新模型已经不用这个格式了,但老模型和某些小作坊产出的模型还在用。.pt/.pth(PyTorch原生格式):PyTorch框架的标准模型格式,功能和.ckpt类似。安全风险同.ckpt。优先级顺序:.safetensors > .ckpt > .pt。如果同一个模型同时提供这三种格式,选.safetensors。这个安全意识是AI绘画圈的"戴安全套"——多数人嫌麻烦不用,但出事了就晚了。安全下载和模型管理的更多建议可以参考Hugging Face上的官方文档。

常见问题

AI绘画术语词典的高频问题涵盖概念理解、工具选择和技术安全。

VAE到底要不要换?原版的不行吗?

原版VAE可以用,但大部分第三方模型都推荐换用特定的VAE以获得更好的色彩和细节。换VAE就像给你的相机换镜头——原厂套头能用,但定焦镜头的画质更好。

LoRA和Checkpoint可以混用吗?多少个LoRA是上限?

可以混用,一个Checkpoint上同时挂3-5个LoRA是常规操作。但LoRA之间有"权重竞争"——挂得越多,每个LoRA的实际影响力越弱。通常3个以内效果最佳。

CFG Scale和Denoising Strength有什么区别?

CFG Scale用于txt2img(文生图),控制AI对prompt的"听话程度"。Denoising Strength用于img2img(图生图),控制AI对原图的"修改程度"。两者都影响输出但作用于不同流程。

觉得有用的话分享给朋友吧。