AI绘画使用全教程:从软件操作到高级技巧的系统化学习路线
两年前我第一次打开Stable Diffusion的时候——满屏的英文参数、命令行报错、显存不足的红色警告,我差点直接卸载。咬牙折腾了两天终于跑出了第一张图:一个"美丽的风景",看起来像是被泼了油漆的土豆,分辨率512x512。我记得特别清楚——当时对着那个土豆图发了十分钟的呆,然后做了一个决定:不学网上那些零散的教程,而是自己梳理一套系统的学习路径,从"这个东西到底怎么装"到"我怎么用它做出能卖钱的图"。两年过去了,现在回头看,那些让我最痛苦的阶段其实是最好解决的问题——前提是你有一个清晰的学习地图。这篇就是那个地图。
阶段零:别急着动手——先搞清楚"我要AI画什么"
这是我见过最多的新手错误:软件还没装完就开始焦虑"别人都出大片了我连一张图都跑不出来"——然后在Discord或GitHub上疯狂复制别人的Prompt,跑出来一堆跟自己没关系的美图,然后就没有然后了。先花半个小时回答三个问题:一,我用AI绘画主要是为了什么?(兴趣娱乐/社媒内容/商业接单/辅助职业创作)二,我最想画什么类型的图?(人物写实/二次元/场景概念/产品图/抽象艺术)三,我目前的美术基础大概什么水平?(完全零基础/会一些绘画/专业美术背景)。这三个问题的答案决定了你接下来应该选什么工具、学什么技能、投入多少时间。
如果你回答"兴趣娱乐"且想画二次元——从Midjourney开始,一个月足够你出好看的同人图。如果你回答"商业接单"且想画电商产品图——直接走Stable Diffusion路线,跳过MJ(因为你需要批量生成和精确控制)。如果你回答"辅助职业创作"且已经是一个设计师——重点学ControlNet和模型训练,Prompt反而不用太深(因为你的审美已经在脑子里了,你只需要AI"执行"你的想法)。关于不同需求的工具选择对比在AI产品绘画软件对比和AI草图绘画软件推荐中有更详细的横向分析。
阶段一:软件安装与环境搭建——最劝退但必须过的坎
AI绘画软件安装是新手的第一道鬼门关。Stable Diffusion WebUI的安装教程网上一大堆但大部分已经过时——因为这个生态的版本迭代快到令人发指。2026年最简单的方式:不要从零手动安装Python和Git——直接下载Stability Matrix这个整合包管理器,它帮你一键安装和管理不同版本的SD WebUI、ComfyUI、Fooocus,而且各个版本之间互不干扰。如果显卡显存小于6GB——别挣扎了,老老实实用云GPU(AutoDL、Colab、RunPod),本地跑SDXL最低需要8GB显存才能比较流畅。
Midjourney的"安装"就简单多了:注册Discord账号→订阅MJ→在Discord里开始写Prompt。但有一个隐藏坑:MJ的默认设置会把你生成的图公开发到社区画廊里。如果你在画商业项目——第一时间在设置里打开"stealth mode"(隐身模式),否则你的甲方可能会在MJ社区看到他们的产品概念图被全世界围观。ComfyUI的选择:如果你不是一个"可视化编程"爱好者——现阶段不建议从ComfyUI入门。它的节点式界面看起来很酷,但对于还在学"什么是CFG Scale"的新手来说完全是灾难。先用WebUI学基础,等你能用WebUI稳定产出之后,再决定是否转ComfyUI(ComfyUI在处理复杂工作流时确实更强——但你先学会"基础工作流"再说)。更多基础操作在AI草图绘画软件推荐中有分工具详解。
阶段二:Prompt工程——不是玄学,是一套可以量化的系统
市面上讲Prompt的文章99%都是"给你几个模板复制粘贴"——这不是学Prompt,这是搬运。真正的Prompt工程是一套你理解了之后可以自己构建任意需求的系统。我的五步构建法:
第一步:主体层(Subject)——回答"画什么"。要素:人物/物体/场景类型+数量+性别/年龄/特征。"a middle-aged Japanese sushi chef, one person, male, 50s, weathered face, short gray hair, wearing a traditional white happi coat"。第二步:动作与构图(Action & Composition)——回答"怎么画"。要素:动作+摄像机角度+景别+构图方式。"standing behind a wooden sushi counter, hands in the middle of forming nigiri——one hand holds the rice the other presses the fish slice on top, camera angle is eye-level slightly from the right, medium shot framing from waist to above head, the composition places the chef's hands at the center of the frame"。第三步:材质与光影(Material & Lighting)——回答"什么样的质感"。要素:所有可见表面的物理属性+光源方向/类型/色温。"the sushi counter is polished hinoki cypress wood with a warm honey tone, the chef's hands are slightly moist from the vinegared rice——the skin shows a subtle sheen, the fish is fresh salmon with visible marbling lines, lighting is from warm overhead pendant lamps creating pools of golden light on the counter, the background behind the chef falls into deep shadow creating natural vignette"。第四步:风格与媒介(Style & Medium)——回答"用什么风格呈现"。"photorealistic editorial food photography style, shot as if for a high-end Japanese food magazine, the image has the color grading of a documentary film——slightly desaturated with lifted blacks and warm midtones, shot on medium format digital camera, 4:5 aspect ratio"。第五步:技术与排除(Technical & Negative)——回答"不要什么"。"highly detailed, sharp focus on the hands and the sushi, natural grain texture, --no plastic food models, artificial looking fish, unnatural colors, text, watermark, overly HDR look, motion blur"。五步走完——你得到的不再是一个"试试看"的含糊描述,而是一个"设计图纸"级别的精确Prompt。
阶段三:ControlNet——从"抽卡"到"导演"的分水岭
如果你的AI绘画还停留在"写Prompt→出图→不满意→改Prompt→再出图"的循环里——ControlNet是你必须跨越的一道门槛。它让你用图片(而非文字)来控制AI的输出——你提供一张"结构参考图"(可以是线稿、深度图、人体姿态骨架或涂鸦),AI在保留这个结构的基础上填充内容和风格。这是从"AI画什么你看什么"到"你想画什么AI帮你实现"的质变。
ControlNet最重要的四种模式——以及什么时候用哪个:Canny(边缘检测)——用途:锁定画面的轮廓和构图。输入:任何图片(线稿、照片、涂鸦)。场景:你有了一张概念草图,想AI帮你填充色彩和细节;或者你想复制一张照片的构图但换掉内容。核心参数:Control Weight 0.6到0.8。太低结构会跑偏,太高画面会僵硬。Depth(深度图)——用途:保持空间关系和立体感。输入:任何有明确前后空间关系的图片。场景:你想保持一个场景的空间布局但改变风格或内容。比Canny保留更多"立体信息"而非仅仅是"轮廓信息"。OpenPose(人体姿态)——用途:控制人物的姿势和动作。输入:人物照片或手画的骨架。场景:你画了一个人物的动态姿势草图,想让AI在保持这个姿势的基础上"穿上皮肤"或者"换一个风格"。核心是控制"骨骼"而非"外形"。Reference/IP-Adapter——用途:保持角色或物体的一致性。输入:一张参考图(角色面部、特定物体、风格参考)。场景:你有一个人物的照片,想让AI在不同场景和动作中保持这个人的面部特征。严格来说不是ControlNet的一部分——但在"控制AI输出"的目标上和ControlNet并列。
ControlNet的学习顺序:先学Canny(最基础最万用)→再学OpenPose(如果你画人物多)→然后Depth(如果你画场景多)。每一种花一到两个下午集中练习——找几张参考图反复调试参数,直到你能"看着输出图预测参数调整的方向"。关于ControlNet在具体创作场景中的深度应用在AI游戏怪物角色绘画和AI概念场景绘画中有实战案例。技术文档参考ControlNet GitHub和CivitAI的ControlNet模型库。
阶段四:模型生态与LoRA训练——拥有你自己的"画风"
当你过了"别人模型出什么图我就出什么图"的阶段——下一步就是训练自己的LoRA。LoRA(Low-Rank Adaptation)是一种轻量级的模型微调技术——你给它15到30张同一个风格或同一个角色的图片,它学出一个"风格补丁",之后你把LoRA加载到基础模型上——基础模型就"多了一种能力"。比如你收集了30张宫崎骏风格的手绘场景,训练一个"Ghibli风格LoRA"——之后你写的任何Prompt加上这个LoRA都会以宫崎骏风格呈现。
LoRA训练的关键不在于技术(现在的训练工具已经极其傻瓜化,如Kohya SS GUI、OneTrainer)——在于训练数据的质量。三原则:一,风格/角色的一致性。30张图必须是"同一种风格"或"同一个角色"——不能混。如果你训练一个"水墨风LoRA"——30张图应该全部是水墨画,不能有15张水墨+15张水彩。二,内容的多样性。在保持风格一致的前提下——30张图的内容要尽量多样:不同的构图、不同的色彩、不同的主题。这防止LoRA"过拟合"——学歪了,以为"水墨画=画竹子",以后画什么都带竹子。三,分辨率和裁剪。所有训练图统一分辨率——建议768x768或1024x1024。不要混横图和竖图——AI在训练时会被搞糊涂。
训练一个LoRA大概需要1到3小时(取决于图片数量和显卡性能)。训练完之后的测试:用一些你在训练数据里没出现过的题材来测试——比如你的训练数据里只有"山水画",测试时写"用这个LoRA画一只猫"——如果画出来的猫也是统一的水墨风格且看起来合理,LoRA训练成功。如果猫变回写实风格——LoRA没学进去。关于模型训练的更多细节参考AI纹样图案设计教程中关于风格一致性的讨论。
常见问题
AI绘画学了半年还是感觉"被AI牵着走"——怎么成为真正的掌控者?
这个感觉的根源是"你在用AI的默认审美标准"。AI默认的审美=训练数据中的平均审美=大众审美=不出错但也没个性的图。突破方法:不再把AI出图当作"最终成品"——把它当作"原材料"。给自己定一个规则:AI出的图,至少经过三步人工修改才能算完成。第一步:构图筛选——AI出20张,你手动挑出3张最有潜力的(不是最好看的,是"最有改造价值的")。第二步:局部重绘——把选中的图导入Krita或Photoshop,手动修改AI画错的部分(手指、文字、不合理的阴影)。第三步:风格叠加——在修好的图上,叠加你自己的手绘元素、纹理、或者用另一个AI工具做风格迁移。这一步让你的"手"进入画面——哪怕只在局部加了一些手绘线条,这个图的"作者性"就从AI转移到了你身上。
怎样避免AI绘画"撞图"——生成的图和别人太像了?
"撞图"的原因是你用的Prompt、模型、种子、参数和别人太接近。四个防撞策略:一,不要用"热门模型"的默认输出——至少加载一个你自己训练或找到的小众LoRA。二,不要复制别人的Prompt直接跑——至少改三个元素(把"sunset"改成"pre-dawn blue hour",把"young woman"改成"woman in her 40s",把"golden light"改成"overcast diffused light")。三,种子值随机化——不要用固定种子反复优化同一张图,用随机种子跑大量变体再筛选。四,手动后期——这是最根本的防撞手段。两张AI原图可能很像,但经过不同的人工后期处理——最终成品会截然不同。
AI绘画的未来会淘汰画师吗——学这个还有前途吗?
淘汰的是"只会画行活"的画师——不是"有审美判断力和创作思想"的画师。AI让"画得像"这个技能从稀缺资源变成了基础设施——就像计算器让"算得快"不再是会计的核心竞争力。但"知道画什么""知道什么是好的""知道如何把AI的产出改造成有灵魂的作品"——这些能力反而因为AI的出现变得更稀缺、更值钱了。你学AI绘画的目标不应该是"成为AI的Prompt打字员"——而是"成为能用AI把创作效率提升三到五倍的创作者"。这个定位下,AI绘画不仅不会没前途——它是未来五年视觉创意领域最值得投入的技能之一。