AI绘画技术进步史:从GAN到Diffusion的生成模型演进历程

AI绘画技术进步史:从GAN到Diffusion的生成模型演进历程
AI绘画技术进步史:从GAN到Diffusion的生成模型演进历程 | FlowPix AI绘画技术进步史从GAN到Diffusion的生成模型演进历程

2015年的某天我刷Twitter看到一张全是狗脸和眼睛的迷幻图片——那是Google的DeepDream生成的——当时我的感受是"这东西又诡异又迷人,但肯定和'绘画'两个字没什么关系"。十年后的今天我坐在这里用AI出图,每一张都比我在美术学院学了四年的同学画得"好看"。这个反差太大,以至于我有时候会想:这十年到底发生了什么?不是"哇AI好厉害"那种感叹——而是想搞清楚每一步技术跃迁解决了什么问题、留下了什么局限。这篇不是什么学术综述——是一个从2015年就开始关注AI图像生成的普通用户视角下的"技术进步史"。

前GAN时代(2015-2017)——AI画的图还不能叫"画"

2015年Google发布了DeepDream——很多人第一次见到"AI生成的图像"。但DeepDream的底层逻辑和今天的AI绘画完全不同:它不做"创造",只做"增强"——给它一张图,它在图中找出和它训练时见过的模式相似的部分,然后放大这些模式。结果就是:输入一张云的照片,输出一张"云里全是狗脸和眼珠"的迷幻图片——因为ImageNet训练数据中有大量狗和眼睛。DeepDream的本质是"模式过拟合的可视化"——它让我们看到了神经网络"眼中"的世界,但它完全不能做文本到图像的生成。

2016-2017年出现了两件重要的事。第一件:Neural Style Transfer(神经风格迁移)——给定一张"内容图"和一张"风格图",AI可以把风格图的艺术风格"移植"到内容图上。这就是Prisma这类App的技术基础——你用手机拍张照,选梵高的《星夜》风格,输出就是一张"像梵高画的你的照片"。风格迁移的意义在于它证明了"内容和风格在神经网络中是可以分离的"——这一点后来深刻影响了Stable Diffusion的设计。第二件:PixelRNN和PixelCNN——它们逐像素地生成图像——从左到右、从上到下、一个像素一个像素地"画"出来。速度极慢(一张小图可能要几分钟),生成的图像模糊且缺乏全局结构。但它们证明了一件事:用神经网络直接生成像素是可行的——这就为后面的所有工作铺平了道路。

GAN时代(2014-2020)——"对抗"出来的视觉真实感

虽然GAN(Generative Adversarial Network)的原论文在2014年就发表了,但GAN真正在图像生成领域爆发是2017-2020年。GAN的核心思想很巧妙——不需要理解"马长什么样"——只需要一个造假的(生成器)和一个鉴定的(判别器),让它们互相对抗:"造假者"试图生成逼真的马;"鉴定者"试图区分真马和假马。两个网络在对抗中共同进步——造假者越来越会造假,鉴定者越来越会鉴定。这个机制让GAN生成的图像在"真实感"上迅速超越了之前所有方法。

2018年NVIDIA的StyleGAN打破了记录——生成的人脸逼真到普通人无法分辨真假。StyleGAN的关键创新是"风格混合"——它把"高级属性"(脸型、性别、年龄)和"低级属性"(肤色、发色、纹理)在生成过程中的不同阶段注入——就像画家先画轮廓再上色。这让生成的图像第一次具有了"可控性"——你可以调"这个参数多一点"来改变人物的某个特征。但GAN有三个致命的局限:训练极不稳定(常常"模式崩塌"——生成器只学会生成少数几种花样)、对文本的理解几乎为零(你没法告诉它"画一只猫"——只能从随机噪声中碰运气)、多样性差(同一类别的变化很少)。

2016-2019年间还有一些有趣的尝试——StackGAN尝试了"用文本作为条件"来生成图像,但效果很差——"a bird with red breast and white belly"生成的鸟常常是红色和白色的像素随机混合,没有鸟的形状。VQ-VAE和VQ-VAE-2试图用"编码-解码"的方案替代GAN,生成质量有所提升但计算效率低。这些"非GAN"的探索在当时看起来是"有趣的尝试但不如GAN",后来回头看——它们是Diffusion Model出现之前的技术预演。arXiv上的生成模型论文存档和Papers with Code的基准测试对比可以让你看到完整的技术演进脉络。

Diffusion革命(2020-2022)——为什么"去噪"比"对抗"强

2020年DDPM(Denoising Diffusion Probabilistic Models)的论文发表是一个分水岭——它展示了一种全新的图像生成思路:不是"对抗",而是"去噪"。Diffusion的训练过程:拿一张清晰的图→逐步添加高斯噪声→直到变成完全随机的噪点→训练模型学习"如何从加了第t步噪声的图中恢复出第t-1步的图"。推理(生成)过程:从纯随机噪点开始→逐步去噪→每一步图像都变得更清晰→最终得到一张全新的、清晰的、但训练集中不存在的图。这个过程的可视化非常直观——就像一张被噪点覆盖的照片逐渐"浮现"出清晰的内容。

为什么Diffusion比GAN强?三个原因。第一,训练稳定——没有对抗博弈,没有模式崩塌的风险。Diffusion的训练就是一个简单的"去噪自编码器"——数学上非常稳定。第二,多样性好——因为生成从随机噪点开始,每次的噪点不同,生成结果也不同——Diffusion模型几乎不会陷入"只能生成少数几种变化"的困境。第三——也是最重要的——Diffusion天然适合条件生成。你可以在去噪过程的每一步都"告诉"模型你想生成什么(通过文本嵌入)——模型会在去噪的同时把图像引导向"符合文本描述"的方向。这就是DALL·E 2、Stable Diffusion、Midjourney背后共同的技术原理——"条件扩散模型"(Conditional Diffusion Model)。

2021年1月OpenAI发布了DALL·E——128亿参数的Transformer直接把文本token序列"翻译"成图像token序列。但DALL·E生成质量一般(256×256),真正引爆行业的是2022年4月的DALL·E 2——它把CLIP(文本-图像语义对齐模型)和Diffusion结合在一起,第一次实现了"高质量、高分辨率、语义准确"的文本到图像生成。更多关于扩散模型原理的内容,在AI 3D模型生成中也有对生成模型技术演进的关联分析。

开源爆发与生态形成(2022-2025)——从"工具"到"平台"

2022年8月22日Stability AI开源了Stable Diffusion——这是AI绘画历史的"Google开源Android"时刻。SD不是第一个文本到图像的扩散模型,但它是第一个高质量、低成本、完全开源的选择。它把扩散过程从像素空间搬到了"潜空间"(Latent Space)——用VAE把图像压缩到原来的1/8大小,在压缩后的潜空间中进行扩散,最后再解压回像素——这个"潜空间"技巧把计算成本降低了大约一个数量级,让普通消费级GPU(8GB显存)也能跑图像生成。

开源之后发生的事情是教科书级的技术生态爆发。2023年2月ControlNet——让创作者可以用边缘检测、深度图、人体姿态骨架来精确控制生成的图像。2023年3月LoRA(Low-Rank Adaptation)——用极小的文件(几十MB)就能微调模型的特定概念或风格。2023年5月IP-Adapter——让"参考图"可以作为Prompt的一部分,解决了"保持角色一致性"的难题。2024年的SD3和SD Turbo——将生成步骤从50步压缩到4步甚至1步,速度提升10倍以上。2025年的Flux(由原SD核心团队开发)——在文字渲染和复杂构图方面又上了一个台阶。

Midjourney走了另一条路——闭源但极致优化用户体验。从2022年V3的"画得还行但手指是六根"到2024年V6的"几乎可以以假乱真",Midjourney的每一次大版本更新都在重新定义"AI能画多好"。它没有开源社区那么灵活,但它证明了"产品化"的巨大价值——把最尖端的技术包装成普通人在手机上点点就能用的产品。关于AI绘画工具的选择和对比,AI绘画课程报名指南中有从学习成本角度的工具推荐。AI绘画鉴定器则从另一个角度探讨了技术进步带来的鉴别挑战。

常见问题

GAN和Diffusion Model的根本区别是什么——为什么Diffusion取代了GAN?

两者的核心逻辑完全不同。GAN是"对抗"逻辑:一个生成器造假,一个判别器打假——两者在对抗中共同进步。问题在于GAN的训练极不稳定——容易"模式崩塌",结果就是生成的图虽然清晰但多样性差。Diffusion Model是"去噪"逻辑:先给一张清晰的图逐步添加噪声直到变成纯噪点,然后训练模型从噪点中逐步恢复出清晰的图。Diffusion的优势:训练稳定(没有对抗博弈)、生成多样性高、可以通过文本引导控制生成方向。代价是推理速度慢——但2023年之后的蒸馏和加速技术已经大幅缩短了这个时间。

为什么2022年被视为"AI绘画元年"——之前的技术差在哪?

2022年之前AI绘画存在三个致命瓶颈。瓶颈一:文本理解——DALL·E 2引入了CLIP,让模型学会了文本和图像在语义空间中的对应关系。瓶颈二:分辨率和真实感——Stable Diffusion将潜在扩散模型引入,大幅降低了计算成本,使高质量输出成为可能。瓶颈三:开源和生态——2022年8月Stable Diffusion开源,引爆了ControlNet、LoRA、IP-Adapter等周边工具的涌现,形成了庞大的SD生态系统。

从创作者的角度看,技术进步带来了哪些实质性的改变?

三个最实质的改变。第一,控制精度的跃升——从"写一段Prompt然后祈祷"变成了"你定骨架AI填血肉"。第二,风格一致性的解决——IP-Adapter让"同一角色在不同场景中保持长相一致"成为可能。第三,实时交互的到来——SD Turbo和LCM让"打字的同时就能看到画面变化"成为现实——从异步循环变成了实时创作流。

AI绘画的下一个技术突破可能是什么方向?

三个方向最值得期待。第一,视频生成的成熟——当视频生成能达到当前图片生成的精确控制水平时,单人制作短片和动画将成为现实。第二,3D资产生成——从单张图片到可用的3D模型——"看着好看但导进引擎就出问题"的现状正在改善。第三,多模态理解与交互——未来的AI绘画工具可能是"你给它看几张参考图、说一段描述、画一个草图,它综合所有输入理解你的意图然后生成"。