早期AI绘画长什么样?2021到2022年的歪脸糊手图,翻回去看全是回忆

早期AI绘画长什么样?2021到2022年的歪脸糊手图,翻回去看全是回忆
早期AI绘画的歪脸糊手旧图与现在精细出图的对比插画

先交代时间:2021到2022年的早期AI绘画,歪脸、糊手、分辨率低,是大家当笑话围观的阶段,没人拿它当正经工具。依据是那时候的模型能力和算力摆在那里,512×512的尺寸连手都撑不住。想直观感受这几年走了多远,最好的办法是把当年存的旧图翻出来,跟现在的图并排放着看一遍。

早期AI绘画最大的特点是烂得好笑:歪脸、糊手、分辨率低,还有一股说不出来的塑料质感。2021年冬天我在群里第一次刷到这类图,一群人笑了半个钟头,谁也没想到三年后的差距会大到让人沉默。

先把时间点钉死。2021年上半年,这类图基本还在小圈子里转,普通人碰不到;2021到2022年,在线生成站多了,普通用户开始跟风玩;2022年下半年,画风陡然一变,笑声慢慢停了。我自己是2022年春天开始动手跑图的,那阵子存下来的翻车图,硬盘里到现在还躺着七十多张。

这篇就干一件事:把旧图翻出来,对着现在看。不写技术原理,那不是我的强项。

那两年的图,翻回去看长什么样

歪脸、糊手、低分辨率、背景一团浆糊,是2021到2022年早期AI绘画的四大招牌,主流出图尺寸512×512,放大一倍细节就散架。后面三条,基本都跟第四条有关——尺寸小,是当时算力和模型双重限制下没办法的选择。

先说手。那是重灾区里的重灾区。我当时存过一张端茶杯的图,一只手数出九根手指,指节还是从手背斜着长出来的,看着像植物。五根手指反而是要运气好才碰得上,六根属于正常发挥。

脸也好不到哪去。正面像还能看,角度稍微侧一点,五官开始"融化":眼睛大小随缘,耳朵位置随机,下颌线经常跟脖子搅在一起。背景更省事,一律是化开的颜料,你说是花、是窗帘、是烟雾,都说得通。

几个关键项,我拿自己存的图做了个粗略对照。

项目2021-2022年现在
常见出图尺寸512×512,放大就崩1024起步,2048也稳
手部五六根手指是常态大概率正常,偶尔翻车
人脸侧脸融化,五官漂移侧脸正脸都立得住
画面里的文字几乎全是乱码多数单词能写对
单张等待时间十几秒到几分钟,还要排队几秒到十几秒

顺带一提,当时写提示词还得用英文,而且要堆那种"best quality、trending on artstation"之类的咒语,不然出图质量再掉一截。我英文不行,全靠复制别人现成的咒语,改两个词,十次里八次翻车。跑一张图等一两分钟,等来的可能是一只七根手指的手。

为什么那时候大家都在笑?

因为翻车太密集:一只手九根手指、侧脸化成蜡、画面文字全是乱码,早期AI绘画基本是行走的表情包工厂,笑点比成图还多。大家转发的动机很单纯——取乐,没别的。

那两年我的群聊日常是这样的:有人丢一张图进来,配一句"看这只手",然后一排哈哈。我自己也存过一张六指竖大拇指的图,当了小半年表情包,逢人斗图必甩。这种笑有个特点——它不是嘲笑某个人,是嘲笑"机器画得这么烂还挺自信"。

笑归笑,当时的判断其实高度一致:玩具。我身边没一个人觉得这东西能吃饭。包括我自己。现在想想,这个判断错得挺典型,我们拿2021年的完成度,去推了它十年后的天花板,谁也没料到改善速度是一年一个台阶。

要较真的话,当时也不是全无预警。有些图的构图和光感已经"像回事"了,只是细节崩。崩在细节,说明底层的东西是在的,这个信号我们都看见了,只是没人愿意当真。笑话听多了,人会麻木。

从笑到不笑,中间也就一年多

2022年是分水岭:上半年大家还拿AI绘画当笑话,下半年模型水平跳了一截,手和脸能看了,分辨率上去了,笑的人陆续不说话了。前后间隔也就一年出头,快得来不及调整心态。

转变在社群里的痕迹很具体。2022年上半年,群里晒图的配文是"哈哈哈你看这手";到下半年,同样的人晒图,配文变成了"你用的什么提示词"。问法一变,性质就变了——从看笑话,变成了取经。

我自己也做过一次对照实验。2022年秋天,把春天跑过的一组提示词原样重跑了一遍,同样的咒语、类似的种子,出来一看愣了几秒:脸立住了,手指多数时候是五根,背景能看出是"窗边"而不是一滩颜料。当时我把两张图并排截图发群里,配文就四个字:"时代变了。"那天群里没人发哈哈。

再往后的事,圈内人多半知道:热度冲上去之后也回落过,那波起落的来龙去脉,我写过一篇ai绘画狂热降温,跟这篇正好是一前一后,这里不展开。

写完这篇,我又把2022年存的翻车图翻了一遍,九根手指那张还在,越看越亲切。它们现在最大的用处是当参照物,给我量出这几年到底走了多远。要是你的相册里也压着当年的图,建议也翻翻——比看十篇评测都直观。

常见问题

2021到2022年普通人一般用什么玩AI绘画?

多数人走在线生成站的路子,输一段描述排队等图;动手能力强的在自己电脑上本地跑,普通家用显卡跑一张512×512的图,也要等十几秒甚至更久,显卡差点的直接跑不动。门槛比现在高不少。

为什么早期AI绘画的手总是画错?

手的结构复杂,姿态千变万化,训练数据里手的样貌又极其多样,当年模型的图像理解力撑不住这种组合,于是六指、粘连、指节错位成了标配。这也是后来各家模型专门花力气修手的原因——手成了衡量模型水平的一块试金石。

那个年代出的图还能放大看清吗?

基本不能。主流就是512×512,靠普通插值放大到两倍就开始糊,人脸像隔着毛玻璃。后期专门的高清放大修复流程普及之后,旧图的分辨率短板才算被补上一部分。

现在回看早期AI绘画的图还有什么意义?

两个用处。一是当尺子,量出技术进步的真实幅度,比任何文字描述都直观;二是提醒自己别拿现在的标准去笑话过去的粗糙,2021年被大家笑的那批图,正是后来一切的起点。你存过哪张印象最深的翻车图,评论区说一声也行。

延伸阅读