ai 绘画邪门不是闹鬼:多出的手、背景人影、恐怖谷脸的成因与排查
先泼盆冷水:AI绘画没有灵异事件,你看到的每张"邪门"图都能落到技术成因上——训练数据残留、采样不彻底、解码走样,三类占了我个人抽卡翻车记录的九成以上。这个判断依据是我抽过的具体样本数出来的,不是感觉,边界也得讲清楚:闭源模型不给种子和参数时,只能缩小范围,没法百分百归因。读者先做一件事:别急着删图,把种子号记下来再排查。
很多人抽到 ai 绘画邪门图的第一反应是后背发凉。先把结论放这儿:没有一张是"闹鬼",全部能归到训练数据残留、采样噪声、解码失真这三处,而且多数能复现、能修。
这么说有底气吗?有。上个月给一个漫展摊主出海报,我三天抽了四批,共62张。留废图记录的习惯让我数出了明细:11张手指不对,3张背景楼梯拐角站着半截人影,还有1张最瘆人——主角的脸和三米外一个路人长得一模一样,连痣的位置都相同。当时群里有人喊细思极恐,我盯着那张图看了十分钟,看出来的不是鬼,是机制。
背景里凭空多出来的人影,真是模型"看见"了什么吗?
背景人影不是灵异,是训练数据的裁剪残留加采样不彻底,两层问题叠出来的视觉副产品,能复现也能消除。训练集里有海量多人合照,裁切工具只抠主体,边角的半个人就连着背景一起被学进去了;采样时步数不够,这些低频轮廓没被完全擦掉,就成了画面里的残影。
扩散模型的原理一句话讲完:把完整图逐步加噪,学"怎么从噪声里还原图",生成时反过来,从一团纯噪声开始一步步减。问题出在减得不彻底。步数设少了,或者提示词权重打架,模型半路就收工,没减干净的部分恰恰最像背景里的轮廓和阴影。你以为是有人在后面站着,放大看,只是一团没收敛的噪声被解码成了"像人"的形状。
那张海报废图我放大到400%看过,所谓人影是一截袖子连着半只没有指头的手,颜色跟墙面阴影只差一两个色阶。这哪是闹鬼,这是模型在模糊区域硬认出了一个人形——训练数据里"楼梯加人物"的构图组合太多,它对这种场景有强烈先验:这儿该站个人。
扯远一句,我当时差点发朋友圈配文"AI成精了",忍住了。发出去图个乐可以,真信了就麻烦,因为你永远不会去查参数。
我用一张邪门废图做了对照实验,四步锁死问题
排查别靠玄学,固定四步走:先记种子、再提步数、然后修局部、最后减提示词,顺序不能乱,每步只动一个变量。动完重抽同一种子做对比,两分钟就能把责任锁到数据、采样还是解码的某一层。
拿那张人影图举例。第一步,种子号1823761记进文档,其余参数一个字不动。第二步,采样步数从25提到40重抽——人影没了,原位置变成一片普通衣褶。责任八成在采样不彻底,跟提示词无关,第三步不用做了。要是人影还在,才轮到怀疑提示词里某个词。
另一次更典型。那张"双胞胎路人"的脸,我固定种子跑了20次,每次只改一个东西:把"杰作、超高清、8k"这类堆料词删掉。第9次开始,路人的脸不再是主角脸的复制,眉眼有了自己的差异。我的理解是:高权重风格词把模型往训练集里最保险的那张脸压,画面人物一多,它干脆复用同一套五官交差。重复五官就是这么来的,跟抄近道一个道理。
手指崩、比心变六指、握拳黏成一坨,机制接近但修法不同,我在这篇里单独写过实操:ai 绘画手势总崩?比心六指、握拳黏指、持物穿模的修正实操。
至于为什么同种子必复现,那是种子机制的事,感兴趣的看这篇:ai绘画00001这种文件名里藏着你的图,种子机制一次讲透。
现象、成因、对策,一张表对号入座
常见邪门现象集中在五类,成因和先手动作一一对应,我整理成下表,对着现象找行,试第一招不对再换。不需要先把机制吃透再动手,排除法比空想快得多。
| 画面现象 | 真实成因 | 先做的动作 |
|---|---|---|
| 背景多出半透明人影 | 采样不彻底,叠加多人构图的训练先验 | 步数提到40,同种子重抽对比 |
| 手指多一根、两指黏连 | VAE解码丢细节,手部在潜空间里占的像素太小 | 开手部修复或局部重绘 |
| 主角和路人脸完全一样 | 风格词权重过高压制了人物差异化 | 删堆料词,人物特征写具体 |
| 一张脸里两双眼睛、五官重复 | 提示词冲突,人数没锁死 | 明确写单人,配反向提示词 |
| 整体像真的、细看发毛 | 训练数据里美颜滤镜比例过高,恐怖谷脸 | 砍半磨皮类LORA权重,或换底模 |
恐怖谷脸单独说两句。那种哪里都对、合起来渗人的感觉,来源很具体:真人向模型的训练数据里,美颜过的自拍占比过高,皮肤被抹平、瞳孔被放大,模型学到的是滤镜后的脸,不是真实的脸。再叠加提示词里的"写实"二字,两套审美标准打架,出来的脸就卡在真人和假人中间。VAE这台东西也脱不了干系——它像个过于自信的压缩机,先把脸压扁再吹回来,吹回来的那层皮肤质感就是塑料的。改法偏向暴力:磨皮类LORA权重砍半,或者干脆换底模,比调几十个参数都管用。
回到开头那张"双胞胎路人"的海报:固定种子、40步、删掉堆料词,重抽一次,路人有了自己的脸,海报当天就交了。所以说,怕的不是图诡异,是没记录。种子不记、参数不存,翻车了只能干瞪眼。从下一张废图开始建个文档,每抽到一张怪图记一行,一周后你就是自己的驱魔人。
常见问题
同一段提示词,为什么我抽出来邪门,别人抽出来正常?
大概率是参数差异。采样器、步数、CFG、模型版本,任何一项不同结果都会天差地别,先让对方截一张完整参数图逐项对,九成能找出差别。
抽到邪门图应该立刻删掉吗?
别删。它是你环境里最真实的问题样本,记下种子和参数再处理也不迟。我的废图文档存到一百多张的时候,定位新问题的速度比刚起步快了不止一倍。
恐怖谷脸和手崩是同一个毛病吗?
不是。脸的问题多出在训练数据的审美偏移,手的问题多出在解码环节丢细节,一个靠换模型减权重,一个靠局部重绘,治法不通用。
换更新的模型,邪门图就会消失吗?
只会换一批形态,不会根除。新模型手崩少了,背景残影和人脸复用照样有,成因在数据和采样机制里,机制不变,现象只是搬家。