用ai绘画挑战ai绘画:一张图连转五手的传话游戏实录
这轮实验的答案是:图生图不能无限续杯。每转一手,图就朝模型默认审美漂一分,三手内是微调,五手后连亲妈都认不出。防漂的关键是每轮只改一件事。
用ai绘画挑战ai绘画,这主意是我自己跟自己较劲想出来的。起因是有天在群里看到有人炫耀「AI画转手绘再转厚涂再转赛博朋克」一条龙,底下全在夸丝滑。我盯着那串图看了半天,冒出一个疑问:转来转去,原图还剩多少?传话游戏里一句话传五个人能变成另一句话,图像呢?我决定拿一张图做个五手连转的实验,全程记录。
先交代底细。原图是我自己直出的一张插画:一个戴圆框眼镜的女生在窗边看书,暖黄台灯,窗外夜雨。工具用同一款的图生图功能,每轮给一句明确的改写指令,比如「转成水彩风」,其余参数不动。每轮出四张挑最贴近指令的一张进下一轮,这个过程本身就很有信息量——挑图的犹豫,就是漂移的痕迹。
五轮连转,每轮丢了什么
五轮实测:第一手换风格只丢配饰,第二手构图开始漂,第三手细节明显流失,第四手人脸向默认审美靠拢,第五手只剩构图骨架。
| 轮次 | 指令 | 主要变化 |
|---|---|---|
| 第一手 | 转成水彩风 | 画风变软,眼镜框从圆的变方的 |
| 第二手 | 改成雪夜背景 | 夜雨换雪没错,但书换成了手机 |
| 第三手 | 加一件红色围巾 | 围巾有了,台灯没了,光源乱了 |
| 第四手 | 视角拉远一点 | 脸明显「网红化」,眼镜干脆消失 |
| 第五手 | 整体更明亮一些 | 窗边看书的概念还在,人物已经换了个人 |
逐轮说感受。第一手最规矩,水彩质感出来得也漂亮,代价小得让我松懈了——圆框眼镜变方框,我当时记了一笔,没当回事。第二手开始露馅:我只是改背景,它顺手把书换成了手机,「在看书」这个核心设定没了。这就是图生图的第一课:你以为你在改A,模型在重画ABC。
第三手和第四手是漂移加速区。加围巾那轮,台灯被抹掉了,画面里的光从此没了来源,人脸却越来越亮——光开始「凭空来」。第四手的拉远视角最伤,脸直接向模型偏爱的那类长相滑过去,我拿第一手和第四手的脸对比,像两个人。到第五手,我把五张图并排发给朋友看,她指认原图,指了第三张。全军覆没。
漂移有方向:永远滑向模型的默认审美
五轮实验最扎心的发现:漂移不是随机的,所有变化都在朝模型的默认审美收敛——脸变网红、色彩变和谐、构图变标准,个性是最先被牺牲的东西。
把五张图的时间线拉出来看,方向惊人一致。原图里那点「不对劲」的东西——歪一点的构图、偏黄的灯光、有点孤僻的表情——每转一轮就被磨平一层。模型好像有一个看不见的「平均好看」引力场,你传的图离它越远,它拽得越用力。
这解释了我在群里看到的那串「丝滑一条龙」:转到最后为什么张张都好看又张张都眼熟?因为个性在转手过程中被逐轮清洗了,剩下的当然是最大公约数。AI挑战AI的结果不是谁赢谁输,是原地收编。
从实验里摸出的三条防漂写法
防漂移三板斧:每轮只改一件事、核心特征词每轮复读、改动幅度宁小勿大。三条都守,五轮之后还能保住六七成像。
第一条,「每轮只改一件事」不是美德,是刚需。我第二手把「改背景」和「保留看书」拆开写,明确复述「她仍在读书,手里是书」,书就保住了。核心特征词每轮复读一遍,等于给模型上一道封印——你不说「保住」,它就默认可以动。
第二条,改动幅度宁小勿大。「整体更明亮」这种模糊指令是漂移加速器,改成「把环境光提高百分之二十左右,冷色改暖色」这种可核对的描述,模型发挥空间小,图就稳。第三条,三手是警戒线。我的实测里前两手损失可控,第三手起细节流失明显加速,正经创作别把图生图当接力赛,当短跑冲刺用完就收。
实验做完,那张原图我重新直出了一次,跟第五手的成品挂在一起。一个有故事的窗边,一个漂亮的窗边。要说这轮用ai绘画挑战ai绘画测出了什么,大概就是这句:模型不会替你记住你想记住的东西,你不反复钉死它,它就顺手擦掉。传话游戏五个人传丢一句话,五手图传丢一张脸,谁也不冤枉。
常见问题
图生图和重新直出选哪个?
改动在一处、想保留原图气质,用图生图;改动超过两项、或者已经转到第三手,直接回文字重新直出,比续杯省时间。
为什么AI会把书换成手机?
图生图不是局部修改,是整图重绘,模型对「必须不变」的部分没有天然义务。凡是不想被动的元素,都要在指令里明写出来。
重复特征词会不会让画面变僵?
复读的是特征词不是风格词,影响很小。实测里每轮复述三四个核心特征的组,稳定性和生动性都在,真正让图变僵的是模糊的大改动指令。
这个实验结论适用于所有工具吗?
趋势是共通的,收敛方向都指向模型默认审美,但漂移速度各家不同。我测的是一款工具的表现,换工具前建议先拿简单图试两手再上正稿。