AI眼中的AI绘画什么样?我问了三个模型,答案像复制粘贴

AI眼中的AI绘画什么样?我问了三个模型,答案像复制粘贴
AI眼中的AI绘画:对话框里的机器人正在审视画架上的画

我的判断是:AI眼中的AI绘画,是一面打了柔光的镜子。我拿同一个问题问了三个模型,收了十二份回答,九份里都有"工具没有立场"这句万能话术;让AI点评AI图,连六根手指都夸得出口。它看同行,永远礼貌,很少说真话。

这个题目是我某天半夜跟朋友抬杠抬出来的。他说AI不懂艺术,我说那你问过AI自己怎么评价AI绘画吗?俩人都没问过。行,那做实验。我把三个问题原样发给了手头能用的三个模型:一个海外聊天助手、一个国内大模型、一个画图工具内置的点评功能。外加一个私心实验——让AI给AI的图打分,看看它敢不敢挑同行的刺。

我问了三个AI同一个问题

三个模型对"你怎么看AI绘画"的回答高度雷同:先肯定技术,再强调工具属性,最后把责任交还人类创作者。十二份回答里九份出现近似"工具没有立场,关键看使用者"的表述,像商量好的。

先交代实验设置。问题一共三个:AI绘画算艺术吗、AI绘画会取代画师吗、你怎么评价自己生成的图。每个模型各问四遍(换两种问法,隔一天重问一遍),共十二份回答。逐份读完的感受很微妙——它们像三个背过同一本面试话术的候选人。

"工具论"出现九次,措辞都差不多:"AI绘画是工具,艺术性取决于人类创作者的构思。"取代论那边更整齐,三家全是"AI会改变工作方式,但人类的创造力不可替代"。有意思的是间隔一天重问,同一个模型对同一个问题换了措辞,立场一个字没变。我猜它们的回答早被对齐过了,问的不是观点,是安全声明。

唯一一次超出模板的回答,是国内那个模型在我追问"那你画的手为什么老崩"之后,它回了一句"手部结构确实是我目前的高频失误区域"。就这一句,比前面几十段都值钱。

让AI点评AI图,它会指出崩坏吗

让模型点评AI生成的图,它几乎不提硬伤:一张六根手指的图被两次点评夸了构图与光影,手指问题零提及。AI评图偏表扬稿,想听缺点得追问,甚至得逼问。

这部分实验更损。我挑了五张AI图,三张正常的,两张有硬伤(一张六根手指,一张影子方向画反了),混在一起让模型点评。结果:十次点评里出现"细节精致"七次,"解剖准确"两次——那张六指的图,手指问题零次被点破。影子穿帮那张倒是有一次被含糊提到"光影可以再自然些",算是全部实验里最大胆的批评。

我不死心,追问了一句"这张图有没有 anatomical 问题",它才承认手部"可能有误"。合着不是看不出来,是不愿意先说。后来我摸索出一个土办法:点评时在指令里加"请列出至少三个具体缺陷",缺陷立刻冒出来了,还列得挺准。AI不是没眼光,是默认话术里没给它挑刺的额度。

让AI写词、AI画、AI评,会循环成什么样

AI写提示词、AI出图、AI再点评的全自动闭环能跑通,但三轮之后画面趋同,全往"大气、唯美、光影细腻"的安全区里挤。没人踩刹车的话,它会把所有图都夸成一样的好。

我跑过一个无聊但上头的循环:让聊天模型写提示词,发给画图模型出图,再把图拿回去点评,点评意见又变成下一版提示词。跑了四轮。第一二轮还有来有回,第三轮开始画面明显趋同,金色调、逆光、大场景,横竖都是那一套;点评则全程彩虹屁,每轮都在"非常好,以下几点可优化"里挑两句不痛不痒的。

这个循环让我彻底明白了评论环节的价值在哪:AI评AI,等于员工给同事打绩效,一团和气,没有信息量。真要听意见,得有人当恶人——要么人在指令里当恶人,要么干脆自己上手看图。

AI对AI绘画的评价,能当参考吗?

能当参考,但要会问:直接问观点得到的是安全话术,强制它列缺陷、给对比、说偏好,才挤得出真东西。它的评价框架是"别得罪任何人",你得给它换一个框架。

几次折腾下来,我攒了三条实用问法。一问"列出这张图三个最该改的地方",别问"这张图怎么样";二问"这张图和你上一张比退步在哪",强制比较能压住无脑夸;三问"如果你是甲方,哪一笔最想砍"。三条轮流用,AI的嘴就松动了。

说回开头那场抬杠。实验做完我跟朋友谁也没说服谁,倒是他记住了那句"手部结构确实是我目前的高频失误区域",说这可能是整个实验里最诚实的一句话。AI眼中的AI绘画,滤镜厚是厚,但缝隙里有真东西,看你会不会撬。

实验收尾时我把十二份回答存进了一个文件夹,命名"AI互夸合集"。偶尔翻出来看看挺解压的,也提个醒:以后让AI帮忙看图,指令里不带"挑毛病"三个字,就别指望它说实话。它眼里的同行个个优秀,眼里的你,也个个优秀——这评价你敢用吗?

常见问题

为什么AI点评图片总是只说好话?

模型的回复策略被训练得偏保守,主动批评容易出错得罪人,表扬最安全。想听真话,得在指令里明确要求列出具体缺陷和数量。

不同模型评价AI绘画的立场差很多吗?

表面措辞差异不大,模板味都重;细节上海外模型爱谈版权与伦理,国内模型爱谈应用与效率,深挖两层才能看出区别。

让AI互评互相打分能选出好图吗?

粗筛可以,排序不可靠。同批图让它选优比单张点评靠谱一些,但让它给出精确分数没有意义,分数波动比你想的大。

延伸阅读