绘画智能AI到底智能在哪:语义理解、举一反三和记性实测
先把丑话说前面:绘画工具的智能是真的,但只真了一半。语义理解和举一反三我实测下来算及格,记性这块基本别指望,三组验证的具体结果都在下面。
同事老陈上周看我修图,冷不丁来了一句:这玩意儿不就是个关键词搜索吗,输入什么吐什么,哪算什么智能。我张口想反驳,忽然发现手里没有证据。行,那就做实验。绘画智能AI宣传了这么多年,智能到底落在哪,得用具体测试说话,不能靠感觉吹。我设计了三组测试,专门挑刁钻的来,结果有让我意外的,也有让我闭嘴的。
语义理解:长句拆得动,否定句拆不动
模型读长描述句子没问题,主谓宾和修饰关系基本能对上号,但否定指令大概率失效,说不许什么,它偏偏画什么。
第一组测长句。我写了一段特别口语的话:「一个下夜班的护士,脱了口罩在便利店门口喝热豆浆,冬天凌晨,哈出的白气」。十张里七张抓住了全部要素:口罩挂在下巴、豆浆杯、白气,连便利店玻璃上的贴纸都有。这个理解水平,说实话超过了我对关键词拼接工具的预期。它不是在匹配词,是真的在还原场景。
翻车翻在否定句上。我加了一句「画面里不许出现任何文字」,结果九张图里六张带着字,招牌、瓶身、路牌,哪儿都是。你越提文字,它越画文字,跟小孩听「别想大象」一个反应。后来我学会了绕着说:写「纯图像构图,无标识物」好一点,或者干脆靠局部重画后期抹。这条经验让我改了整个写词习惯——想不要什么,尽量别说出来。
举一反三:常见的组合它敢接,太偏的它就露馅
把风格用到新对象上是它的强项,水墨加霓虹这种跨界组合一次就成;但两三个冷门要求叠一起,它就开始丢三落四。
第二组我故意出了道组合题:「水墨风格的赛博朋克城市」。这种搭配训练集里没多少现成答案,我以为会崩,结果第一张就相当能看:墨色晕染的摩天楼,霓虹灯像朱砂点上去的。这就是我说的举一反三——它把水墨的笔触逻辑和霓虹的色彩逻辑各自拆开,重新捏到了一起。后来我又试了「刺绣质感的星空」,也成立。
但要求一多它就露馅。「水墨赛博朋克,俯视,下雨,一个人撑伞」四个条件叠上,出图开始顾此失彼,雨下了,伞没了;伞有了,视角平了。我的土办法是拆步骤:先出构图,再局部改风格,一次只加一个变量。老陈看完这组测试改口了,说这更像个记性差但悟性高的学徒——悟性真有,靠它一个人记不全事儿。
这组还顺手测了个边界:让它直接模仿某位在世画师的风格,它会打太极,要么装听不懂,要么给你个四不像。但你把那位画师的技法拆成特征词——比如说留白比例、勾线粗细——它立刻又行了。所谓举一反三,反的是特征,不是名字。这个发现对我写提示词的思路冲击挺大,想要谁的味儿,就拆谁的活儿。
记性这块,别高估它,会话一关全忘
同一会话内它记得你的偏好,能延续风格和设定;新开会话就是失忆重开,跨会话的连续性要靠垫图和固定参数自己维护。
第三组测记性。同一会话里,我第一张定了「暖棕色调,胶片颗粒」,后面只说「换个海边场景」,色调和颗粒感稳稳延续,五张里四张不用回头调。这一点用起来确实省心,像跟老搭档合作,说过一遍的口味不用重复。
隔天新开会话,同样的开场白,出来的东西味儿全变了。它没有任何跨会话记忆,所谓「它记得我喜欢什么」是错觉,是你自己每回都在重复同样的设定。我的对策是攒一份自己的固定配置:风格词、参数、垫图存成模板,开工先挂上。所以别信那些「AI越用越懂你」的说法,越用越懂你的,是你自己整理的那份模板。
顺带记录一个会话内的坑:延续偏好是延续,不等于完全复现。我试过同一会话里隔了十几张再要求「跟第五张一样」,结果色调对上了,构图早跑偏了。所以关键的图别偷懒,当场多抽两张备着,别指望回头还能找回来。
说到底,这三组测下来,我的评价是:它智能在理解,不智能在记忆。你把话说清楚、把记性外包给模板,它的悟性才用得上。
那天跟老陈把三组测试过完,他的结论是「算个聪明的学徒」,我觉得比「搜索引擎」中肯多了。工具的智能有边界,边界的形状搞清楚了,用起来反而踏实。你如果也被人问住过这工具智能在哪,把否定句那条先拿去试,翻车最快,印象最深。
常见问题
提示词是不是写得越长越好?
不是。长到一定程度,后面的要求就开始被稀释,我这组测试里四条件叠加就开始丢要素。两三句以内说清主体、环境、风格,比一大段流水账管用。
中文提示词一定要翻成英文再输入吗?
看模型。不少模型对中文长句的理解已经够用,我护士那段就是纯中文。但生僻的风格词翻译过去仍更稳,拿不准就中英各跑一小批对比。
想让它延续上次满意的那张图,最稳的做法是什么?
用那张图当垫图,配上锁定的种子,再把当时的参数抄回来。三样齐了,新会话也能复现大半味道,光靠文字描述不行。