AI绘画和AI识图搭配用:让看图的AI给画图的AI当审稿

AI绘画和AI识图搭配用:让看图的AI给画图的AI当审稿
AI绘画和AI识图配合:一只眼睛与一支画笔相互校对插画

直接给结果:识图AI当审稿员,二十张AI图能拦下七张废图,手指、透视、光影三类穿帮它看得比人快。反馈再翻译成修改词回喂给绘画工具,一轮下来返工时间能省一大半。

AI绘画和AI识图听起来是两码事,一个管画,一个管看,八竿子打不着。真把两者串起来用,才发现看图的那个是天然的质检员——它没有"看着还行"这种惰性,你让它挑毛病,它就一条一条给你列出来。

起因是我赶一批游戏立绘风格的设定图,四十多张的量,人眼一张张抠细节要抠到半夜。朋友提醒我:你不是天天用带视觉能力的对话AI吗,让它先看一遍。我挑了二十张废图风险最高的先试,结果这一试就成了固定工序。

先把丑话说在前头:这套工序多花的是提问和复制粘贴的时间,省的是反复重跑的额度和深夜抠图的命。一张图的审稿来回大概一分钟,四十张摊下来多花四十分钟,换回来的是交稿提前一天。这笔账怎么算都是赚的。

识图AI当审稿员,二十张拦下七张

把成图丢给识图AI,让它找结构错误、检查光影一致性、核对细节数量,二十张里它点出十一张有毛病,其中七张确实该废。审稿的标准模板固定三句话,输出稳定。

我的提问模板就三句:第一句,客观描述这张画面了什么;第二句,找结构上的错误,重点看手、五官、肢体衔接;第三句,检查光源方向和影子朝向对不对得上。三句固定下来,它每次给的反馈格式都一样,我核对起来快。

战果举例:一张骑士图,它指出"右手握剑的手指数量异常",放大一看,六根。一张街景,它说"两个路灯的影子指向相反方向",我还真没注意。二十张里它漏报了两张、误报了一张(把正确的褶皱说成结构问题),准确率折算下来够用。七个确认真废的图,要是靠我自己慢慢放大找,一晚上就交代在这了。

识图的反馈怎么翻译成修改词

识图说清"哪里错",生图才能"怎么改":结构错改动作描述,透视错改机位和景深词,光影错改光源方向词,逐条对应。反馈不翻译就喂回去,AI基本听不懂。

翻译有讲究。"手指数量异常"直接改成"把手画对"没用,我把提示词改成"双手拢在袖中",绕开画手指这个难点——这是最实用的翻译思路:改不动就避开。"影子方向矛盾"翻译成"主光源来自画面左侧,单一光源",加了"单一"两个字,出图的影子立刻老实了。

还有一类翻译是加权重。识图说"剑刃形状前后不一致",我在提示词里把剑的描述单独拎出来写细:直刃、无弯折、护手样式。描述越具体,重跑时它崩的概率越低。审稿反馈里每一条,几乎都能找到对应的提示词写法,这层对应关系熟了,翻译速度就上来了。

透视错的翻译最难。识图AI会说"透视线不汇聚",但生图模型对"透视线"这种术语反应一般。我改写成"低机位、广角、远处建筑向一点收缩",第三次才对上。术语要翻成画面描述,这条经验值一次返工。

审稿也有漏检,最后一道关是人眼

识图AI查得出结构硬伤,查不出风格跑偏和情绪不对味,审美层面的判断仍然得人来拍板。把它当放大镜用,别当裁判用,分工才合理。

漏检的两张图问题都不在结构:一张风格忽近忽远,前半张偏写实后半张偏插画;另一张表情不对,角色该哭不哭。识图AI描述起来头头是道,让它评价"对不对味",它就开始打官腔,绕来绕去不给你准话。这类毛病它天生看不出来,别为难它。

还有一次啼笑皆非的误报:它把一件铠甲上正常的刻花判断成"纹理崩坏",我差点照着改。打那以后我给自己立了规矩——识图的反馈只当线索,废不废图,人眼说了算。工具提效,决策留人,这套搭配才跑得长远。

这套"画完让另一个AI看一遍"的工序,现在成了我的标配。它最动人的地方不是准,是稳——人眼审稿会累会烦,凌晨一点的我什么都看得"还行",它不会。四十多张立绘最后提前一天交稿,审稿员没喝我一口水,也没喊过一句累,比谁都靠谱。

常见问题

识图AI看图要花钱吗?

主流对话AI的图片识别基本免费或含在订阅里,成本远低于返工的时间。批量审稿注意单日对话上限就行。

什么样的图最有必要过一遍识图?

有人物手脚的、有复杂透视的、有镜面反射的,这三类翻车率最高。纯风景和扁平插画风险低,可以抽查。

识图和生图必须是同一家吗?

不必,跨家搭配反而好,两家模型的盲区不重叠。生图和识图用同一家,有时候会犯一样的错,互相护短。

反馈特别多的时候怎么处理?

先改结构和光影这类硬伤,风格类意见放后面。一次只改一两项重跑,全改完再跑,出问题都不知道该怪哪条。

延伸阅读