AI绘画和AI视觉不是一回事:一个管画、一个管看

AI绘画和AI视觉不是一回事:一个管画、一个管看
AI绘画和AI视觉对比插画:一只机器手拿画笔一只机器眼在识别

有话直说:AI绘画和AI视觉是两条技术路线,方向正好相反——绘画让机器「画出来」,视觉让机器「看懂」。相册自动分类、扫码、车牌识别全是视觉的活。两张图别再互相指认了。

后台每隔一阵就有留言把AI绘画和AI视觉搅在一起问,最典型的一条:我家相册自己会把照片分类,这算AI绘画吗?

不算。那是AI视觉。这一篇就把这对最容易混的词掰开:它们用的是两套模型,干的是两个方向的事,你日常至少每天要跟其中之一打十次照面。

AI视觉让机器「看懂」,AI绘画让机器「画出来」

AI视觉是输入图、输出理解:这张图里有什么、在哪、是什么;AI绘画是输入文字、输出图:凭一句话造一张新图。一个读图,一个写图,管线方向相反。

展开一点说,视觉这边的任务清单很长:分类(这是猫还是狗)、检测(人脸在画面哪个框里)、分割(把主体从背景里抠出来)、识别(这张脸是谁)。你手机扫码支付、停车场抬杆、拍照翻译菜单——背后全是视觉模型在干活。

绘画那边大家熟了:输入提示词,扩散模型从噪点一步步「去噪」出一张图。它不需要看懂任何东西,它学的是图和文字的对应关系。

两个词容易混,大概因为都姓AI、都跟图打交道。粗记法:你给它字它给图,绘画;你给它图它给答案,视觉。

你的相册早就被AI视觉管着了

手机相册的人物聚类、场景搜索、回忆剪辑,全是端侧视觉模型的功劳,而且大部分计算就在你手机上完成。我第一次意识到这件事,是因为我妈。

我妈的手机相册某天弹出「为你整理了家人照片」,把她三年里拍的我、我爸、外婆各自归了类,连外婆八十岁生日那批和日常视频里的她都归到了一起。她拿着手机问我这是谁在帮她翻照片。没人翻,是视觉模型把她三万多张照片过了个遍。

这类功能的工程量说出来吓人:人脸检测、特征提取、相似度聚类,三步全在本地跑。这也是视觉和绘画的一个实际差别——视觉模型轻量到能塞进手机实时运行,绘画模型到现在多数还住在云端的显卡里。

还有个更隐蔽的日常应用:输入法里的表情搜索。你打「猫」能搜出猫表情包,那是视觉模型提前给几十万张图打好了标签。视觉是默默干活的那个,干完不留名。

AI视觉怎么看AI画的图?我做了个小实验

把十张AI绘画的图喂给识图接口:写实风格的八张识别全对,置信度0.9以上;两张风格化强的掉到0.5上下,水墨风的马被认成「马」只有0.52,还附带0.31的「雕塑」。风格化越重,视觉模型越犹豫。

实验不严谨,单张接口、样本十张,图一乐的水平。但结果有指向:AI视觉是拿真实照片喂出来的,它眼里的「标准猫」是照片里的猫。绘画图如果长得像照片,它照样认;一旦风格拉满——水墨、粗颗粒版画、夸张变形——置信度明显下滑。

这个发现反过来看更有用:置信度下滑说明风格化到位了。我做插画时偶尔拿成品图过一遍识图,如果连它都被认成「写实照片」,说明风格词没起作用,得回去改。视觉模型意外成了风格的裁判,虽然它本意没想干这个。

顺带记一个翻车:实验里有一张Q版狮子,识图接口给了「狗」0.44、「玩具」0.29,「狮子」压根没进前五。大头贴式的夸张变形对视觉模型来说太难了,比例一夸张,它认脸的准头先崩。做IP形象的朋友要是用识图做辅助检查,记得把这条算进去。

再往深一层,AI绘画的图和AI视觉的识别,还牵出检测与反检测的问题:生成的图太像照片,专门识别生成图的检测工具就跟着冒出来了,误伤和漏检都有,这事够单独写一篇,这里不展开。

写完这篇,我把两条线的关系画了张小图贴在工位上:左边文字,右边图,向上箭头标「绘画」,向下箭头标「视觉」。我妈那条相册留言我回了句「是手机自己看的」,她回了一串大拇指。技术名词分不清不要紧,知道你手里那台机器既能看也能画,用的还是两套本事,就够了。

常见问题

以图搜图算AI视觉吗?

算。以图搜图是把你的图转成特征向量再去库里找相似,正是视觉的典型任务。搜出来准不准,取决于特征提取模型的好坏。

两者会合并成一个模型吗?

正在靠近,有些多模态模型既能看也能画,但「看」和「画」内部仍是不同模块分工。对使用者来说,短期内还是当两样工具用更实际。

视觉模型能帮我筛AI生成的图吗?

能干点粗活,比如批量挑出「像照片」的图。但精细的风格判断、审美取舍它做不了,最后拍板的还得是人。

手机相册人脸分类安全吗?

主流手机的聚类计算在本地完成,不上传云端,可以查你机型的隐私说明确认。第三方相册App就未必了,装之前看清权限。

延伸阅读