AI修图技术是什么原理?一篇文章讲清楚背后的门道
原理不玄:修图AI一共三条技术路线——传统算法照固定公式改数字,判别式模型负责认出画面里是什么,生成式模型负责按概率补画不存在的像素。三条路线各管一摊,效果好坏全看用在哪类画面上。读完你就能自己判断一个修图功能靠不靠谱,不用再被宣传页上的形容词唬住。
修图AI的三条技术路线,一条比一条「自作主张」
AI修图技术的原理分三条路线:传统算法照公式改像素,判别式模型认出内容,生成式模型按概率补画新像素。三条路线能力完全不同,混在一起聊,才会冒出「AI修图是不是把图传到电脑上修」这种问题。这是读者今年上半年问得我耳朵起茧的一句——我计算机专业出身,写摄影器材科普第三年了,每次都得从头掰扯:传不传云端只跟第三条路线的一部分有关,跟原理本身是两码事。
最老的一层是传统算法,十多年前就成熟了。你拖动曲线工具,把暗部压下去、亮部提上来,软件做的就是给每个像素套一个固定的数学映射:输入多少亮度、输出多少亮度,白纸黑字写得明白。锐化也一样,卷积核在画面上逐格扫描,邻座像素差得越大就加得越猛,锐化数值从50拉到150,变化轨迹完全可预测。这类操作像按菜谱炒菜,同样的料谁来都是一个味,确定性的,不存在灵感。话说回来,这套老算法今天依然是Lightroom里用得最多的那批滑块,一点没过时。
第二层是判别式深度学习,大概2015年之后陆续进手机。它不管改图,只管认图——训练时看过几百万张标注过的照片,学会了分类和分割:这一块是人脸,那一片是天空,这圈头发丝属于前景。你手机里人像模式能精准把人抠出来做背景虚化,靠的就是分割模型画出的掩膜。它像小区门口认脸的门卫,只报身份,不动手改东西。
第三层才是一般人嘴里的「AI修图」:生成式模型。消除笔、AI扩图、一键换天空,背后多半是扩散模型。它的工作方式反直觉——不是从原图里「找」像素来填,而是先把你圈的区域打满噪声,再一步步「去噪」,每一步都按概率猜这块地方最像什么。像让一位修画师补被撕掉的一角:他不是从废纸篓里找回碎片,是凭经验画了一块自己认定合理的。
为什么消除笔有时补得完美,有时补得离谱?
因为生成式模型每次都在按概率猜,同一个缺口能猜出不同答案,背景越有规律猜得越准。这跟修图师手艺无关,是扩散模型的数学本性决定的。背景是重复纹理——砖墙、草坪、纯色路面——概率分布集中,猜出来八九不离十;缺口正好切过复杂结构,比如半根柱子或者半张脸,模型要同时猜出两侧怎么延续,稍有偏差就长出歪的东西。
我今年3月在桌面版PS里试过一次典型翻车:把一张街拍里的共享单车消除掉,圈选的时候多带了一条路灯杆,同样的选框生成三次,第一次地上多出一条影子朝向都不对的黑印,第二次灯杆从半截长出来还扭了个角度,第三次才算正常。同一个框,三次结果不同——传统算法绝不可能给你这种「抽卡」体验,这恰恰说明它背后跑的是生成式模型。
所以看到消除笔翻车,先别骂自己手残。模型补的是「它认为合理」的像素,不是「你拍了但被挡住」的像素,这两件事差别很大。细密边缘是重灾区,栅栏、网兜、发丝这种高频率结构,掩膜经常把缝隙里的背景也判成前景,叠了又叠还是糊。用嘴修图到底能走到哪一步,我单独做了三十天实验,两成左右的复杂场景效果不稳定,细节都记在另一篇文章里:AI帮我修图的结果怎么样?三十天用嘴修图的实验记录。
手机上跑的和云端跑的,根本不是同一个AI
手机NPU跑几亿参数的小模型,离线快但上限低;云端服务器跑几十亿参数的大模型,效果强但要传图。同一个「AI消除」按钮,底下可能是两套完全不同的系统。这也顺带回答了开头那个问题——只有走云端的那部分,才涉及「把图传出去」。
2024年之后发布的旗舰手机基本都带独立NPU,算力在几十TOPS这个量级,骁龙8 Gen 3那颗NPU官方标称大约45 TOPS。这点算力塞不下真正的大模型,厂商做的是蒸馏、量化后的小版本,INT8甚至INT4精度跑,常识判断和精细生成都打折。好处也实在:断网能用,照片不出手机,单次处理延迟一两百毫秒,拖滑块基本跟手。
云端是另一回事。服务器上的扩散模型参数量大几十倍,能理解更复杂的场景,代价是上传原图、排队等几秒到十几秒、按次计费或者订阅。8月底我拿同一张废片在手机端和网页端各跑了一次消除:手机端三次都把电动车补成了类似滑板车的怪东西,网页端一次就补对了。说实话,这个差距肉眼可见,钱花在算力上确实有效。
下次用修图功能,可以先看一眼它要不要联网。要联网的,效果上限高,但照片离开了你的设备;离线跑的,图不出手机,能力被算力锁死。这是效果和隐私之间的明码标价,各家没有例外。生成的像素既然是「猜」出来的,被拿去做假票据、改证件也就有了可乘之机,防线的部分这篇不展开,我写得更细:AI修图数字内容有多危险?发票、合同、成绩单的防线。
回到开头那个被问烦的问题。AI修图技术不是一句话能概括的东西:曲线和卷积在改数字,判别式模型在认东西,扩散模型在猜像素,手机和云端又各自跑着大小不同的版本。判断一个功能靠不靠谱,看它走哪条路线、用在哪类画面上,比看宣传页上的形容词有用得多。细密边缘的糊、生成结果的随机,这些短板眼下没解决,明年会不会解决,我不打包票。再有人问我「是不是传到电脑上修」,我大概还是会耐心掰扯一遍——毕竟这不是玄学,是可以讲清楚的工程。
常见问题
AI修图会直接改动我的原图文件吗?
主流App默认把结果存成新文件或新图层,原图另留一份。但个别工具的「保存」是覆盖式的,导出前记得看一眼文件名有没有带副本后缀。不放心就先备份再动手,RAW格式尤其要留意,覆盖一次就找不回来了。
扩散模型补出来的内容是我真实拍到的画面吗?
不是。它补的是模型认为合理的新像素,跟快门按下那一刻的真实场景没有对应关系。修风景、去杂物无所谓,但涉及证据性质的图——票据、合同、证件照——补出来的部分严格说属于合成内容,商用和存档场景要有这个意识。
为什么消除笔对头发丝和栅栏这类边缘特别容易翻车?
细密结构的空间频率高,分割模型画掩膜时容易把发丝之间的背景也判成前景,消除或换背景时就会沿着错误边界一起改。目前没有哪家完全解决,常见的补救办法是手动收缩选区一到两个像素再跑一次,或者干脆把这些区域留给人手修。
不联网的修图App里那个AI消除是真的AI吗?
多数是,但要分层看。新机型上通常真的在NPU跑量化后的小模型;老机型或低端机型会降级成内容感知填充一类的传统算法,能力窄得多。区分办法很简单:开飞行模式试一次,还能用的说明是端侧真跑,直接提示联网失败的就是伪离线。