AI修图模型选大的还是小的?本地玩家的速度画质取舍

AI修图模型选大的还是小的?本地玩家的速度画质取舍
AI修图模型大小对比:一台显卡上大小两个模型跑同一张人像修图的速度与画质示意

先看你显卡:12GB显存以下老实用小模型,16GB以上才有资格摸大模型的门槛。同一批32张图我在大小两个模型各跑了一遍,大模型单张104秒、小模型9秒,画质差距没大到值十倍等待的地步。装哪个,先对下面的表。

AI修图模型选大的还是小的,先给结论:显存12GB以下闭眼选小模型,16GB能摸到大模型的门槛但得憋着用,24GB以上再谈画质自由。我机器是4070 Ti Super 16GB,属于两头都够得着的那种,所以8月底那个周末(30、31号两天),我把同一批32张图——15张人像磨皮、9张老照片上色、8张去路人换天空——在本地装的大小两个模型各跑了一遍,账全记下来了。

同一批图,两边跑出来的账

大模型赢在听懂复杂指令、整体质感更稳,小模型赢在速度和显存占用,八成日常修图小模型就够用了。32张图跑完,单张耗时差了十一倍,显存峰值差了四倍。

先交代环境。ComfyUI,今年6月更新后开始稳定支持fp8权重分层卸载,我用它挂两个模型:大的上Qwen-Image-Edit 20B的fp8量化版,小的是一个2B级的指令修图模型。同一批图,同样的提示词,跑出来的账是这样的——大模型单张平均104秒,显存峰值15.6GB;小模型单张9秒,显存峰值3.8GB。十来倍的耗时差,换来了什么?

说实话,大头差在指令理解上。我给大模型下过一句「把左边电线杆去掉,顺便把阴天改成傍晚的暖光」,它一次到位,光的方向都帮你捋顺了。小模型嘛,电线杆去掉了,「顺便」那句直接装没听见,得拆成两步再跑一遍。大模型像请了个老师傅,你说想吃「像外婆做的那种红烧肉」,他真能给你炖出记忆里的味道;小模型像预制菜,热一下就能吃,不会惊艳,也基本不翻车。

老照片上色那批最有意思。我给两边下的是「按1970年代国产胶片的色调上色,别太艳」,大模型真给了那种偏黄偏灰的怀旧感,连照片边缘的岁月发黄都留着;小模型上出来的颜色鲜亮得像新拍的,奶奶的红头巾艳成玫红。我妈路过瞥了一眼就说,左边那张像太姥姥年轻时照的,右边那张像影楼赶工P的。这句评价比我记的跑分数据都准。

但翻回来看细节,情况就微妙了。人像磨皮这块,我把两边输出放大到200%对比,大模型保住了睫毛和皮肤纹理,小模型的皮肤放大看有点「水」,像蒙了层薄纱。可问题是你日常发朋友圈、发小红书,谁会放大到200%看?我试了下把小模型的输出丢给大模型二次精修,效果确实好,可104秒一跳的进度条等得人心慌。去掉路人、换天空这种活,两边的差距肉眼几乎分辨不出,那还等什么大模型。

爆显存那晚:蓝屏重启的代价

显存顶满不只是弹个报错那么简单,驱动超时会直接蓝屏重启,排队的图、调好的参数、半小时的等待全没了。这事我在9月2号晚上亲身经历了一次。

那天我贪快,把批量张数从1改成4,想着一夜跑完剩下的80张老照片。20B的模型fp8量化后权重就要19GB上下,靠分层卸载硬塞进16GB显存,本来就是走钢丝。我又开着十几个Chrome标签页查资料,跑第三批的时候屏幕黑了三秒,蓝屏,错误码VIDEO_TDR_FAILURE,nvlddmkm.sys,机器自己重启了。重启回来,ComfyUI队列清空,调好的那套参数得凭记忆重敲。

我本来以为上了fp8量化就万事大吉,结果栽在批量上。后来老实了:批量锁1,浏览器全关,Text Encoder挪到CPU跑,单张耗时从104秒涨到150秒左右,但再没蓝过屏。爆显存的报错「CUDA out of memory. Tried to allocate 2.5 GiB」我见得多了,弹了顶多重跑;蓝屏是真肉疼,显卡本身有保护一般烧不了,可系统盘和没保存的东西遭殃。话说回来,那天晚上要是排队前多看一眼显存占用曲线,这半小时就不用白扔。

大小模型到底怎么选?

常规修图小模型起步,碰到复杂指令和整体重绘再切大模型,显存紧张就量化加分层卸载,别硬跑。我现在的用法是九成图小模型秒出,一成精修才切大模型。

对比项大模型(20B fp8)小模型(2B级)这笔账值不值
单张耗时约104秒(卸载后150秒)约9秒日常出图小模型完胜
显存峰值15.6GB3.8GB大模型16GB卡走得惊心动魄
复杂指令理解一步到位,能捋顺逻辑要拆步骤,常漏「顺便」大模型的钱花在这
皮肤纹理细节放大200%不糊发「水」,蒙层薄纱感商业出图才在意,发图党无所谓
稳定性批量开2张以上就危险随便开,没出过事大模型这票我不投
出图一次成功率32张里重跑5张32张里重跑11张小模型重跑快,扯平了

所以我的建议按场景来:日常去路人、磨皮、调色,小模型一步到位;要改整体氛围、理解一句长指令、做商单交付,切大模型。显存不够还非要跑大模型的,量化到fp8基本无感,别下4bit。至于「要不要为此换卡」——我劝你先冷静,换卡之前先看看这篇5080 AI修图显卡实测,新卡在这活上的提升幅度未必有你想象的大。

还有个省钱的路子:白天用小模型批量过筛,挑出值得精修的再切大模型。9月5号我处理一批婚拍底片就用这招,96张里大模型只跑了11张,整体等待时间缩到全程大模型的两成,客户那边照样挑不出毛病。

回到开头那句:先看你显卡。卡决定了你的下限,用法则决定你的体验——我这套大小模型共存的方案折腾了小一个月,值的地方在于两边的活各干各的,九成的图九秒出,剩下的一成才值得你泡杯茶等两分钟。显存不够就别硬上大模型,蓝屏那晚的教训够我记一阵子了。

常见问题

8GB显存真的一点大模型的边都沾不上吗?

能沾,但体验很差。8GB卡跑20B级模型得上3到4bit量化再叠加CPU卸载,单张要等6到8分钟,指令稍微复杂就OOM退出。这个配置更适合跑1到2B的小模型,或者急图走按次付费的在线服务,一张几毛钱比升级硬件划算。

量化到fp8或者4bit,画质到底掉多少?

fp8我对比过原版权重和量化版的输出,肉眼基本分不出来。4bit开始能看出皮肤纹理发糊、画面里的小字边缘发毛,人像特写尤其明显。省的是一半显存,亏的是细节,做商业交付建议守住8bit这条线。

爆显存蓝屏会把显卡烧坏或者弄坏系统吗?

显卡自带过流过热保护,蓝屏本质是驱动响应超时被系统强制重启,硬件层面一般没事。真正的损失是任务队列清空和频繁强制断电对系统盘的损耗。把批量张数锁在1、关掉吃显存的浏览器标签,比事后重启省心得多。

没有独立显卡,纯CPU能跑AI修图模型吗?

小模型勉强能忍:2B级模型纯CPU跑单张大约1到3分钟,偶尔救个急可以接受。大模型想都别想,20B级别在CPU上单张按小时计,等图的时间够你在线服务跑几十张了。核显用户同理,老老实实小模型或者云端。

延伸阅读

  • AI修图原理拆解:想搞懂模型底层到底在算什么,先看这篇再决定装哪个。