国产修图大模型对比:同题五图横向记分

国产修图大模型对比:同题五图横向记分
国产修图大模型对比:豆包、即梦、可灵同题五图横向记分实测

先把结论亮出来:五款国产模型同题过招,没有全能冠军,只有各自主场。想清楚你平时修什么图,再决定用哪家。

国产修图大模型对比这件事,我拖了挺久,上个月终于正经做了一轮。挑了豆包、即梦、可灵,外加两个平时用得少的,备好五张原图,同一个任务原样丢给五家,跑完一轮再跑第二轮复核。结果挺有意思:名气大的那款在三道题上翻车,反倒是存在感不强的那个,在中文字海报这道题上稳得吓人。各家强弱分布太散了,这篇文章就是把记分过程摊开给你看。

五道题怎么定:贴着真实需求出题

题不在多,在准。五道题对应五类最常见的修图场景,每张图每家各跑三遍,取表现最稳的那次记分。

五道题分别是:写实人像、中文字海报、老照片修复、去杂物、风格化。选这五类不是拍脑袋,是我翻了自己近两个月的修图记录,发现日常需求基本就落在这几筐里。写实人像考的是皮肤质感和五官结构动没动;中文字海报考的是笔画能不能写对,这是国产模型宣传最多的点,得验一验成色;老照片修复考的是会不会擅自换脸,家里长辈的照片,脸改了就废了;去杂物考的是背景补得塌不塌;风格化考的是风格是贴上去的还是长出来的。

规则也定得死。每道题给每家三次机会,指令完全一致,不单独优待谁。跑完第一轮隔了两天又复核一轮,防止某家那天服务器状态好。记分不用数字,就用三个档:稳、能用、翻车。为什么不用十分制?因为我发现打分的时候手会松,同样是脸歪了,心情好给七分心情差给五分,三个档逼着我只能做判断。

同题五图记分:一题一题摊开说

五题记完,豆包赢在听懂人话,即梦赢在中文字和海报感,可灵赢在画面完整度,老照片修复和去杂物各家各有翻车现场。

写实人像这道,豆包稳,皮肤质感保住了,毛孔该在的在;即梦能用,就是默认把皮肤磨得偏光,得追加一句别磨皮才像样;可灵稳,五官结构几乎不动;剩下两家,一家把眼距改了,一家给模特补了个摄像头里的双眼皮,都算翻车。这道题给我的教训是:人像类的第一要求不是变美,是别动结构。

中文字海报,即梦是断层的第一。二十来个字的海报标题,三跑全对,字体还带点设计感;豆包能用,长句偶尔粘连一两个字,重跑一次能好;可灵在这道题翻得比较狠,笔画缺横少竖,有次把"展"写出了多余的点。我原本以为中文字是各家都解决了的问题,实测发现差距还在,而且不小。

老照片修复是最分化的一道。豆包能保脸,但修复到我奶奶年轻时的合影时,把手部结构修坏了,六根手指的图我拿到过两次;即梦把照片修得太"新",纹理全抹平了,像翻拍的翻拍;可灵画面保真度可以,水印留下的印子去得干净,可它有一次把背景里路人的脸重新画了一遍,这种擅作主张最要命。

去杂物这道题各家水平咬得紧,差距在细节。桌面上的水杯、地上的纸屑,五家都能去掉;但背景线条复杂的时候,比如栏杆、瓷砖缝,有两家补出来的纹理会糊成一片。这块我之前单独写过一篇去杂物的边界实测,深挖过什么杂物能去什么不能去,这里就不重复展开了。单说结论:杂物小、背景简单,谁都能过;杂物大、背景有规律线条,就得挑着用了。

风格化这道最有意思,翻车的姿势都不一样。有的模型风格像滤镜,一层皮浮在原图上;有的会把人画得六亲不认,风格是浓了,脸没了。能用的标准我定得严格:风格要吃进光影里,人还得是人。按这个标准,五家里只有两家拿到稳。风格化这块怎么挑方向,我写过一篇按图的用途选风格的文章,搭配着看更全。

按需求选型:你的主场在哪,谁的主场就是谁

随手修发朋友圈选豆包,做海报和中文物料选即梦,要整体画面感选可灵。名气只是参考,需求才是坐标。

把五题记分汇总一下,用文字表呈现:写实人像一栏,豆包、可灵两档为稳;中文字海报一栏,即梦独一档;老照片修复一栏,没有稳,最好的也只是能用,而且各有各的雷区;去杂物一栏,全体能用,个别场景翻车;风格化一栏,两家稳,剩下看运气。

对号入座就清晰了。你的图多数是自拍和日常照,优先豆包,口语指令听得准,说"把背景里那个人去掉"它真的懂;你做公众号封面、活动海报,即梦闭眼入,中文字这道题它和第二名的差距肉眼可见;你在意整张图的氛围和完整度,出图当素材用,可灵值得留一个位置。至于我那两个不点名的选手,不是它们不行,是这道题里没有一道是它们的主场。

入口和平台的选择也顺带说一句,这些模型散落在不同的 App 和网页里,有的要会员有的不要,我整理过一篇国内修图 AI 入口的大盘点,选完模型可以接着看从哪进最省事。

回到开篇那句话:没有全能冠军,只有各自主场。这轮同题五图跑下来,最大的收获反而是放下了"哪个最强"这个问题——问法就错了,该问的是"我要修的那类图谁最稳"。你手里的图就是最好的考卷,按我这五道题的思路给自己出一份,跑上两轮,答案比任何榜单都准。

常见问题

这次对比用的是免费版还是付费版?

混合用的,哪家当时用什么版本我都照日常习惯来,没为了测试专门充值。付费功能会影响出图上限,但这次比的五道题在免费额度内都能完成,结论对普通用户是成立的。

记分为什么不用具体分数?

因为修图效果很难量化,脸歪两度算扣几分?不同人心里的秤不一样。三个档位逼我做判断而不是做算术,读起来也更不容易被数字误导。

过段时间再测,结果会变吗?

大概率会。这类模型迭代很快,我第一轮和复核轮之间就感觉某家的出图速度变了不少。这份记分表看思路和看方法比记结论更有价值,隔几个月拿同样的题重跑一遍是更好的用法。

五张原图可以去哪里找?

用你自己拍的最好。我这次用的是手机随手拍:一张人像、一张旧扫描照、一张桌面杂物图,外加两张自己做的底图。自己的图自带真实需求,测出来的结论直接能用。

老照片修复会不会泄露家人信息?

上传到任何在线服务都意味着照片离开了你的设备,这一点要有数。涉及长辈肖像的合影,我一般挑不涉及敏感信息的照片测,正式修复前先看清楚服务的条款,介意的话留几张关键照片只在本机处理。

延伸阅读