AI绘画ai进化实录:同一组提示词新旧模型重跑对比
说我的结论:AI绘画这一两年的进化是实打实的,手部、画面文字和反光这三处差距最大;可旧模型没有全面出局,速度和特定粗糙质感它照样能打。进化不是替换,是分工变细了。
AI绘画ai进化这个话题,空聊没意思,得拿数据说话。我本地一直留着一个两年前的旧开源模型没舍得删,上个月心血来潮,把它跟云端正在用的新款模型拉到同一条跑道上:同一组提示词、同一个种子、相近的采样参数,二十个题材各跑三轮,一共一百二十张图,逐项打分。跑完最大的感受不是"新版真好",而是看清了进化到底落在哪几个点上——有几个地方跟我预想的完全相反。
怎么比才公平:同词、同种子、同参数
对比要锁死三个变量:提示词一字不改、种子固定、采样步数对齐,只留模型这一个变量,不然比的是调参水平不是模型能力。
规则我先定死了。提示词从我的词表里挑了二十条,短的如"雨夜公交站台 红色雨伞",长的有七十字的场景描述,中英各半,两边用各自擅长的语言版本——这里有个绕不开的坑:新款模型吃中文,旧模型对中文几乎无感,所以我给旧模型跑的是逐词翻译过的英文版,翻译损耗这口锅我认,记分时单独标注了。
种子两边都固定在同一个数,步数旧模型30步、新模型25步,都是各自社区的常用甜区值。每条词跑三张,弃掉最差一张取两张平均,防止一张好运图拉高印象分。整套跑下来花了两个晚上,云端那边单张9秒左右,本地旧模型6秒——速度这块旧模型先赢一分,这是我没想到的开局。
记分结果:手、文字、反光三处差距最大
旧模型的手崩了七张,新模型只崩一张;画面里的招牌文字旧版全是鬼画符,新版能写出简单的两三个字但仍会错;玻璃和水面反光,新版多了环境倒影这一层。
| 对比项 | 本地旧模型 | 云端新模型 |
|---|---|---|
| 手部(40张含手图) | 崩7张,多为六指 | 崩1张,握姿发僵 |
| 招牌文字(10张) | 10张全鬼画符 | 4张写对两字词,6张错字 |
| 玻璃水面反光 | 反光均匀,像贴图 | 有街景倒影,层次多一层 |
| 多人构图(15张) | 2张肢体粘连 | 15张全过,间距自然 |
| 出图速度 | 6秒,离线 | 9秒,依赖网络 |
翻车集里有一张我得单独说说。"菜市场的鱼摊"这条词,旧模型把鱼鳞画成了规则的六边形网格,像贴了一层地砖;新模型好很多,鳞片有了大小和光泽的变化,但还是能看出一点网格的影子。可见有些老毛病是代际遗传的,进化治了大病,留了小病,验收时别指望一步到位。
最直观的一张对比是"雨夜公交站台":旧模型的积水是一片均匀的亮,新模型的积水里能看出站台灯管一根根的倒影。就这一处,画面可信度差出一个档次。多人构图那组更悬殊,旧模型两个牵手的人能长出三只手,新模型十五张全部过关,间距和视线都合理——这两年的迭代主要就砸在这些地方,钱花在哪看得清清楚楚。
进化没覆盖的角落:旧模型还能打的场景
批量出草图、断网环境、低配电脑三个场景旧模型照样好用;另外某些要做旧、要颗粒感的风格,旧模型的糙反而是优点。
跑完对比我没有删掉旧模型。三个理由。其一,速度:本地6秒、不排队不费额度,我给客户出草图要一口气跑两百张,用旧模型跑初筛,选中的方向再用新模型精出,流程反而快。其二,断网也能干活,出差路上没信号照样出图,这点云端模型给不了。其三,风格上有个反直觉发现:做旧海报那组词,旧模型出的颗粒感和褪色感比新模型更对味——新模型太干净了,干净得像刚出厂,旧模型的糙正合适。
还有笔账得算给纠结要不要升级的人:新模型是按张计费的,我这两个晚上云端部分花了小几十块。日常随手玩、跑草稿,旧模型零成本;交付级的图再上新模型,这样搭配着用,钱花在刀刃上。
一百二十张图跑完,我对"进化"这个词的理解变了:它不是新旧交替的换血,更像工具箱里多了一把更细的刀。刀多了不假,但哪把切什么,得自己心里有数。模型在进化,用模型的人的判断力,也得跟着进化才行。
常见问题
新模型一定比旧模型出图好看吗?
大体是,但有例外。我实测里做旧、颗粒感这类风格旧模型更对味,加上速度和零成本的优势,一概"喜新厌旧"不划算,按题材分配模型更合理。
对比测试时种子对不上怎么办?
不同模型之间种子只能保证起点一致,不代表画面完全可比,我测的时候也有几组新模型没复现旧模型的构图。遇到这种组别,就当构图随机项处理,只比画质细节,别比构图。
旧模型跑不动新词表吗?
长句和新概念确实吃亏,翻译成英文能救一部分。我的做法是给旧模型用精简短句,控制在20字以内,理解偏差会小很多。
以后还有必要留旧模型吗?
看你的硬盘和用途。有批量草图需求、想省额度、或者做旧风格用得多,留着不亏;纯粹偶尔玩两张的,删了也不心疼。