AI修图中文提示词的边界:哪些需求它听不懂

AI修图中文提示词的边界:哪些需求它听不懂
AI修图中文提示词边界测试:成语、量词、方言与网络用语的听得懂与听不懂对照插画

中文比想象难。AI修图中文提示词的可靠边界,大致停在「字面可量化」这一层:成语只认字面义,量词和方言翻车率最高,网络用语全看训练数据更新到哪年。先别急着换软件,把模糊的中文指令拆成可数的动作,通过率立刻不一样。

AI修图中文提示词最稳的部分,恰恰是最不像中文的部分——「背景虚化30%」「肤色提亮两档」这种带数字的指令,基本百发百中。一旦换成「P得精神点」「修出松弛感」,结果就开始抽签。我从今年3月起专门干这件事:拿几百条中文修图指令喂给手头能碰到的修图工具,成语、量词、方言、网络用语各建一个「听得懂/听不懂」文档,每条至少跑三次再下结论。半年下来感受很明确:模型不是不懂中文,是不懂中文里那些没法直接翻译的部分。

成语:字面义能过,引申义必翻车

成语大约一半能听懂:画面和字面重合的能执行,靠引申义的一律跑偏,把成语改写成白话动作反而是捷径。

我攒了120条成语,全是能挂在修图指令上的那种,比如「整体调成古色古香」「皮肤修得白里透红」。字面义和画面重合的,通过率不低。「古色老香」这种打错字的都能被纠正过来,「白里透红」8月底那次重测五次过了四次。

麻烦的是引申义那批。「眉眼修得顾盼生辉」,它给眼角加了两个高光点,像贴了星星贴纸。「形神兼备」输进去,图一动不动,连参数都没变。「蓬荜生辉」最离谱,直接在背景上撒了一层金色光斑——它真就理解为「要生辉」。说实话,这感觉像一个背熟了成语词典但没怎么用过成语的外国朋友:每个字都认识,连起来全靠猜。

所以我在成语文档的结尾写了一行备注:能改成白话的,别用成语。「古色古香」改成「降低饱和度、偏黄褐色调、加一点暗角」,五次全过。同样的意思,换个说法就是两回事。

量词和方言:翻车重灾区

量词错得最隐蔽:「一点点」「一丢丢」常被当成大改,方言词十个里九个失灵,换算成数字或百分比最保险。

量词是整个测试里最气人的部分。错得隐蔽,你下单的时候以为它懂了。「把亮度提一丢丢」,它提了接近一半,我原图直接过曝。「裁掉一圈背景」,它裁掉了差不多四分之一的画面。「稍微意思一下就行」这句我最想骂——这是我妈发照片让我修时的原话,我原样输进去,饱和度直接拉满,输出红得像过年。你觉得表述已经很客气了,它没有接收这个信号。

方言更惨。东北话的「整精神点」,输出完全随机,五次里三次没反应。四川话的「P得巴适点」,一次直接回了我不理解该指令。粤语写「影得靓仔啲」,全军覆没。后来我对比过国产工具和国外软件在同一批方言词上的表现,国外那款连「磨皮」都要换成英文才稳定执行,中文支持的差距值得单独说,感兴趣可以看我整理的外国软件中文支持实测(AI修图外国软件中文支持)。

话扯远了,话说回来,量词和方言的共性是同一个:它们都是「约定俗成的缩写」,缩的是只有人之间才有的默契。模型没有这份默契,就只能按字面抡。

「帮我P精神点」为什么会变成加特效?

「精神」既能形容人的状态,又被网络语境带成了某种特效风格,模型挑了它见得最多的那条路:加光效。拆成动作清单才能救回来。

这是我今年5月最经典的翻车现场。我把证件照丢进工具,输入「帮我P精神点」,出来的图眼角带着星芒,背景一圈光晕,瞳孔里还有高光亮点,整个像开了「精神特效」滤镜——字面意义上的,给「精神」加了特效。截图发给我朋友,她回了三个「哈哈哈哈」加一句「这是要做法事吗」。

复盘下来原因不复杂。「精神」是个多义词:状态好的精神、精神小伙的精神、照片里那种利落有神的气质,全挤在同一个词里。模型在海量数据里见过最多的大概率是带光效的「精神」修图教程,于是它就往那个方向去了。你觉得模糊,它觉得明确,这才是最要命的错位。

解决办法笨但管用:拆。我把这条指令改写成「去掉黑眼圈、眼白提亮一档、嘴角轻微上扬、头发边缘清理干净」,同一张照片连跑五次,四次达到我想要的效果。从零到五变成五中取四,这就是中文提示词的现实:不是模型不行,是中文一个词里塞的信息太多了。具体怎么拆才高效,我在AI修图描述写法那篇里整理过一套流程(AI修图描述写法),可以直接照着改。

回到开头那句话:中文比想象难,难在它把大量信息藏在字面外面。半年测下来,我的「听不懂」清单确实越来越短了,可细看会发现,缩短的原因多数是我不说中文了——都说数字、说百分比、说动作。这算不算赢,我到现在也没想明白。至少有一点确定:下次你再想「P精神点」的时候,你知道它听到的可能是另一个东西。

常见问题

同一批指令换个工具测,结论还成立吗?

规律成立,比例会变。8月底我用同一套指令在两个新工具上重跑过,成语通过率最高能差二十多个百分点,网络用语差异最大,基本取决于各家训练数据更新到哪一年。但「字面义能过、引申义翻车」这条规律,到现在没有破过一次。

想自己建听得懂清单,该先测哪类词?

先测量词和程度词,翻车率最高、损失最直观,一眼就能看出偏差幅度;再测你行业里的行话。每条指令至少跑三次,固定同一张原图、同一组默认参数,中途别动设置,不然分不清是措辞的问题还是参数的问题。

提示词里中英文混着写会更稳吗?

分情况。专有名词和风格词(比如 bokeh、matte)夹英文确实更稳;情感类词千万别翻——「松弛感」译成 relaxed 之后出来的图完全是两码事,宁可老老实实拆成「肩膀放松、表情自然、光线柔一点」这种动作描述。

延伸阅读