_长安绘画ai实测:大明宫、西市胡商与唐三彩,盛唐出图笔记

_长安绘画ai实测:大明宫、西市胡商与唐三彩,盛唐出图笔记
长安绘画AI实测:大明宫含元殿与西市胡商的盛唐出图

直接给结果:长安题材出图,朝代锚定词加市井密度词,比画质词管用得多。我拿同一底稿跑了大明宫、西市、三彩釉色三组对比,飞檐和胡商面孔是最容易翻车的两处,下面把能用的词和翻车现场都摊开。

上个月帮一个唐史科普号配插图,编辑就提了一个要求:要盛唐的长安,别整成影楼写真。我一口应下来,当晚跑图就傻眼了。大明宫的飞檐糊成一团乱线,西市街上一个胡商都没有,全是大眼睛美人杵在朱红宫墙前摆姿势。折腾了三个通宵,删了上百张废图,才算摸出点门道。长安绘画ai要出盛唐那股气象,靠的不是把「恢弘」「金碧辉煌」往提示词里堆,恰恰相反,得先做减法。

大明宫含元殿实测:飞檐糊成蜘蛛网,多半是词序问题

底稿这么写:建筑主体放句首,斗拱飞檐单独点名,再压一个晨光时段,含元殿的层次基本能立住。

我用的底稿是「大明宫含元殿,双层飞檐,木构斗拱,晨光斜照,龙尾道坡道,仰视视角」。就这一句,没有一个形容词是形容气势的。第一版我写的其实是「宏伟的唐代宫殿建筑群,飞檐斗拱,金碧辉煌,气势恢弘」,跑了十张,两张檐角是清楚的,剩下八张檐角互相穿模,像一窝蜘蛛网糊在房顶上。

问题出在哪?模型把「宏伟」「金碧辉煌」当成了主指令,建筑结构词被稀释掉了。我把形容词砍掉一半,只留结构词和视角词,同一组跑二十张,十三张檐角分明。这个提升幅度是我自己没料到的。老实讲,写提示词跟做菜一个道理,主料得先下锅,调料撒太多反而吃不出菜味。

还有一个细节值得单独说:斗拱。你不写它,模型给的屋顶就是一块平板;你写了「木构斗拱」,出图立刻多出一层檐下的阴影节奏。这个词在含元殿题材里的性价比,比我试过的所有光线词都高。后来我干脆把它存成固定后缀,跑任何唐代建筑都挂上,几乎没失过手。

为什么你的长安总像影视城布景?缺的是市井密度

影视城感的来源是太干净:街上没人、没摊、没杂物。给街道加上市井密度词,布景感立刻就破了。

第二组我主攻西市。头一版写「唐代西市,繁华街景」,出图确实热闹,但那种热闹是横店闭馆后的热闹——铺面整整齐齐,路面一尘不染,行人像道具一样均匀分布。不夸张地说,看着就像景区宣传照。

改法是把密度拆成具体的「东西」:「胡商牵着骆驼,波斯地毯摊位,挑担的小贩,酒旗幌子,人群摩肩接踵,路面有车辙」。就加了这么几个名词,画面一下子有了人味。我个人的偏好是再加一句「洒水抑尘」,让街面半湿,反光会把整个市集的层次托起来。就这么一个小动作,同一批图里能多挑出三四张能交稿的。

胡商的脸是另一道坎。「深目高鼻」这个成语模型居然能懂,但容易顺手把画风带成阿拉伯集市。我后来换成「粟特商人,络腮胡,尖顶毡帽」,跑出来的脸型才对——中亚那一路的长相,跟唐人站在一起有对比又不违和。还有个翻车记录:「驼铃声」这种听觉词模型根本不认,白占字数;写成「驼队铜铃」,它反倒给你个铃铛特写,哭笑不得。

唐三彩色调:一组釉色词让画面直接落地

唐三彩的魂是釉色流淌感。直接写「唐三彩配色」多半出纯黄陶马,得拆成琥珀黄、赭绿、奶白三色加流釉质感才对。

第三组本来是奔着陶马去的,结果有个意外发现:把釉色词当全图色调用,效果比当主体描述更好。「唐三彩釉色,琥珀黄与赭绿交织,奶白底,釉面流淌」这一串放在街景上,整个长安像被上了一层温润的釉,比正午大白光耐看得多。

我试过直接写「唐三彩」,十张里有七八张给你一只陶马,剩下的是黄釉碗。模型对这个词的理解是「器物」,不是「色调」。所以要用它的色,就得替它把色拆开说。这算是本次实测里最省钱的一个技巧:零成本把一张普通街景的档次拉起来。

主观意见放这里:三彩色配黄昏光是我心中最好的组合,暖釉色跟落日是同一个色温,画面浑然一体;配正午光就发闷,像出土文物摆拍。

最后编辑从一百多张里挑走三张,两张是西市夜市,一张是三彩色调的含元殿。她说了句让我记了好几天的话:原来盛唐的气象不在宫殿多高,在街上人多。想想还真是这个理。你下次跑长安,不妨先把手边的画质词删一半,换成几个活人、几个摊子试试。

常见问题

出图的唐代女子总梳成和风发髻,怎么拉回来?

用具体髻名锚定,写「双环望仙髻」或「堕马髻」,配「齐胸襦裙」,别写「唐装美女」这种笼统词。髻名越具体,模型越难往浮世绘那边滑。

长安夜景的光源应该怎么写?

灯笼做主光源,月光做补光,写「上元灯火」比写「夜景照明」出味得多。千万别出现霓虹相关的词,一沾整个朝代就穿帮了。

含元殿的台阶总画成直上直下,能救吗?

能。写「三层夯土台基,龙尾道盘旋而上」,再加仰视视角。含元殿的精髓就在那个缓冲的大台基,平地起高台和垫三层台子,压迫感完全两回事。

长安题材走写实还是插画感?

我的偏好好很明确:科普配图选插画感。写实路线会把服饰、建筑的穿帮一并放大,插画感反而能容错,观者也更愿意把注意力放在氛围上。

延伸阅读