猫和老鼠AI绘画头像怎么画?经典动画角色出图
简单说:猫和老鼠AI绘画头像最大的坑是模型不认这俩角色,纯提示词相似度很低。用IP-Adapter加参考图、CFG压到4到5、再配卡通LoRA,角色还原度能从三成飙到八成。
老实讲,第一次想做猫和老鼠AI绘画头像我就翻车了。Tom画成了普通蓝猫,Jerry看着像田鼠——经典的歪嘴大眼全没了。后来才搞懂,这俩是米高梅1940年的老IP,主流模型根本没在语料里好好学过。这篇把我折腾出来的还原套路写明白。
为什么猫和老鼠头像这么难还原?
Tom和Jerry不是"一只猫一只鼠"那么简单,它们的圆眼、大嘴、夸张表情是2D动画符号化的产物,写实或通用二次元底模都画不出那个味。难点在抓特征,不在出图本身。很多人卡在这。
我自己试下来,纯靠提示词写"a blue-grey cat and a brown mouse",出来的图就是俩普通动物,毫无灵气。问题在于Tom的黄色瞳孔、白色肚皮、还有那个标志性的得意坏笑,Jerry的圆耳朵和豆豆眼,这些细节模型压根不知道你要。
更别提动态了。这俩角色最经典的是追逐画面,Tom扑空、Jerry偷笑,那种戏剧张力AI很难凭空脑补。所以还原工作得手动喂参考。
顺嘴一提,做这种经典角色头像,思路和还原其他知名角色是相通的,可以参考这篇小乔AI绘画头像里讲的三国角色特征抓取。
Tom的特征清单:蓝灰猫怎么写准
Tom的关键特征是蓝灰色短毛、白色腹部和嘴部、黄色椭圆瞳孔、粉红长尾巴、夸张的大嘴和圆眼。提示词要把这些拆开逐项写,不能笼统说blue cat。越具体越好。
我常用的正向词组是"Tom cat from Tom and Jerry, blue-grey fur, white belly and muzzle, yellow oval eyes, large expressive mouth, pink tail, 2D cartoon style, flat shading, exaggerated expression"。
负向挂"realistic, 3D render, photographic, fur texture, human-like eyes"——这些是写实化的元凶,得压住。底模建议用专门的2D动画或美式卡通模型,写实底模怎么调都出不来那个扁平赛璐璐感。
Jerry的特征清单:棕鼠别画成田鼠
Jerry的特征是浅棕色圆滚身体、大圆耳朵、黑色豆豆眼、小粉鼻、短细四肢,整体偏Q萌而非写实鼠。提示词重点写cute round body和big round ears,负向必加realistic mouse和rat。这步省了必崩。
Jerry最容易被画成真老鼠,毛茸茸还带长尾巴,恐怖谷。我第一次出的图就这样,吓一跳。后来负向词狠狠加了"rat, long tail, whiskers, realistic rodent",再配上"chibi, cute, round, cartoon mouse",才算扳回来。
它的体型比Tom小很多,构图时要在提示词里点明size difference,不然俩角色一样大就没追逐的张力了。
角色互动和构图感强的头像,和做星座少年那种带人设的头像逻辑类似,这篇射手座男生AI绘画头像里讲的人设元素融入值得一看。
IP-Adapter实测:参考图比纯提示词强太多
实测用IP-Adapter挂Tom和Jerry的官方剧照做参考,权重0.6到0.7、CFG压到4到5,角色相似度从纯提示词的约三成飙到八成。这是还原经典角色最划算的办法。没有之一。
具体操作是准备两到三张经典剧照当参考图,IP-Adapter选plus版本,权重别开太高,0.7以上会糊掉原本风格。CFG我特意压到4.5,因为卡通角色线条简单,CFG高了反而过锐出噪点。
根据 Hugging Face 上 IP-Adapter 项目 的说明,参考图权重过高会压制提示词控制,所以两者得配合着调。我个人的甜区是参考图权重0.65、提示词CFG 4.5、步数22到25。
翻车经历也得提一句。我之前把IP-Adapter权重拉到1.0想追求"一模一样",结果出来的是剧照的模糊重绘,毫无创作空间。还原不是复印,留点生成余地才有意思。
找现成LoRA可以去 Civitai 模型库 搜Tom and Jerry,社区有人做了专门的角色LoRA,配合IP-Adapter用更稳。
出图参数和后处理:卡通头像要干净
卡通头像参数和写实图不同,我实测CFG 4到5、步数20到25、采样器Euler a或DPM++ 2M Karras、Hires放大1.5倍,出来的线条最干净。卡通图怕过饱和不怕柔和。这套和写实图调法相反。
采样器我对比过,Euler a出图最柔顺适合卡通,DPM++ 2M Karras细节多一点。两者都行,看你要扁还是要有层次。步数超过30对卡通图基本是浪费,多花约10秒没回报。
后处理方面,卡通头像放大用R-ESRGAN 4x+ Anime6B这个专门动画算法,比通用算法锐利但不糊。重绘幅度0.2到0.3就够,太高会改画风。
关于这部动画的背景资料,维基百科 Tom and Jerry 词条 记载它从1940年首播至今拿了七项奥斯卡,理解角色设定有助于抓特征。
双人构图:追逐戏怎么摆
画Tom追Jerry的双人头像,用ControlNet的openpose锁住两个角色的姿势和视线方向,再在提示词写明chasing dynamic pose,比纯抽卡稳定十倍。动态构图必上ControlNet。
追逐画面最难的是俩角色互动对不上,Tom的手扑空、Jerry的逃跑方向乱。openpose能分别设定骨架,我一般先搭个简单的双人骨架草图喂进去。
视角上,头像方构图建议用正面或四分之三侧面,纯侧面在方形头像里太挤。表情要给到极致,Tom的恼怒和Jerry的狡黠是灵魂,提示词写exaggerated angry face和smug grin。如果想先画整张场景再裁头像,这篇讲AI绘画猫和老鼠整图出图的构图思路更全。
古典人设类头像对神态要求也高,这篇林黛玉AI绘画头像讲的古典气质还原思路能借鉴。
常见问题
没有Tom和Jerry的LoRA能画吗?
能,但相似度会打折。用IP-Adapter加参考图是最省事的替代方案,权重0.6到0.7效果接近专门LoRA。纯提示词也能出,只是角色味淡很多,更像普通卡通猫鼠。
画出来像真老鼠怎么办?
负向词狠狠加rat、realistic rodent、long tail、whiskers,正向加cute、round、chibi、big round ears。底模换成2D卡通或美式动画模型,写实底模必崩。这是最常见的翻车点。
用Midjourney还是Stable Diffusion好?
还原特定角色SD更可控,因为有IP-Adapter和ControlNet这些精细工具。Midjourney画风好看但角色相似度难保证,画原创卡通头像倒是更省事。要还原Tom和Jerry,SD优先。
双人头像怎么避免角色混色?
在提示词里用区域提示词或分别描述,明确Tom是blue-grey、Jerry是brown。出图后如果还串色,用局部重绘单独修。ControlNet分区控制也能缓解这问题。
觉得有用的话分享给朋友吧。