AI绘画加AI解说怎么做视频?三集老街传说的实录
说重点:AI绘画加AI解说,最适合做的是风物传说类叙事短片——画面出氛围,解说讲故事,两不相抢。我给文旅号做的三集老街传说全部跑通,单集五小时,腔调、空镜、地名三大坑的修法都在下面。
AI绘画加AI解说的组合,我在口播视频里用过一次,真正摸出门道是在这三集老街传说上。本地文旅号想做个"老街故事"栏目,预算有限,请不起配音也拍不了空镜,我接了下来。三集做完,平均单集五个小时,这篇把过程摊开讲。
接活之前我也有过犹豫:AI做的画面,观众会不会一眼嫌假?三集的数据给了答案——第一集播完两千一,评论区讨论的是故事本身和"这条街在哪",没一个人提画面假不假。氛围到位了,观众根本不追究像素来源。
解说视频的画面逻辑和配图不一样
解说视频的画面是空镜,负责铺氛围,不负责演戏;解说词是主线,画面跟着解说走,一句话一个镜头。把它当成给广播剧配画面,思路立刻就顺了。
我第一版就干过本末倒置的事:画面里画了人物动作特写,解说还在铺背景,观众眼睛在找人物、耳朵在听故事,两边打架。后来定了规矩——解说词里出现具体人物之前,画面只出场景:青石板、灯笼、门环、雨檐。人物等到解说点到名字那一句才进画,观众注意力立刻归位。三集试下来,这套"画面慢半拍"的节奏比声画同步更耐看,完播数据也支持:第二集比第一集的完播率高了将近一成,改节奏那一步功不可没。
三集老街传说的实际做法
每集九十秒,解说词四百八十字上下,空镜二十二到二十六张,三集共出图六十七张、用四十六张。流程固定成四步:定稿、分段配音、逐句出图、剪辑对轨。
先说翻车最狠的一处:空镜重复。第一集里同一张青石板路镜头出现了四次,观众在评论区留了句"这条街是不是就一条路"。第二集起我建了个"镜头台账",一张图用过就记账,出图时按台账轮换视角——俯视、贴地、门缝里看,同一个主题也能翻出五种机位。第三集同类重复降到零。
耗时分布也值得交底:写稿改稿一小时,配音十分钟,出图加挑选两小时,剪辑对轨一个半小时,封面和标题半小时。出图看着量大,好在空镜不挑人手不挑脸,一次通过的比率比画人物高得多,六十七张里废的只有二十一张,大多废在透视穿帮上。
封面也顺手在这套流程里出了。三集的封面我都从当集空镜里挑一张最抓眼的,垫图重出一版加了标题留白的横版,十分钟一张,风格跟正片天然统一。以前做封面还得另开一个思路,现在是顺路的事,这是我做这三集最意外的省力点。
AI解说的腔调是调出来的
默认配音是新闻腔,讲故事得手动往说书腔上掰:语速降到0.95倍,句尾停顿加长,稿子里的书面词全部换成口语。三处一起改,味道才出得来。
第一集的配音我听完就毙了——稿子写得端着,配音念得也端着,像晚间新闻在念童话。改法分两头:稿子那头,把"坐落于"改成"就在",把"始建于清代"改成"清朝那会儿就立起来了";配音那头,语速从1.0降到0.95,句间停顿从0.3秒加到0.5秒。第二集出来,同一号里有人问是不是请了本地老人讲的,我看着屏幕笑出声。
地名是另一个坑。第二集里"乐平"两个字,AI张口就是"乐(yuè)平",还理直气壮。查了半天,工具不支持手动注音,最后换个写法绕过去——稿子里写成"乐(le四声)平老街"让AI照念,成片里再不留痕。你那儿要是也有生僻地名,先拿去试念一句,比成片出来再返工强。
三集做完,最大的感触是这组合拳打的是"氛围性价比":一条实拍空镜要设备、要天气、要腿脚,AI空镜只要十分钟和一点想象力。解说也是,腔调调顺之后,改稿重录只要十分钟。五小时一集的速度谈不上快,但对预算有限的文旅号来说,是以前想都不敢想的产能。栏目的第四集已经在写了,这次我想试试让画面比解说快半拍,看看是另一种味道还是灾难。
常见问题
解说词是自己写还是让AI写?
我的分工是AI出初稿、人工重写。传说故事的地名、年代、口吻必须人来把关,AI初稿当素材库用就好,直接照发容易出张冠李戴的事故。
空镜风格前后集不一致怎么办?
把第一集的风格词存成模板,后面每集原样带进提示词,色调、光线、时代感就能咬住不放。我的三集风格词一共二十来个字,一直没动过。
AI解说能完全替代真人配音吗?
风物传说这类稳得住,需要强情绪的纪录片腔还差口气。碰到要哽咽、要笑意的句子,AI给不了,那种稿子还是找真人。
九十秒的片子适合发哪些平台?
短视频平台的横向叙事片最吃这套,发的时候记得首帧放最强的空镜,前两秒留不住人,后面做得再好也白搭。