AI绘画和AI语音怎么配合?先定音频再画画面的一条流水线

AI绘画和AI语音怎么配合?先定音频再画画面的一条流水线
AI绘画和AI语音配合的插画:声波化作画布上的风景

我的判断是:AI绘画和AI语音配合,顺序比工具重要——先把语音做完,让音频当骨架,画面按句子往骨架上挂。反过来先画图后配音,八成要在切点对不上的时候全部重排。

很多人把AI绘画和AI语音当两件不相干的事,其实它们凑一起就是解说类视频的整条产线。

上个月我做了条三分四十秒的科普短片,讲本地的老桥。语音用的某家TTS,稿子九百三十字,生成出来两分半就搞定。画面全是AI绘画,二十三张。成品发出去,有人问我是不是请了配音。没有。全程我一个人,一台电脑,从晚上八点干到十一点。

这篇就把这套流程拆开讲。不炫技,都是笨办法。

为什么语音必须先做

先做语音,是因为音频定死了时长和节奏,画面可以迁就它;画面先做,时长会随着配音改动不断漂移,每改一版全片切点跟着重排。骨架定了,皮肉才好长。

我第一版吃过亏。当时兴致上来先画了十几张图,画得挺美。配音一出来,解说比画面长出四十多秒,硬塞进去要么加快语速(像倒带),要么补图。补的图和前面的风格对不上,一眼就能看出断层。那十几张图最后用上的只有五张。

语速这件事有个粗略参考:中文TTS默认语速大约每分钟两百六十到三百字。你写稿的时候心里数一数字数,乘一下,片长八九不离十。稿子九百三十字,配上片头片尾留白,正好三分四十。

把音频切成画面脚本,三步就够

三步:给音频导出字幕文件拿到逐句时间戳,把稿子按句切成画面单元,每句配一条画面描述。二十三张图就是二十三个时间点,排队生成即可。

  1. TTS平台基本都能导出SRT字幕,里面每句话有起止时间。没有的话,用剪辑软件自动识别字幕也能拿到同样数据。
  2. 按标点切句,一句一行。太长的复句拆成两句,让每个画面单元控制在八到十二秒,超过这个数观众会腻。
  3. 每行后面补画面描述。描述别贪多,一个主体一个动作一个场景,就够生成用了。

举个我脚本里的真实例子:音频到一分十一秒那句「桥墩是光绪年间砌的」,对应描述就写「青灰色石砌桥墩,水面倒影,清晨薄雾」,九个字都不用。画面描述写长了反而乱。

对了,生成的时候把宽高比直接定成成片比例。我那次踩的坑是图默认出了横版,剪辑时全靠裁切,两张图的主体被切掉半边,只能回头重新生成。

每张图之间我还加了一点小动作:剪辑里给静图加个两三百毫秒的缓推,就是慢慢放大的效果。二十三张图每张推一点点,看的人不会觉得在看PPT。这个功能免费剪辑软件就有,叫法不一,认准「关键帧缩放」几个字就行。成本为零,质感上升一大截。

翻车实录:一个多音字毁掉一整段

TTS读错字比画面崩图更致命,崩图重抽一张就行,读音错了整段音频都要重来,切点全部后移。写稿阶段就得把多音字和生僻字提前处理掉。

那部片子里有座「洧川桥」。生成第一遍,TTS把洧读成了「wěi」——好吧这个字它居然读对了。真正翻车的是后面一句「栖架在河面上」,栖被读成了「xī」,听着像「西架」。我重生成三遍都一样,最后把「栖架」改成「横架」,一次过。

从那以后我写完稿会多一步:把拿不准读音的词全挑出来,换成最平实的说法。稿子不是文学作品,观众听懂比文气重要。TTS不会跟你商量,它只会一本正经地错。

还有一个连带的坑:改词会改变时长。那句改完短了一秒半,后面所有切点得跟着挪。所以我的习惯是音频定稿之前不画一张图,听起来慢,其实总耗时最短。

挑音色也有讲究。我试了六个音色才定下来,标准是:念「石墩、檩条、青苔」这类词不别扭。有的音色文艺句子念得很好,一碰具体物件名词就发飘。别信试听里的抒情段落,拿你稿子里最「硬」的那句去试音,那才是日常。

那条老桥的短片最后数据一般,播放量不高,但底下有条评论让我挺高兴:有人留言说他是听完全程的,说画面没抢戏。这就对了。语音是叙事的线,画面是垫在下面的绒布,绒布太花,线就看不清了。下次做第二集,我打算把单图停留时间从十秒压到八秒,试试节奏紧一点是什么效果。

常见问题

画面张数和音频时长怎么配比?

按每张图停留八到十二秒算,三分半的片子二十到二十五张。少于这个密度会显得拖,多到三十张以上剪辑工作量会陡增,性价比往下掉。

免费TTS和付费的差在哪?

最大的差别是断句和情绪。免费的像念课文,付费的会换气、会带轻重音。解说类短片建议至少在关键段落用付费音色,观众对语音的容忍度比对画面低得多。

画面风格中途换了怎么办?

别硬接,在两段风格之间插一张过渡图,比如空镜或者黑场加一个词。我那条片子里从白天切夜景,用了一张水面反光的过渡图,观众没觉得突兀。

需要会剪辑软件吗?

需要一点,但只要最基础的三样:按字幕时间轴切块、拖图片对齐、加转场。我用的还是免费剪辑软件,没碰任何高级功能。

延伸阅读