AI配音怎么分开配音?多人对话和分轨输出的实操方法
简单说:AI配音分开配音的核心是按角色拆文案、每条角色单独合成一轨、最后分轨导出再合并,最大的坑是一锅炖式整段喂给AI导致角色串味和无法单独调,分轨才是干净多人对话的根本。
多人对话的配音(情景剧、访谈、相声、播客模拟)是AI配音里最容易翻车的一类。很多人拿到一段对话文案,直接整段丢给TTS,结果两个角色的声音搅在一起,男的女的分不清,想单独改一句都改不了。这篇我把"分开配音"到底怎么分、分到什么程度、怎么合回去,一次讲透。
分开配音到底是分什么
分开配音分的是"角色"和"轨道"——先把对话文案按说话人拆成若干段,每个角色单独走一次TTS合成、单独存成一轨,最后把多轨对齐合并,分轨的好处是能单独调每个角色的音量、语速、情感,还能单独重做某一句不牵连其他角色。
很多人以为"分开配音"就是男声女声分别生成,其实远不止。真正的分开是按"角色×语句"拆到原子级。一段三个人的对话,A说了5句、B说了3句、C说了2句,你要拆成10条独立的文本片段,分别标注属于谁,然后按角色归类,每个角色的所有句子合成成一轨(或者每句一轨再拼)。
这跟"整段丢给AI让它自己分角色"是两码事。整段丢进去,AI要么用一个声音念到底,要么随机切,你没法精细控制。分轨才是把控制权拿回自己手里的做法。
第一步:把对话文案按角色拆干净
拆文案是分开配音的地基——按"说话人:台词"的格式把对话整理成结构化清单,一行一句、标清谁说的,拆得越干净后面合成越省事,偷懒不拆后面全乱。
具体怎么做。假设你有一段情景剧:
"老板:今天业绩怎么样?员工:还行,比上周好点。老板:具体多少?员工:涨了百分之十五。"
把它整理成这样(我一般用纯文本或表格):
1|老板|今天业绩怎么样?
2|员工|还行,比上周好点。
3|老板|具体多少?
4|员工|涨了百分之十五。
拆的时候连标点都别偷懒——问号、感叹号、省略号都要保留,因为TTS会根据标点读出语气。问号丢了,"今天业绩怎么样"会被读成平铺直叙,老板那种追问的感觉就没了。
还有个细节:每句前面加上**停顿标记**。对话不是连珠炮,角色之间要有呼吸。我在每句台词之间预留0.3-0.5秒的间隔(后面对齐时再加),不然两句撞在一起听着挤。
第二步:每个角色单独合成一轨
每个角色用各自的声线和参数单独走一次TTS,把该角色的所有句子按顺序合成出来、单独存成一个音频文件(一轨),不同角色用不同voice,同一角色的句子保持同一voice保证统一。
操作流程(以我常用的做法为例):
选声线:老板选沉稳偏低的中年男声,员工选年轻清亮一些的男声或女声。两个角色声线要有区分度,但又不能差太离谱显得不像一个场景的人。我一般让音高差个3-5个档次、语速差0.1倍左右。
逐句合成:把老板的4句话(第1、3句)按顺序喂给TTS,用老板的voice;员工的2句(第2、4句)用员工的voice。每句单独导出一个音频片段,文件名按"角色_序号"命名(boss_01.wav、staff_01.wav),这样后面对齐不乱。
参数建议:老板语速0.9-0.95倍(沉稳),员工1.0-1.05倍(略快显年轻)。情感标签如果工具支持,老板用neutral或serious,员工用neutral或slightly_nervous(被老板追问嘛)。音量统一-3dB左右留出headroom,后面再调。
这里有个我踩过的坑:同一角色的两句话,中间隔了别的角色的话,合成时要分别合成再手动加间隔,别把两句连起来生成。连起来生成AI会当一句话读,中间该有的"被别人打断"的停顿就没了。
第三步:分轨对齐合并
把每个角色的音频片段按对话顺序在时间轴上排列对齐,角色之间留0.3-0.5秒呼吸间隔,全部对齐后导出一个混合音轨,分轨文件单独保留方便日后单独改。
这一步在音频编辑软件里做(我用Audition,免费的Audacity也行)。把boss_01放第0秒,staff_01接在它后面留0.4秒间隔,boss_02接在staff_01后面……依次排成一列。
对齐时盯两个东西:一是别让两句话重叠(除非你要的是抢话效果,那种故意重叠的另说,要手动调),二是间隔要自然——问句后面接答句,间隔短一点0.3秒(答得快);陈述句后面,间隔0.5秒(有思考停顿)。
排好之后全部mute检查一遍每个角色单轨是否顺畅,再unmute听整体混音。混音导出时音量再平衡一次——老板声音压一点(-2dB),员工略提(+1dB),让对话有主次又不至于一个人盖过另一个人。
最关键:分轨文件别删。存成单独的工程文件,哪天老板那句话要改语气,直接重做那一轨,其他不动,几秒钟搞定。这就是分开配音最大的价值。
我的翻车:整段一锅炖导致没法单独改
最痛的翻车是图省事把整段对话一次丢给TTS,结果两个角色串味、想改员工一句话却牵连整段重做,后来改成拆句分轨,单独改一轨几分钟搞定,才知道分轨不是麻烦是省事。
这坑我帮一个做情景短剧的哥们踩的。他给了一段四个人对话的剧本,我嫌拆句麻烦,直接整段丢进TTS(那工具支持多角色但得一锅喂)。出来是分了角色,但有个角色的某句话语气特别怪,我想单独重做这句——发现做不到,因为整段是一个文件,改一句得整段重生成,前面调好的其他句全白费。
而且更糟的是,一锅喂的时候AI对"谁接谁的话"判断会错,偶尔把B的话用A的声音读了,整段逻辑都串了。据Statista的数据,短剧类内容里多人对话场景占比很高,分轨制作是保证可改性和角色一致性的标准做法。
后来我老老实实拆句分轨,每个角色一轨。哪句要改就重做那一轨的一句,其他不动,五分钟搞定。那次之后我定了个规矩:超过两个人对话,一律分轨,绝不一锅炖。
常见问题
AI配音怎么分开配音?
核心是按角色拆文案、每角色单独合成一轨、分轨对齐合并。先把对话按"说话人:台词"拆成原子句,每角色用自己的voice逐句合成单独存轨,最后在音频软件里按顺序对齐留呼吸间隔,导出混音。分轨文件保留方便单独改。
多人对话配音为什么要分轨不能整段生成?
整段一锅喂AI会导致角色串味(谁接谁判断错)和无法单独改某句,改一句得整段重做。分轨让每个角色独立可控,单独调音量语速情感,单独重做某句不牵连其他,才是干净多人对话的根本。
对话角色之间要留多少间隔?
问句接答句0.3秒(答得快显自然),陈述句接陈述句0.5秒(有思考停顿)。别让两句话重叠(除非故意抢话效果)。间隔太短听着挤,太长显拖,0.3-0.5秒是自然呼吸的范围。
分轨文件要不要删?
千万别删。分轨文件单独保留,哪天某句要改语气或声线,直接重做那一轨的一句其他不动,几分钟搞定。删了就得整段重做,分轨的价值就没了。存成工程文件最稳妥。
分开配音看着比一锅炖多几步,其实是用流程换可控性,做得多了比整段返工快得多。多人对话的完整制作流程可以看ai配音过程那篇,角色声线怎么选参考说书角色配音那篇,工具层面的对比看ai配音tts那篇,更多配音工具介绍可以参考微软Azure语音服务。
觉得有用的话分享给做多人对话内容的朋友吧,分轨这步能省下不少返工的功夫。