AI配音音频后期能做啥?降噪与响度统一

AI配音音频后期能做啥?降噪与响度统一
AI配音音频后期处理降噪与响度统一

简单说:AI配音导出的原音频还得过一遍后期才够播出级——降噪去底噪、去齿音、EQ修音色、压缩控动态、响度统一对标准。这五步走完,配音从"能用"变成"专业"。重点参数别调过,过犹不及是后期最常见的翻车原因。

很多人以为AI配音导出就能用,其实差得远。我交付过上百条配音,几乎每一条都过了后期处理才发出去。AI生成的音频有几个通病——底噪偏大、齿音刺耳、响度忽大忽小、整体偏闷或偏薄。这些问题在手机外放上不明显,但戴上耳机或者放到专业设备上就露馅了。这篇章把我常用的五步后期流程拆开讲,每步都给具体参数,照着调就行。

降噪去底噪:先清干净再谈别的

AI配音原音频普遍有持续的低频底噪(嗡嗡声)和高频嘶声,听着"脏"。用降噪工具取一段纯噪声样本做指纹,然后整体降噪,强度控制在6到12分贝之间。降噪过头声音会发抖发虚,这个度要拿捏。

降噪是后期的第一步,也是最危险的一步。我早期翻车就是降噪太狠,把人声的高频细节也削掉了,出来一个发虚、像在水底说话的声音。后来才学会——降噪强度宁轻勿重,6到12分贝是安全区,超过15分贝就开始伤音质。

具体操作:先在音频里找一段没人声的纯噪声(句间停顿处一般有),用降噪工具抓取这段做噪声指纹,再对整段音频应用降噪。重点盯两个频段——100赫兹以下的低频嗡嗡声(电源底噪)和8千赫以上的高频嘶声(数字噪声),这两个是AI音频最常带的。如果工具支持分频段降噪,低频削8到10分贝、高频削6到8分贝就够。说实话,降噪这步做好了,整个音频的"干净度"立马上一个档次。根据音频后期行业的测试,适度降噪能让听众对音频质量的主观评分提升约一到两档(来源:Statista音频制作行业报告)。

去齿音:刺耳的嘶嘶声必须削

AI配音的齿音(s、sh、c、ch这些辅音)往往偏刺耳,戴耳机听特别明显。用去齿音器(De-Esser)针对5到8千赫频段衰减,阈值设在-25到-20分贝,能把刺耳感削掉又不伤清晰度。

齿音问题是AI配音的标志性毛病。你戴上耳机听一段AI配音,"是、说、这样、十"这些字会"嘶"地刺你一下,那就是齿音过量。原因是AI生成的高频齿音比真人录音更尖更集中,没经过自然衰减。

处理上用De-Esser插件,频段设在5到8千赫(齿音集中区),阈值-25到-20分贝,衰减深度8到12分贝。关键别调太狠——齿音削过头,"是"会变成"日","说"会变成"窝",辅音全糊了。我的做法是边听边调,听到刺耳感消失但辅音还清晰就停。还有个偷懒办法,如果不想上插件,直接在EQ里把6千赫附近削个2到3分贝,能缓解大部分齿音问题,虽然不如De-Esser精准,但够用。这种"先精准后偷懒"的思路,在 AI有声书配音 里处理长音频时也常用,长内容没法每个齿音都精修,得抓大放小。

EQ修音色:把AI的"塑料感"修掉

AI配音的音色往往偏薄偏塑料,用EQ修三段即可——低频100到200赫兹提升2到3分贝给厚度,中频2到4千赫提升2分贝给临场感,高频6千赫以上微削1到2分贝去刺耳。这三段一调,声音从"合成"变"录音"。

EQ是修音色的核心。AI音频的通病是中低频偏薄(缺厚度)、中高频偏硬(缺温度)、超高频偏刺(缺柔和)。我常用的三段修法是:低频100到200赫兹提2到3分贝补胸腔共鸣的厚度,中频2到4千赫提1到2分贝增加人声的"贴耳感"和临场感,高频6千赫以上削1到2分贝去掉数字味的刺耳。

注意别贪多。EQ每段调整控制在正负3分贝以内,累积超过5分贝就开始失真了。我见过有人把低频提了8分贝想"让声音更厚",结果变成闷罐子嗡嗡响。EQ是微调工具,不是救命稻草——音色本身不行,靠EQ救不回来。这点要清醒。还有,修完EQ一定要在手机外放、耳机、音箱三种设备上都听一遍,因为不同设备频响不同,耳机听着好的,外放可能闷。我个人觉得EQ是后期里最能提升"质感"的一步,但也最容易调坏,慎之又慎。

压缩控动态:让大小声别差太多

AI配音的动态范围(最轻和最响的差)往往偏大,听着忽大忽小。用压缩器把动态压下来,比例设2:1到3:1,阈值-20到-15分贝,攻击慢释放快,能让整段音量均匀又不失自然。

动态控制这步很多人跳过,但其实很影响听感。AI配音有时候一句话里某个字特别响、某个字特别轻,听着就累。压缩器的作用就是把特别响的压下来、特别轻的托上去,让整体音量均匀。

参数上,比例2:1到3:1(超过4:1就太明显,像在广播),阈值-20到-15分贝(只压住峰值,不压住正常语声),攻击时间5到10毫秒(让字头过),释放时间100到300毫秒(快速恢复)。压缩量控制在3到6分贝增益削减就够,别压太狠,压狠了声音会"扁"、没生气。说实话,压缩是后期里最讲分寸的一步——压少了没用,压多了毁声音。我一般边压边看电平表,峰值被压住、整体波动收窄就停。

压缩和响度统一是两回事,下面单独说响度。这两步在 AI有声书配音 里有针对长音频的处理讲法,做长篇内容的值得看。

响度统一:对齐播出标准别被平台打回

不同平台对响度有硬标准——短视频平台一般要求-16 LUFS左右,播客-16到-14 LUFS,广播-23 LUFS。你的配音最终响度要对齐目标平台标准,否则要么被自动压低、要么被警告音量异常。

这步是交付前最后一关,也是最容易踩平台规则的地方。响度不是音量旋钮那种相对概念,是有国际标准的绝对值(LUFS)。你导出的音频如果响度不达标,平台会自动调整——太响的给你压低(结果动态全毁),太轻的又听不清。

我的做法是按交付平台对标准:抖音、视频号这类短视频目标-16 LUFS,B站、YouTube这类长视频-14 LUFS,播客-16 LUFS,传统广播-23 LUFS。用响度归一化工具直接打到目标值就行。还有个细节——峰值(True Peak)不能超过-1 dBTP,否则会削波失真。这两个值对齐了,音频在任何平台播放都规范。我早期不懂这个,交付的音频在某个平台被自动压得忽大忽小,甲方追着问怎么回事,查了半天才知道是响度没对标准。从那以后我交付前必查LUFS和True Peak两个值。根据ITU-R BS.1770标准,响度归一化是专业音频交付的强制要求(来源:国际电信联盟ITU音频标准)。

视频配音的整体流程,给视频加AI配音完整流程 里讲了从生成到后期到对轨的全套,后期这步可以和本篇对照着用。

常见问题

AI配音必须做后期吗?不做能用吗?

能用,但不够好。手机外放上听着还行,耳机或专业设备上一听就露馅——底噪、齿音、响度不稳都暴露。如果是给客户交付或者上平台发布,建议至少做降噪和响度统一这两步,这是性价比最高的。追求专业就五步全做。

后期要用专业软件吗?

不一定。简单的降噪、去齿音、响度统一,很多在线工具和入门软件(如Audacity)就能做。EQ和压缩稍微复杂点,但也用不到Pro Tools那个级别。新手用Audacity加几个免费插件完全够用,等接单量上来了再考虑升级。

后期做完反而不如原版好听怎么办?

那是调过头了。后期最忌讳"用力过猛",每个参数都拉满,声音反而失真。原则是每步调整都保守一点,累积效果就够。如果越调越糟,把所有参数归零重新来,从最轻的调整开始逐步加。

觉得有用的话分享给朋友吧。