沙哑AI配音怎么做?烟嗓质感的声线调校指南
简单说:沙哑AI配音的三个关键——音色选低沉粗粝的"烟嗓"类、响度比正常旁白压低2到3格、语速放到0.9倍左右。气声感是沙哑的灵魂,光降音调没用。
"用一个历经沧桑的声音来讲这个故事。"——拿到这个需求的时候,我第一反应就是做沙哑AI配音。烟嗓这个东西很神奇,同一个"欢迎回来",正常声线说出来平平无奇,沙哑声线一出来,画面感直接就有了。但AI调沙哑比调清亮难一个档次,压得太狠像感冒,压得不够像没睡醒。这篇把我这两年攒的调校经验一次讲完,参数都是实测出来的,你可以直接抄。
沙哑声线的底层逻辑是什么
沙哑感的本质是"气声占比高加上声带不完全闭合的摩擦感"。人抽烟多了或者上了年纪,声带边缘变厚,发声时漏气,出来的声音就带毛边。理解了这个,你就明白为什么不能只拉低音调。
很多新手调沙哑的第一反应是把音调参数拉到底,结果出来一个"低音炮",跟沙哑半点关系没有。沙哑要的不是低,是糙。你在剪映或者魔音工坊里选音色的时候,找那些标注"低沉""磁性""大叔"的音色,试听的时候注意听尾音——好的沙哑音色,尾音会有一点点自然的破碎感,那个就是我们要的毛边。
话说回来,我合作过的一个纪录片团队,他们管这种声音叫"内容的声音"——意思是这种声线一出来,观众潜意识里就觉得讲述者"经历过事"。这就是为什么人物纪录片、怀旧盘点、深夜电台清一色用沙哑嗓。配音行业的整体趋势数据可以看艾媒咨询的音频内容报告,有声和旁白类内容这几年的增长基本都压着短视频大盘在跑。
我的沙哑调校参数(实测版)
下面这套参数是我做完那条老字号纪录片旁白之后定下来的,后来又在不同工具上验证过两轮。工具不同,参数名会有出入,但方向通用。
| 参数 | 数值 | 说明 |
|---|---|---|
| 音色类型 | 低沉/磁性/大叔系 | 尾音要带自然毛边 |
| 语速 | 0.9倍左右 | 沙哑声线说快了会糊 |
| 响度 | 比正常旁白低2-3格 | 压着说,气声感才出得来 |
| 停顿 | 句间停顿拉长300ms | 给"喘息感"留空间 |
| 音调 | 只降1-2格,不拉到底 | 低音炮不等于沙哑 |
这里面最容易翻车的是响度。我第一次调的时候没降响度,出来的效果像"砂纸磨铁皮",刺耳。后来明白原因了:沙哑音色本身高频毛刺多,响度一高,毛刺全被顶出来了。压低两三格之后,毛刺变成质感,很奇妙。
不同内容的沙哑用法
沙哑不是一种声线,是一类声线。纪录片旁白、深夜电台、怀旧盘点、老友聊天,用的"沙哑"其实都不是同一种。
纪录片旁白要"沙而不虚"——声音有厚度,毛边只在做长音的时候出现,句子的主体是稳的。深夜电台要"沙而懒"——气声占比更大,尾音可以虚掉,像凌晨一点一个人对着话筒说话。怀旧盘点要"沙而暖"——选音色的时候挑年龄感偏大的,让声音本身就带年代滤镜。这三类的共同点是语速都不能快,你很难想象一个烟嗓说话像机关枪,那不是沧桑,那是着急。
翻车记录:过度沙哑是重灾区
这个必须单拎出来讲。有一回做怀旧盘点,我贪心,把沙哑参数推到了70%以上,自己听的时候觉得"就是这个味儿",发出去评论区第一条就是"Up主感冒了还坚持更新,泪目"。尴尬。后来复盘,沙哑参数超过一半,AI声音的清晰度会断崖式下跌,观众听不清内容,所有的沧桑感都白搭。我的建议是把沙哑强度控制在30%到45%之间,宁少勿多。清晰度是1,质感是后面的0,这个顺序不能反。
另一个坑是长文本的"沙哑漂移"。生成超过800字之后,有些工具的沙哑音色会越说越哑,说到结尾糊成一团。解决办法很土但管用:分段生成,每段控制在300字以内,然后自己在剪辑软件里对齐。麻烦是真麻烦,稳也是真稳。
工具怎么选
沙哑音色的品质排序(我个人体感):专业配音平台的烟嗓音色 > 剪映的"低沉"系音色 > 通用TTS的降调处理。排在末尾的那种基本不推荐,通用TTS里没有真烟嗓,硬用降调模拟,出来的是"低沉的正常声",糊弄不了耳朵刁的观众。
如果用剪映,"解说小帅"旁边那几个低沉系音色都可以试,选完之后记得手动降语速。魔音工坊的烟嗓类音色颗粒感更重,适合纪录片。如果你有自己的素材,也可以走GPT-SoVITS这类声音复刻路线,用一段真烟嗓素材去训练,效果上限最高,但门槛也最高。声音复刻的完整流程我写在声音复刻那篇里了。GPT-SoVITS的项目细节看GitHub项目页。
和其他声线怎么搭配
沙哑声线在双人内容里是黄金配角。一段正常的清亮声线念内容,沙哑声线负责"接住"情绪句,反差一出来,情绪句的重量直接翻倍。情绪参数的底层逻辑可以看配音情绪参数那篇。要是做叙事类内容,沙哑配温婉是经典组合,温婉声线的处理参考温婉声线那篇。
常见问题
沙哑AI配音用什么工具好?
首选有真烟嗓音色的平台(魔音工坊的烟嗓类、剪映的低沉系),别用通用TTS硬降调,出来的只是低沉不是沙哑。追求上限就走GPT-SoVITS复刻路线。
沙哑参数调到多少合适?
30%到45%之间。超过一半清晰度会断崖式下跌,观众第一反应是"感冒了",不是"有故事"。
为什么我的沙哑配音听着像感冒?
两个原因:沙哑强度过高,或者只降了音调没降响度。压低响度两三格、语速放到0.9倍,气声感出来就不像感冒了。
沙哑声线适合什么内容?
人物纪录片、怀旧盘点、深夜电台、老友聊天类口播。凡是需要"讲述者经历过事"这种感觉的内容,沙哑都是首选。
沙哑这个声线,调好了是岁月,调坏了是咽炎。区别就在那几个格子的响度和一半以下的沙哑强度。觉得这篇有用的话,分享给那个总在调音色卡壳的朋友吧。