配音历史趣谈:从蜡筒到AI的百年声音史
简单说:声音复制四时代——机械(留住)、电磁(可剪)、数字(可算)、AI(可创造);启示是技术民主化不可逆、气口节奏的手艺内核不变、岗位被淘汰也被创造。
配音历史趣谈知多少?每次点"生成配音",这个按钮背后是一百多年的技术史。声音复制史的四个时代:机械时代(蜡筒和唱片,声音第一次被留住)、电磁时代(磁带,声音第一次可编辑)、数字时代(CD和采样,声音第一次可计算)、AI时代(神经网络,声音第一次可创造)——每个时代都把上一代的"不可能"变成日常。这篇讲来路。
机械和电磁时代
1877年爱迪生的蜡筒留声机第一次留住了人声——但只能录一次,蜡筒听完就磨没了;磁带的发明让声音第一次可以"剪"(剪接磁带是早期的配音剪辑)。趣事:早期的电影配音是"现场配音"——影院雇人在银幕旁念台词(日本的专业"弁士"能把整部电影演成一个人的声音秀);中国早期的译制片传统(上译厂的配音黄金期)就诞生在磁带时代,那批配音艺术家的工作方式是"对着一帧帧画面找气口"——这种手艺在AI时代几近失传,但对气口的敏感留给了后世的配音导演。声音技术史的资料可以看Wikipedia的声音录制史条目。
数字和AI时代
数字时代(1980年代起)把声音变成数据——CD、采样器、数字音频工作站(DAW)让剪辑从物理(剪磁带)变成软件(拖波形)。AI时代的起点常被归到深度学习爆发(2010年代):WaveNet(2016)证明了神经网络能生成以假乱真的人声,此后TTS的进化进入快车道——从"听得清"(合成感明显)到"听得自然"(接近真人)只用了不到十年。你现在用的每一家配音工具,底座都是这场革命的余波。TTS的技术原理看TTS原理那篇和BERT那篇;行业的当下格局看人机对比那篇。
历史给创作者的启示
百年声音史给内容人的三个启示:技术的民主化不可逆(录音从天价棚到免费App,配音正在重演)、手艺的内核不变(对气口和节奏的敏感,磁带时代的功夫今天仍是稀缺品)、每个时代淘汰岗位也创造岗位(弁士消失了,配音演员诞生;标准化配音在消失,AI配音师在诞生)。语音技术的市场数据看Statista语音技术报告;历史资料交叉验证用大英百科。写下这段历史的当下(2026),AI配音正处在"磁带遇上CD"的转折点——享受它,也记录它,你就是声音史的一部分。
语音合成的里程碑
TTS的"进化树"(简版):机械时代("说话机器"的"机械尝试"——机械合成器的"蒸汽朋克时代"(19世纪的机械发声),"机械"的萌芽期;电子时代("贝尔实验室"的"电子语音"——电子合成的"技术奠基"(20世纪的实验室突破),"电子"的奠基期;神经网络时代("深度学习"的"自然飞跃"——神经网络的"质变"(2016后的飞跃),"神经"的爆发期)。华人的"语音贡献"(华语TTS的"本土里程碑"——中文语音合成的"技术攻关"(中文的独特挑战(声调的合成难题),"中文TTS"的本土史)。
声音媒介的百年变迁
录音媒介的"进化史":蜡筒的"最初记录"(蜡筒的"录音始祖"——爱迪生蜡筒的"最初声音"(录音的技术起点),"蜡筒"的始祖位;黑胶磁带的"模拟时代"(模拟的"温暖时代"——模拟录音的"质感时代"(模拟的声音审美),"模拟"的黄金期;数字流媒体的"当代"(数字的"无限复制"——数字音频的"零损耗"(流媒体的普及),"数字"的当代)。声音史内容的"创作富矿":老录音的"考古内容"(声音的"历史档案"——历史录音的"考古价值"(百年前的声音遗产),"考古"的内容位;技术史的"科普流量"(技术史的"科普窗口"——技术史的"故事性"(历史叙事的天然流量),"科普"的故事力。做旧的年代技术看做旧那篇,经典配音的怀旧方案看经典那篇,生成原理的技术科普看原理那篇。
常见问题
AI配音是什么时候开始的?
广义的语音合成研究有几十年,实用的分水岭是2016年WaveNet——神经网络生成人声的起点,此后不到十年从听得清进化到听得自然。
最早的配音是什么样的?
默片时代是现场配音(人在银幕旁念台词),磁带时代才有可编辑的配音,上译厂的黄金期就诞生在那时。
技术史对做内容有什么用?
三个启示:技术民主化不可逆、手艺内核不变(气口和节奏)、岗位被淘汰也被创造。看懂周期就不焦虑周期。
声音技术下一个时代是什么?
没人确定(实时克隆、情感可控是可见方向)。确定的策略:把资产放在跨时代的层(脚本、审美、听众关系),不放工具层。
声音史的密码在每个时代的不可能变成日常。觉得有用的话分享给爱琢磨声音的朋友吧。