文本转语音(TTS)和语音合成看起来像是新兴技术,但实际上,它们的历史可以追溯到几个世纪以前。
从最早借助机械装置模仿人类语音的尝试,到如今最前沿的人工智能和深度学习模型,TTS的发展历程颇为精彩。
本文将带你深入了解文本转语音和语音合成的发展历史,并展望其未来前景。
文本转语音与语音合成:从早期探索到现代应用
18世纪至19世纪
文本转语音与语音合成的历史可以追溯到18世纪和19世纪。这一时期出现了多种早期语音合成尝试,而且都依赖机械装置。1770年代,匈牙利发明家沃尔夫冈·冯·肯佩伦设计了一种名为“声学—机械语音机”的机械装置,用来模拟人体声道。该装置利用风箱、簧片和管道发出元音和辅音。
18世纪末,英国物理学家查尔斯·惠斯通发明了肯佩伦语音机的机械改良版,称为“说话机器”。该装置能够模仿多种乐器的声音。虽然惠斯通的设备并不是专门为语音合成设计的,但它进一步验证了通过机械设备发声的思路。
19世纪还出现了其他多种机械装置,包括法贝尔的“人工语音”机器。这些设备结合机械和气动系统来生成语音效果。
20世纪初与首个全电子语音合成系统
到了20世纪初,语音合成技术变得更加复杂,并迎来了首个全电子语音合成系统——由荷马·达德利在新泽西州贝尔实验室(Bell Labs)开发的声码器(vocoder)。
达德利的声码器通过一系列谐振器和滤波器生成合成语音。1939年至1940年,研究人员在纽约法拉盛草原世界博览会上展示了名为Voder的设备。他们通过键盘和踏板操控装置,生成语音。
20世纪50年代初至70年代末:合成器的兴起
1951年,达德利的研究推动富兰克林·S·库珀博士在哈斯金斯实验室开发出“模式回放器”。该系统可以分析语音、单词或短语录音,并将其分解为构成声波的部分,也就是“声谱图模式”。随后,这些模式会被记录到磁带上并回放,从而生成合成语音。
1976年,Kurzweil Reading Machine 推出了首个获得商业成功的文本转语音系统。该系统采用拼接合成技术,通过组合预先录制的音素和词语来生成语音。它最初是为残障人士提供辅助而设计的,但很快就作为阅读辅助工具得到普及。
从1978年起,德州仪器开始研发可用于电子游戏和计算机应用的语音合成芯片。该芯片采用拼接合成技术,通过组合录制好的语音单元(如双音素)生成类人的语音输出。这项技术后来被应用于DECtalk文本转语音系统,为残障人士提供高质量的合成语音。
现代文本转语音系统
近年来,一项重要创新是利用神经网络生成合成语音。Google、Microsoft等公司开发了基于深度学习算法的高质量TTS系统,能够分析海量人声数据,生成自然流畅的语音输出。
在辅助技术领域,TTS的另一项关键进展是单元选择和拼接合成技术的应用。通过拼接预先录制的语音单元(如双音素,甚至完整词汇),系统能够输出更真实、更自然的语音。这些技术已被广泛用于Speechify、苹果Siri、亚马逊Alexa等主流TTS应用,以及IBM ViaVoice等早期工具中。
近年来,语音识别技术也取得了长足进步,让TTS系统变得更加智能。将语音识别算法与TTS系统结合后,合成语音中的过渡也能更加自然。
近些年,韵律和语调的融合也取得了进展,为输出语音加入停顿、重音和语气。对于英语这类重音和语调都很关键的语言来说,韵律特征尤为重要,因为它们会明显影响句意表达。
深度学习与未来技术展望
TTS技术的未来值得期待。随着人工智能和深度学习的不断应用,合成语音将更加自然,也更能模拟人类语音中的细微变化。
这一领域一个极具潜力的应用方向,是虚拟助手和聊天机器人的开发。这些系统会更具对话感,用户与它们的互动也会更加自然。
此外,语音到音素转换(音标转写)领域也将持续进步。随着机器识别和理解人类语音的能力不断提升,语音转文本系统的准确率和效率也会继续优化。
最后,文本转语音技术会变得更加普及,并进一步融入我们的日常生活。随着更多设备接入物联网,用户将能通过语音实时控制设备,让生活更加便捷高效。
与 Speechify 一起拥抱文本转语音变革
如果你正在寻找一款能够生成自然、高质量旁白效果的文本转语音服务,那么Speechify值得一试。
Speechify 采用先进的共振峰合成技术,可生成逼真自然的语音效果,告别传统的机器人声。即使是像斯蒂芬·霍金这样曾接触过文本转语音技术的知名人物,也可能会对 Speechify 的表现感到惊艳。
Speechify 使用起来很简单——只需访问官方网站或下载手机应用,输入所需文本,选择合适的语音风格,再调整语速和音调即可。Speechify 可为在线学习、演示视频、播客和演讲生成出色的自然旁白。你还可以从大量自然的AI音色中进行选择,用于YouTube和社交媒体内容。
别再将就普通的TTS服务——立即体验 Speechify,感受文本转语音技术的未来。
常见问题
谁发明了世界上第一台语音合成器?
20世纪30年代初,荷马·达德利在纽约贝尔实验室设计了世界上第一台语音合成器。
语音合成的主要用途是什么?
语音合成的目的是通过语言处理和基频分析,将文本生成为人工语音。
TTS 有哪四种应用方式?
TTS 可用于无障碍辅助、娱乐、语言学习和语音服务自动化。
文本转语音有哪些优势?
文本转语音可以提升无障碍体验、促进学习,还能让用户通过听来高效获取书面内容,从而提高生产力。
文本转语音合成发展过程中最令人惊讶的时刻是什么?
文本转语音合成发展史上最令人惊讶的时刻之一,就是查尔斯·惠斯通机械语音合成器的诞生。

