波网
WaveNet 是 DeepMind 于 2016 年推出的一种突破性神经网络,它一次生成一个原始音频样本,产生极其自然的语音和音乐。
概述
It set the modern standard for high-fidelity text-to-speech.
深入探讨
WaveNet 是一种自回归生成模型:它根据之前的所有样本来预测每个音频样本,通常每秒 16,000 或 24,000 个样本。它的核心创新是一堆扩张因果卷积。因果意味着模型只回顾时间,保留生成顺序;膨胀意味着每一层都会跳过呈指数增长的样本数量,因此适度的堆栈可以覆盖数千个样本(宽广的感受野),而无需巨大的成本。以语言特征或梅尔频谱图为条件,WaveNet 产生的语音比之前的串联和参数声码器更加自然,缩小了与人类录音的大部分差距,并为 Google Assistant 的早期版本提供支持。
技术洞察
扩张卷积是关键技巧:扩张率为 1、2、4、8 等,仅数十层深的网络就可以处理数千个过去的样本,捕获精细的波形细节和更长的韵律结构。输出将每个样本的值建模为分类分布(最初通过 mu-law 压扩为 256 个级别),门控激活单元加上残差和跳过连接稳定了这个非常深的堆栈的训练。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
WaveNet 的未来
最初的 WaveNet 速度很慢,因为采样是连续的。后继者解决了这个问题:并行 WaveNet 和 WaveRNN 支持实时合成,后来基于流和 GAN 的声码器(如 WaveGlow 和 HiFi-GAN)以及扩散声码器进一步提高了质量和速度。 WaveNet 的自回归、扩张卷积思想在这些系统中得到了延续,并影响了音频之外的架构,巩固了其在生成建模领域的遗产。
现实世界的实施
为 Google 助手和 Google 云文本转语音生成自然的声音
充当神经声码器,将梅尔频谱图转换为 TTS 管道(如 Tacotron 2)中的波形
从原始音频合成逼真的钢琴和器乐
用于辅助工具和有声读物旁白的语音合成
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is WaveNet?
WaveNet 是 DeepMind 于 2016 年推出的一种突破性神经网络,它一次生成一个原始音频样本,产生极其自然的语音和音乐。它为高保真文本转语音设定了现代标准。
WaveNet 如何生成音频?
WaveNet 是自回归的:它根据之前的样本来预测每个音频样本。
WaveNet 的关键卷积创新是什么?
扩张因果卷积使网络能够有效地覆盖数千个过去的样本,同时仅向后查看时间。
为什么膨胀对 WaveNet 有帮助?
指数级增加的膨胀率可以为数千个具有相对较少层数的样本提供较宽的感受野。
最初的 WaveNet 的主要实际缺点是什么?
由于每个样本都依赖于之前的样本,因此生成是连续的,因此速度很慢,这激励了 Parallel WaveNet 和其他后继者。
在文本到语音的管道中,WaveNet 通常起什么作用?
WaveNet 可以获取梅尔频谱图(例如,来自 Tacotron 2)并生成最终的自然声音波形。