音频人工智能指南

韵律建模

韵律建模教机器语音的旋律、节奏、音调、重音和基于单词的节奏。

阅读时间:2分钟最后更新

概述

It is what separates a flat robotic voice from one that sounds genuinely human.

深入探讨

韵律是语言的音乐:音调的升降(语调)、声音的持续时间(持续时间)、响度(能量)以及强调的位置。这些线索所传达的意义是单独的词语所没有的,表明问题与陈述、讽刺、紧迫性或哪个词很重要。现代文本转语音系统使用神经网络对韵律进行建模,神经网络可以预测文本的音高轮廓、音素持续时间和能量。 Tacotron 2 通过注意力隐式地学习到了大部分内容,而 FastSpeech 2 通过预测持续时间、音调和能量作为单独的可训练特征来明确地学习到这一点。好的韵律取决于系统无法仅从标点符号获得的上下文,这就是为什么模型越来越多地使用周围的句子甚至参考音频来设置正确的语气。

技术洞察

音调被跟踪为声音的基频 (F0),即声带振动的速率。像 FastSpeech 2 这样的模型添加了一个方差适配器,可以将 F0、能量和每个音素的持续时间预测为单独的流,然后根据它们调节频谱图解码器。由于文本不确定韵律(一个句子有许多有效的读数),这是一个一对多的问题,因此系统使用变分潜伏或参考编码器来选择特定的传递,而不是平均为单调。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

韵律建模的未来

Prosody 正在朝着整个段落和对话的上下文感知方向发展,因此叙述者可以营造紧张气氛,或者聊天机器人可以匹配用户的情绪。大型语音和语言模型正在学习韵律和意义,通过纯文本指令实现强调、情感和说话风格的可控旋钮。期待有声读物、配音和助手自然地改变交付方式,再加上对不流畅和呼吸的更好控制,以跨越恐怖谷的最后一段。

现实世界的实施

有声读物旁白系统可以改变音调和节奏,使章节听起来富有表现力而不是单调

虚拟助理在是/否问题结束时提高语调,因此听起来显然像是一个问题

与原演员表演的重点和节奏相匹配的电影和视频配音工具

屏幕阅读器可强调关键词,以便盲人用户更快地掌握句子含义

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prosody Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

XLNet 排列建模

常见问题

What is Prosody Modeling?

韵律建模教机器语音的旋律、节奏、音调、重音和基于单词的节奏。这就是平淡的机器人声音与真正的人类声音的区别。

哪组特征最能描述语音韵律?

韵律是指位于单词之上的语音、语调(音调)、节奏和持续时间、重音和能量(响度)的超音段品质。

在韵律建模中,基频(F0)代表什么?

F0 是发声的基频,即声带的振动率,我们听到的就是声音的音高或旋律。

FastSpeech 2 与早期模型相比如何改进韵律控制?

FastSpeech 2 引入了一个方差适配器,可以显式地预测持续时间、音高和能量,比纯粹的隐式注意力对韵律进行更直接、更稳定的控制。

为什么仅从文本预测韵律被认为是一对多问题?

根据意图和情感,相同的单词可以有无数种方式表达,因此模型必须在许多有效的韵律读数中进行选择,而不是计算单个答案。

哪个提示最直接地表明英语口语句子是是/否问题?

英语中的“是/否”问题通常以升调结尾,这是一种韵律提示,可以将它们与陈述(即使是相同单词)区分开来。