音訊人工智慧指南

韻律建模

韻律建模教導機器語音的旋律、節奏、音調、重音和基於單字的節奏。

閱讀時間約2分鐘最後更新

概述

It is what separates a flat robotic voice from one that sounds genuinely human.

深入探討

韻律是語言的音樂:音調的升降(語調)、聲音的持續時間(持續時間)、響度(能量)以及強調的位置。這些線索所傳達的意義是單獨的字詞所沒有的,顯示問題與陳述、諷刺、緊迫性或哪個字很重要。現代文本轉語音系統使用神經網路對韻律進行建模,神經網路可以預測文本的音高輪廓、音素持續時間和能量。 Tacotron 2 透過注意力隱式地學習到了大部分內容,而 FastSpeech 2 透過預測持續時間、音調和能量作為單獨的可訓練特徵來明確地學習到這一點。好的韻律取決於系統無法僅從標點符號獲得的上下文,這就是為什麼模型越來越多地使用周圍的句子甚至參考音訊來設定正確的語氣。

技術洞察

音調被追蹤為聲音的基頻 (F0),即聲帶振動的速率。像 FastSpeech 2 這樣的模型添加了一個方差適配器,可以將 F0、能量和每個音素的持續時間預測為單獨的流,然後根據它們調節頻譜圖解碼器。由於文本不確定韻律(一個句子有許多有效的讀數),這是一個一對多的問題,因此系統使用變分潛伏或參考編碼器來選擇特定的傳遞,而不是平均為單調。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

韻律建模的未來

Prosody 正在朝著整個段落和對話的上下文感知方向發展,因此敘述者可以營造緊張氣氛,或者聊天機器人可以匹配用戶的情緒。大型語音和語言模型正在學習韻律和意義,透過純文字指令實現強調、情感和說話風格的可控旋鈕。期待有聲書、配音和助手自然地改變交付方式,再加上對不流暢和呼吸的更好控制,以跨越恐怖谷的最後一段。

現實世界的實施

有聲書旁白系統可以改變音調和節奏,使章節聽起來富有表現力而不是單調

虛擬助理在是/否問題結束時提高語調,因此聽起來顯然像是一個問題

與原始演員表演的重點和節奏相匹配的電影和視頻配音工具

螢幕閱讀器可強調關鍵字,以便盲人使用者更快掌握句子意義

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prosody Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

XLNet 排列建模

常見問題

What is Prosody Modeling?

韻律建模教導機器語音的旋律、節奏、音調、重音和基於單字的節奏。這就是平淡的機器人聲音與真正的人類聲音的差別。

哪一組特徵最能描述語音韻律?

韻律是指位於單字之上的語音、語調(音調)、節奏和持續時間、重音和能量(響度)的超音段品質。

在韻律建模中,基頻(F0)代表什麼?

F0 是發聲的基頻,也就是聲帶的振動率,我們聽到的就是聲音的音高或旋律。

FastSpeech 2 與早期模型相比如何改善韻律控制?

FastSpeech 2 引入了一個方差適配器,可以明確地預測持續時間、音高和能量,比純粹的隱式註意力對韻律進行更直接、更穩定的控制。

為什麼僅從文本預測韻律被認為是一對多問題?

根據意圖和情感,相同的單字可以以無數種方式表達,因此模型必須在許多有效的韻律讀數中進行選擇,而不是計算單一答案。

哪一個提示最直接顯示英語口說句子是是/否問題?

英語中的“是/否”問題通常以升調結尾,這是一種韻律提示,可以將它們與陳述(即使是相同單字)區分開來。