音频人工智能指南

树皮生成音频模型

Bark 是 Suno 的开源文本到音频模型,它不仅可以生成语音,还可以直接从文本提示生成笑声、叹息、音乐和声音效果。

阅读时间:2分钟最后更新

概述

It matters because it treats audio as one continuous creative medium rather than just narration.

深入探讨

Suno 于 2023 年发布的 Bark 打破了传统的文本到语音转换,将音频生成为一系列离散标记序列,就像语言模型生成单词一样。 Bark 不是只能产生干净语音的干净管道,而是可以用情感变化来表达句子,加入括号内的提示,如[笑]、[叹气]或[音乐],甚至哼一首曲子。它支持多种语言,并且可以在单个提示中在它们之间切换。因为它是完全生成性和概率性的,所以相同的提示每次都会产生不同的效果。代价是它可能会产生额外的声音或漂移,并且比专用 TTS 引擎更慢且更难以控制。它的吸引力在于富有表现力、栩栩如生且令人惊讶的人类音频。

技术洞察

Bark 使用 GPT 风格的架构,对音频令牌而不是原始波形进行操作。文本首先转换为粗略语义标记,然后转换为精细声学编解码器标记,最后由 Meta 的 EnCodec 神经编解码器解码为波形。因为它像语言模型一样自回归地预测标记,所以诸如[笑声]之类的非语言提示就变成了需要生成的更多标记,这就是它产生超出语音的声音的原因。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

树皮生成音频模型的未来

像 Bark 这样的生成音频模型预示着未来,任何文本,包括舞台指导和声音设计,都可以一次性变成音频。期望更快的实时变体、对语音和情感更严格的控制以及更强大的保护措施。 Suno 本身大力投入人工智能音乐生成,这表明基于代币的音频模型将越来越模糊统一系统中语音合成、音效和完整音乐创作之间的界限。

现实世界的实施

生成富有表现力的有声读物旁白,包括自然的笑声和情感停顿

无需聘请配音演员即可为原型应用程序制作多语言语音剪辑

为独立游戏和视频项目创建音效和环境音频提示

构建可访问的内容,其中包括非语言提示的文本可以自然地大声朗读

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bark Generative Audio Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

音频扩散模型

常见问题

What is Bark Generative Audio Model?

Bark 是 Suno 的开源文本到音频模型,它不仅可以生成语音,还可以直接从文本提示生成笑声、叹息、音乐和声音效果。这很重要,因为它将音频视为一种持续的创意媒介,而不仅仅是叙述。

Bark 与传统文本转语音引擎有何不同?

Bark 是一种生成音频模型,除了语音之外,还可以产生笑声、叹息、音乐和声音效果。

谁发布了 Bark 模型?

Bark 由 Suno 于 2023 年作为开源文本转音频模型发布。

Bark 从根本上是如何生成音频的?

Bark 预测音频标记序列,就像 GPT 风格的语言模型预测单词一样。

Bark 使用什么神经编解码器将标记转换为波形?

Bark 使用 Meta 的 EnCodec 神经编解码器将其精细的声学标记解码为波形。

为什么相同的 Bark 提示每次都会产生不同的结果?

由于 Bark 会概率性地生成标记,因此重复运行相同的提示会产生不同的效果。