音频人工智能指南

语音分离和鸡尾酒会问题

语音分离是将个人声音从几个人同时说话的录音中分离出来的任务。

阅读时间:2分钟最后更新

概述

It tackles the 'cocktail party problem' that humans solve effortlessly but machines find genuinely hard.

深入探讨

在喧闹的聚会上,你可以专注于一个对话,同时过滤掉其余的对话,心理学家科林·切里 (Colin Cherry) 在 1953 年将这种能力称为“鸡尾酒会问题”。计算机之所以会陷入困境,是因为重叠的声音会混合成单一波形,而且系统事先不知道有多少发言者,也不知道哪种声音属于谁。语音分离算法采用混合音频并为每个扬声器输出单独、干净的音轨。早期的方法使用统计方法和麦克风阵列来利用空间线索。突破来自于 Deep Clustering 和 TasNet/Conv-TasNet 等深度学习模型,它们学习直接从波形中屏蔽或重建每个语音,即使使用单个麦克风也是如此。

技术洞察

许多系统在学习或频谱图域中工作:神经网络估计每个说话者的“掩码”,当应用于混合物时,隔离该声音。像 Conv-TasNet 这样的时域模型完全跳过频谱图,并在原始样本上运行,以获得更高的保真度和更低的延迟。核心挑战是排列问题,决定哪个输出通道映射到哪个说话者,这是通过排列不变训练解决的,因此模型不会因输出排序而受到惩罚。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

语音分离的未来和鸡尾酒会问题

分离正在走向开放、现实世界的条件:未知且不断变化的扬声器数量、混响室和连续的音频流。目标说话人提取,即给模型一个简短的语音样本来提取那个人,正在快速增长。组合视听模型使用嘴唇运动来消除声音的歧义。这些功能预计会嵌入到助听器、耳塞和会议转录中,让设备聚焦您想听的人。

现实世界的实施

会议转录工具可将重叠的发言者分开,以便每个人的话语都在笔记中正确归属。

先进的助听器可以在拥挤的餐厅中隔离说话者,使佩戴者能够更轻松地交谈。

音乐和播客制作使用分离来将人声与乐器分开或理清主持人之间的串扰。

语音识别管道预先分离混合音频,以便可以准确转录每个语音。

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Separation and the Cocktail Party Problem quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Democs 音乐源分离

常见问题

What is Speech Separation and the Cocktail Party Problem?

语音分离是将个人声音从几个人同时说话的录音中分离出来的任务。它解决了“鸡尾酒会问题”,人类可以轻松解决,但机器却很难解决。

什么是“鸡尾酒会问题”?

它由科林·切里 (Colin Cherry) 于 1953 年创造,描述了当多人同时讲话时关注单个发言者的挑战。

考虑到多个说话者的混合录音,语音分离系统的输出是什么?

分离会为每个扬声器产生一股干净的声音流,从而理清混合物中重叠的声音。

Conv-TasNet 与许多早期的分离方法有何不同?

Conv-TasNet 在原始音频上使用学习编码器而不是固定的频谱图,从而实现高保真、低延迟的分离。

许多分离网络如何将单个声音从混合物中分离出来?

该模型预测每个说话者的掩码;将其应用到混合物中会保留说话者的内容并抑制其余内容。

什么是“目标说话人提取”?

您无需将每个人分开,而是提供语音提示,模型仅提取目标说话者。