오디오 AI 가이드

말 분리와 칵테일 파티 문제

음성 분리는 여러 사람이 동시에 말하는 녹음에서 개별 음성을 분리하는 작업입니다.

2분 읽기마지막 업데이트

개요

It tackles the 'cocktail party problem' that humans solve effortlessly but machines find genuinely hard.

심층 분석

시끄러운 파티에서는 나머지 대화를 걸러내고 하나의 대화에만 집중할 수 있습니다. 이는 심리학자 Colin Cherry가 1953년에 '칵테일 파티 문제'라고 명명한 능력입니다. 컴퓨터는 겹치는 음성이 단일 파형으로 혼합되기 때문에 어려움을 겪으며, 시스템은 몇 명의 스피커가 존재하는지, 어떤 사운드가 누구에게 속하는지 미리 알 수 없습니다. 음성 분리 알고리즘은 혼합된 오디오를 가져와 각 스피커에 대해 별도의 깨끗한 트랙을 출력합니다. 초기 접근 방식에서는 통계적 방법과 마이크 배열을 사용하여 공간 단서를 활용했습니다. 단일 마이크를 사용하더라도 파형에서 직접 각 음성을 마스킹하거나 재구성하는 방법을 학습하는 Deep Clustering 및 TasNet/Conv-TasNet과 같은 딥 러닝 모델을 통해 획기적인 발전이 이루어졌습니다.

기술적 통찰력

많은 시스템은 학습된 영역이나 스펙트로그램 영역에서 작동합니다. 신경망은 혼합에 적용될 때 해당 음성을 격리하는 각 화자에 대한 '마스크'를 추정합니다. Conv-TasNet과 같은 시간 영역 모델은 스펙트로그램을 완전히 건너뛰고 원시 샘플에서 작동하여 충실도를 높이고 대기 시간을 줄입니다. 핵심 과제는 어떤 출력 채널이 어떤 화자에 매핑되는지 결정하는 순열 문제입니다. 이는 순열 불변 훈련으로 해결되므로 모델이 출력 순서에 대해 불이익을 받지 않습니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

말 분리의 미래와 칵테일 파티 문제

분리는 공개된 실제 조건, 즉 알 수 없고 변화하는 스피커 수, 잔향실 및 지속적인 스트리밍 오디오를 향해 나아가고 있습니다. 모델에 짧은 음성 샘플을 제공하여 해당 사람만 추출하는 대상 화자 추출이 빠르게 증가하고 있습니다. 결합된 시청각 모델은 입술 움직임을 사용하여 음성을 명확하게 합니다. 보청기, 이어버드, 회의 기록에 내장된 이러한 기능을 통해 듣고 싶은 사람을 장치에서 조명할 수 있습니다.

실제 구현

회의 기록 도구는 겹치는 화자를 분리하여 각 사람의 말이 노트에 올바르게 표시되도록 합니다.

고급 보청기는 붐비는 식당에서 말하는 사람 한 명을 격리하여 착용자가 대화를 더 쉽게 만듭니다.

음악 및 팟캐스트 제작에서는 분리를 사용하여 악기에서 보컬을 분리하거나 진행자 간의 혼선을 해결합니다.

음성 인식 파이프라인은 혼합된 오디오를 미리 분리하여 각 음성을 정확하게 기록할 수 있습니다.

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Separation and the Cocktail Party Problem quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

Demucs 음원 분리

자주 묻는 질문

What is Speech Separation and the Cocktail Party Problem?

음성 분리는 여러 사람이 동시에 말하는 녹음에서 개별 음성을 분리하는 작업입니다. 인간은 쉽게 풀 수 있지만 기계는 정말 어렵다고 생각하는 '칵테일 파티 문제'를 다루고 있습니다.

'칵테일 파티 문제'란 무엇인가?

1953년 Colin Cherry가 만든 이 용어는 많은 사람이 동시에 말할 때 한 명의 발표자에게 주의를 기울이는 어려움을 설명합니다.

여러 화자의 혼합 녹음이 있을 경우 음성 분리 시스템의 출력은 무엇입니까?

분리는 스피커당 하나의 깨끗한 스트림을 생성하여 혼합에서 겹치는 음성을 풀어줍니다.

Conv-TasNet은 이전의 많은 분리 방법과 어떻게 다른가요?

Conv-TasNet은 고정 스펙트로그램이 아닌 원시 오디오에 대해 학습된 인코더를 사용하여 충실도가 높고 대기 시간이 짧은 분리를 가능하게 합니다.

많은 분리 네트워크는 개별 음성을 혼합에서 어떻게 분리합니까?

모델은 화자당 마스크를 예측합니다. 이를 혼합물에 적용하면 해당 화자의 내용이 유지되고 나머지는 억제됩니다.

'대상화자 추출'이란?

모든 사람을 분리하는 대신 음성 신호를 제공하면 모델이 해당 대상 화자만 추출합니다.