오디오 AI 가이드

DDSP 미분 오디오 합성

DDSP(미분 디지털 신호 처리)는 기존 합성기 빌딩 블록을 신경망과 융합하므로 딥 러닝을 통해 발진기와 필터를 직접 제어할 수 있습니다.

2분 읽기마지막 업데이트

개요

It produces strikingly natural, controllable instrument sounds with tiny models and little data.

심층 분석

Google의 Magenta 팀이 2020년에 도입한 DDSP는 신경 오디오 생성을 다시 생각합니다. 한 번에 하나씩 원시 오디오 샘플(예: WaveNet)이나 스펙트로그램의 픽셀을 예측하는 네트워크 대신 DDSP는 기존 DSP 구성 요소(고조파 추가 발진기, 필터링된 잡음 생성기, 잔향)를 차별화 가능하게 만듭니다. 이는 훈련 중에 경사도가 흐를 수 있음을 의미하므로 작은 신경망은 해석 가능한 제어 신호(기본 피치, 전체 소리 크기 및 시간에 따른 수십 개의 고조파 진폭)를 출력하는 방법을 학습합니다. 그러면 신디사이저가 이러한 컨트롤에서 실제 오디오를 렌더링합니다. 소리의 물리학은 처음부터 학습하는 것이 아니라 아키텍처에 적용되기 때문에 DDSP는 훨씬 적은 수의 매개변수와 훈련 예제를 사용하여 고품질을 달성하고 사용자가 피치, 음량 및 음색을 독립적으로 조작할 수 있도록 합니다. 바이올린으로 노래하는 목소리를 연주하는 것과 같은 음색 전송도 수행할 수 있습니다.

기술적 통찰력

핵심은 스펙트럼 모델링 신디사이저입니다. 고조파 발진기 뱅크는 기본 주파수의 정수배에서 사인파의 합을 생성하는 반면, 별도의 경로는 숨소리와 부조화 텍스처를 위해 백색 잡음을 필터링합니다. 신경망은 오디오를 직접 출력하지 않습니다. 시간에 따라 변하는 제어 매개변수(f0, 음량, 고조파 분포, 필터 계수)를 출력합니다. 훈련에서는 여러 FFT 창 크기에 걸쳐 생성된 오디오와 대상 오디오를 비교하는 다중 스케일 스펙트로그램 손실을 사용하며 이는 위상차에 강합니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

DDSP 미분 오디오 합성의 미래

DDSP는 브라우저 내 및 임베디드 장치를 포함하여 일반 하드웨어에서 실행되는 실시간 저지연 신경 기기 및 오디오 효과를 추진하고 있습니다. 해석 가능한 컨트롤은 표현력이 풍부한 연주 도구와 음악가가 음색을 직접 조정하는 하이브리드 신디사이저에 이상적입니다. 연구자들은 미분 가능한 DSP 아이디어를 물리적 모델링, 실내 음향 및 전체 오디오 제작 체인으로 확장하여 음악 제작 및 사운드 디자인 전반에 걸쳐 클래식 신호 처리의 제어 가능성과 딥 러닝의 현실성을 혼합하고 있습니다.

실제 구현

흥얼거리거나 노래하는 멜로디를 실시간으로 바이올린, 플루트 또는 트럼펫으로 다시 렌더링하는 음색 전송 도구입니다.

음악가가 직관적인 피치, 음량 및 밝기 노브로 제어할 수 있는 경량 신경 신디사이저 플러그인입니다.

자연스러운 하모닉 디테일을 유지하면서 녹음된 악기의 피치 교정 및 표현력 있는 재합성.

무거운 GPU 모델 없이 사실적인 악기 사운드를 생성하는 브라우저 기반 대화형 음악 데모입니다.

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDSP Differentiable Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

AudioGen 텍스트-오디오 합성

자주 묻는 질문

What is DDSP Differentiable Audio Synthesis?

DDSP(미분 디지털 신호 처리)는 기존 합성기 빌딩 블록을 신경망과 융합하므로 딥 러닝을 통해 발진기와 필터를 직접 제어할 수 있습니다. 작은 모델과 적은 데이터로 놀랍도록 자연스럽고 제어 가능한 악기 사운드를 생성합니다.

DDSP의 핵심 혁신은 무엇입니까?

DDSP는 기존 합성기 빌딩 블록을 차별화 가능한 모듈로 변환하여 신경망이 역전파를 통해 이를 제어하는 ​​방법을 학습할 수 있도록 합니다.

DDSP에서 신경망은 실제로 무엇을 출력합니까?

네트워크는 시간에 따라 변하는 제어 매개변수를 예측하고, 별도의 미분 가능한 신디사이저는 이 매개변수로부터 오디오를 렌더링합니다. 결코 샘플을 직접 출력하지 않습니다.

DDSP의 스펙트럼 신디사이저는 어떤 두 가지 핵심 사운드 생성 구성 요소를 결합합니까?

고조파 가산 발진기는 음높이의 고조파 부분을 생성하는 반면, 필터링된 노이즈는 숨결과 불협화음 질감을 추가합니다.

DDSP가 상대적으로 작은 모델과 적은 데이터로 높은 품질을 달성할 수 있는 이유는 무엇입니까?

알려진 신호 처리 구조는 처음부터 학습하는 것이 아니라 내장되어 있으므로 네트워크에서 학습할 내용이 훨씬 적어 데이터 및 매개변수 효율성이 향상됩니다.

DDSP는 생성된 오디오와 대상 오디오를 확실하게 비교하기 위해 어떤 손실 기능을 사용합니까?

여러 해상도에서 크기 스펙트로그램을 비교하는 것은 샘플 수준 손실로 인해 어려움을 겪는 위상차에 강력합니다.