오디오 AI 가이드

VALL-E 및 코덱 언어 모델

VALL-E는 오디오 코덱 토큰에 대한 언어 모델링 문제로 텍스트 음성 변환을 재구성하여 단 3초의 샘플에서 음성 복제를 가능하게 했습니다.

2분 읽기마지막 업데이트

개요

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

심층 분석

2023년 초 Microsoft에서 발표한 VALL-E는 음성 합성을 언어 모델링처럼 처리합니다. 스펙트로그램을 예측하는 대신 신경 코덱(EnCodec)의 개별 음향 토큰을 예측하므로 생성은 오디오 어휘에 대한 다음 토큰 예측이 됩니다. 보이지 않는 화자의 3초 녹음과 대상 텍스트가 주어지면 VALL-E는 해당 화자의 음성을 계속해서 음색과 음향 환경까지 보존합니다. 이는 일반적인 TTS 데이터 세트보다 훨씬 더 많은 약 60,000시간의 음성으로 훈련되어 강력한 제로샷 복제 기능을 제공합니다. 코덱 토큰은 RVQ를 통해 계층화되므로 VALL-E는 두 단계를 사용합니다. 즉, 자동 회귀 모델은 프롬프트에 따라 조정된 첫 번째 대략적인 토큰 스트림을 예측하고, 비자동 회귀 모델은 나머지 세부 토큰을 채웁니다. 이 코덱-LM 레시피는 VALL-E 2 및 많은 음성 기반 모델과 같은 후속 모델에 영감을 주었습니다.

기술적 통찰력

비결은 계층적 코덱 토큰에 대한 하이브리드 디코딩입니다. 자동 회귀 단계는 가장 중요한 첫 번째 코드북 토큰을 한 번에 하나씩 예측하여 운율과 내용을 캡처합니다. 미세한 음향 세부 정보를 추가하는 나머지 코드북은 첫 번째 스트림과 화자 프롬프트를 조건으로 한 비자동회귀 모델에 의해 병렬로 예측됩니다. 이러한 분할은 모든 토큰을 순차적으로 생성하는 비용을 피하면서 높은 품질을 유지하며, 코덱을 사용한다는 것은 음성과 텍스트가 동일한 변환기 기계로 모델링될 수 있음을 의미합니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

VALL-E 및 코덱 언어 모델의 미래

코덱 언어 모델은 음성을 대규모 언어 모델과 병합하여 하나의 모델에서 듣고 추론하고 말하는 통합 시스템을 지향합니다. 더 나은 안정성과 더 적은 아티팩트, 실시간 스트리밍 생성, 감정과 스타일에 대한 더 엄격한 제어를 기대하세요. 접근성 및 더빙에 VALL-E를 유용하게 만드는 동일한 강력한 복제는 딥페이크 및 동의에 대한 우려를 불러일으키므로 워터마킹, 음성 확인 보호 장치 및 정책 가드레일이 이러한 시스템 배포 방법의 핵심 부분이 되고 있습니다.

실제 구현

잃어버린 음성을 복원하는 맞춤형 보조자 또는 접근성 도구를 위해 몇 초의 오디오에서 음성 복제

원래 화자의 음색을 유지하면서 비디오를 다른 언어로 현지화하고 더빙합니다.

녹음의 음향 환경을 보존하는 표현력이 뛰어나고 상황에 맞는 내레이션 생성

음성 오디오를 이해하고 생성하는 다중 모드 어시스턴트에서 음성 백본 역할을 합니다.

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

대규모 언어 모델의 새로운 능력

자주 묻는 질문

What is VALL-E and Codec Language Models?

VALL-E는 오디오 코덱 토큰에 대한 언어 모델링 문제로 텍스트 음성 변환을 재구성하여 단 3초의 샘플에서 음성 복제를 가능하게 했습니다. 텍스트 LLM을 지원하는 동일한 다음 토큰 예측이 매우 자연스럽고 표현력이 풍부한 음성을 생성할 수 있음을 보여주었습니다.

VALL-E가 이전의 텍스트 음성 변환 시스템과 구별되는 핵심 아이디어는 무엇입니까?

VALL-E는 TTS를 개별 오디오 코덱 토큰에 대한 다음 토큰 예측으로 재구성하여 음성 생성을 언어 모델처럼 처리합니다.

VALL-E가 새로운 화자의 음성을 복제하려면 얼마나 많은 참조 오디오가 필요합니까?

VALL-E는 보이지 않는 화자의 약 3초 샘플에서 제로샷 음성 복제를 수행할 수 있습니다.

VALL-E는 오디오 토큰을 생성하기 위해 어떤 신경 코덱을 사용합니까?

VALL-E는 Meta의 EnCodec을 기반으로 하며 음성을 합성하기 위해 개별 음향 토큰을 예측합니다.

VALL-E가 자기회귀 단계와 비자기회귀 단계를 모두 사용하는 이유는 무엇입니까?

코덱 토큰은 RVQ를 통해 계층적입니다. VALL-E는 효율성을 위해 첫 번째 대략적인 스트림을 자동 회귀적으로 예측하고 나머지 세부 토큰을 병렬로 예측합니다.

강력한 제로샷 복제를 가능하게 하기 위해 VALL-E가 훈련된 음성 데이터의 양은 대략 얼마나 됩니까?

VALL-E는 일반적인 TTS 데이터세트보다 훨씬 많은 약 60,000시간의 음성 훈련을 통해 제로샷 일반화를 강화했습니다.