오디오 AI 가이드

MusicLM: 계층적 의미 체계 및 음향 토큰

MusicLM은 음악 구조를 위한 의미 체계 토큰과 사운드 세부 사항을 위한 음향 토큰의 계층 구조를 통해 긴 형식의 오디오를 생성하는 Google의 텍스트-음악 모델입니다.

2분 읽기마지막 업데이트

심층 분석

2023년 초 Google 연구에서 발표한 MusicLM은 언어 모델이 단어를 예측하는 것과 마찬가지로 개별 오디오 토큰의 시퀀스를 예측하여 음악 생성을 구성합니다. 이는 표현의 계층 구조를 사용합니다. 의미론적 토큰(w2v-BERT라는 모델의)은 장기간에 걸쳐 멜로디 및 리듬과 같은 상위 수준 구조를 캡처하는 반면, SoundStream 신경 코덱의 음향 토큰은 음색 및 질감과 같은 미세한 세부 사항을 캡처합니다. 첫 번째 단계에서는 텍스트 프롬프트에서 의미 체계 토큰을 생성한 다음 이후 단계에서는 해당 의미 체계에 따라 음향 세부 정보를 채웁니다. 텍스트 조절은 설명과 오디오가 동일한 공간에 있도록 훈련된 공동 음악 텍스트 임베딩인 MuLM/MuLan에서 제공됩니다. 이러한 단계적 접근 방식을 통해 MusicLM은 몇 초 후에 표류하는 대신 몇 분 동안 음악적 일관성을 유지할 수 있습니다.

기술적 통찰력

핵심 아이디어는 토큰 계층 구조 전체에서 텍스처와 구조를 분리하는 것입니다. 대략적인 의미 체계 토큰은 희박하고 느리게 변경되므로 Transformer는 큰 시퀀스 길이 없이 장기적인 형태를 모델링할 수 있습니다. 음향 토큰은 조밀하고 속도가 빠르지만 이미 고정된 의미 체계에 따라 예측만 하면 되므로 각 단계를 다루기 쉽습니다. SoundStream의 잔여 벡터 양자화는 최종 디코더가 24kHz 파형으로 다시 변환하는 계층형 음향 코드를 생성합니다.

전략적 영향

접근 및 도달

전사, 내레이션, 음성 인터페이스를 통해 접근성을 향상시킵니다.

비용 및 예산

미디어 팀은 더 적은 예산으로 세련된 오디오를 더 빠르게 출시할 수 있습니다.

속도와 규모

고객 대면 시스템은 음성 상호 작용을 더 큰 규모로 처리할 수 있습니다.

MusicLM의 미래: 계층적 의미 체계 및 음향 토큰

MusicLM의 계층적 토큰 접근 방식은 MusicGen 및 상업용 음악 도구와 같은 최신 시스템의 템플릿이 되었습니다. 더 엄격한 멜로디 조절(곡을 흥얼거리고 완전한 편곡을 얻음), 절과 코러스가 포함된 더 길고 완전한 구조의 노래, 악기와 키에 대한 더 나은 제어 가능성을 기대하세요. 까다로운 문제는 법적, 윤리적입니다. 교육 데이터 라이센스, 아티스트 동의, 생성된 오디오 워터마킹을 통해 인간이 만든 음악과 구별할 수 있도록 하는 것이 이제 배포의 핵심입니다.

실제 구현

서면 장면 설명을 영화나 예고편 악보로 전환합니다. '합창단과 함께하는 장대한 오케스트라 빌드'

이미지 캡션이나 미술 설치를 위한 그림 설명에 따라 배경 음악 생성

짧은 흥얼거리거나 휘파람 부는 멜로디를 완전한 악기 편곡으로 확장

광고 및 콘텐츠 제작자를 위해 다양한 템포와 분위기로 다양한 스톡 음악 트랙 제작

위험 및 가드레일

동의가 없으면 음성 오용 및 명의 도용 위험이 높아집니다.

악센트, 방언 또는 시끄러운 환경에서는 정확도가 떨어질 수 있습니다.

합성 오디오는 명확한 라벨링이 없으면 실제 음성으로 오인될 수 있습니다.

구현 로드맵

1

음성 캡처, 복제 및 재사용에 대한 명시적인 동의를 얻습니다.

2

다양한 화자와 배경 조건에서 품질을 테스트합니다.

3

사람이 출력을 검토하거나 승인해야 하는 시기를 정의합니다.

4

합성 오디오에 라벨을 붙이고 책임을 묻기 위해 출처 기록을 보관하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

상징적 음악 세대

자주 묻는 질문

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM은 음악 구조를 위한 의미 체계 토큰과 사운드 세부 사항을 위한 음향 토큰의 계층 구조를 통해 긴 형식의 오디오를 생성하는 Google의 텍스트-음악 모델입니다.

MusicLM은 음악 생성 작업을 근본적으로 어떻게 처리합니까?

MusicLM은 언어 모델이 단어를 예측하는 방식과 유사하게 개별 오디오 토큰에 대한 자동 회귀 예측으로 음악 생성을 구성합니다.

MusicLM에서 시맨틱 토큰의 역할은 무엇입니까?

w2v-BERT의 시맨틱 토큰은 장기간에 걸쳐 멜로디 및 리듬과 같이 거칠고 느리게 변화하는 구조를 캡처합니다.

음색이나 질감과 같은 미세한 음향 디테일을 제공하는 구성 요소는 무엇입니까?

음향 토큰은 SoundStream 신경 코덱에서 나오며 음색 및 질감과 같은 미세한 세부 사항을 인코딩합니다.

MusicLM은 텍스트 프롬프트를 음악 오디오에 어떻게 연결합니까?

MuLan은 텍스트 설명과 일치하는 오디오 매핑이 공유 임베딩 공간의 인근 지점에 매핑되도록 훈련되어 텍스트 조절이 가능합니다.

계층적, 단계적 설계가 장거리 구조에 도움이 되는 이유는 무엇입니까?

희소 의미 체계 토큰은 천천히 변경되므로 Transformer는 조밀한 음향 세부 정보가 채워지기 전에 장기적인 형태를 효율적으로 모델링할 수 있습니다.