MusicLM: Mã thông báo ngữ nghĩa và âm thanh phân cấp
MusicLM là mô hình chuyển văn bản thành nhạc của Google tạo ra âm thanh dạng dài thông qua hệ thống phân cấp mã thông báo ngữ nghĩa cho cấu trúc âm nhạc và mã thông báo âm thanh cho chi tiết âm thanh.
Lặn sâu
Được công bố bởi Google Nghiên cứu vào đầu năm 2023, MusicLM định hình việc tạo nhạc là dự đoán chuỗi các mã thông báo âm thanh riêng biệt, giống như một mô hình ngôn ngữ dự đoán các từ. Nó sử dụng một hệ thống biểu diễn phân cấp: mã thông báo ngữ nghĩa (từ mô hình có tên w2v-BERT) ghi lại cấu trúc cấp cao như giai điệu và nhịp điệu trong khoảng thời gian dài, trong khi mã thông báo âm thanh (từ codec thần kinh SoundStream) ghi lại các chi tiết nhỏ như âm sắc và kết cấu. Giai đoạn đầu tiên tạo mã thông báo ngữ nghĩa từ dấu nhắc văn bản, sau đó các giai đoạn sau sẽ điền chi tiết âm thanh dựa trên các ngữ nghĩa đó. Điều hòa văn bản đến từ MuLM/MuLan, một phương pháp nhúng văn bản-âm nhạc chung được đào tạo để mô tả và âm thanh nằm trong cùng một không gian. Cách tiếp cận theo giai đoạn này cho phép MusicLM duy trì tính nhất quán về mặt âm nhạc trong vài phút thay vì trôi đi sau vài giây.
Hiểu biết kỹ thuật
Ý tưởng chính là tách cấu trúc khỏi kết cấu trên hệ thống phân cấp mã thông báo. Các mã thông báo ngữ nghĩa thô rất thưa thớt và thay đổi chậm, do đó, Transformer có thể mô hình hóa dạng dài hạn mà không cần độ dài chuỗi lớn. Mã thông báo âm thanh dày đặc và có tốc độ cao, nhưng chúng chỉ cần được dự đoán dựa trên ngữ nghĩa đã cố định, giúp mỗi giai đoạn có thể thực hiện được. Lượng tử hóa vectơ dư của SoundStream tạo ra các mã âm thanh phân lớp mà bộ giải mã cuối cùng chuyển trở lại dạng sóng 24 kHz.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Âm nhạcLM: Mã thông báo ngữ nghĩa và âm thanh phân cấp
Cách tiếp cận mã thông báo phân cấp của MusicLM đã trở thành khuôn mẫu cho các hệ thống sau này như MusicGen và các công cụ âm nhạc thương mại. Mong đợi điều hòa giai điệu chặt chẽ hơn (ngâm nga một giai điệu, sắp xếp đầy đủ), các bài hát có cấu trúc đầy đủ dài hơn với các câu và điệp khúc cũng như khả năng kiểm soát nhạc cụ và phím tốt hơn. Các vấn đề nhức nhối là pháp lý và đạo đức: cấp phép dữ liệu đào tạo, sự đồng ý của nghệ sĩ và tạo hình mờ cho âm thanh để có thể phân biệt với âm nhạc do con người tạo ra hiện là trọng tâm của quá trình triển khai.
Triển khai trong thế giới thực
Chuyển mô tả cảnh bằng văn bản thành điểm phim hoặc đoạn giới thiệu, ví dụ: 'dàn nhạc hoành tráng với dàn hợp xướng'
Tạo nhạc nền dựa trên chú thích hình ảnh hoặc thậm chí là mô tả bức tranh để sắp đặt nghệ thuật
Mở rộng giai điệu ngân nga hoặc huýt sáo ngắn thành một bản phối nhạc cụ đầy đủ
Sản xuất các bản nhạc stock đa dạng ở nhịp độ và tâm trạng khác nhau cho người tạo quảng cáo và nội dung
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Thế hệ âm nhạc tượng trưng
Câu hỏi thường gặp
What is MusicLM: Hierarchical Semantic and Acoustic Tokens?
MusicLM là mô hình chuyển văn bản thành nhạc của Google tạo ra âm thanh dạng dài thông qua hệ thống phân cấp mã thông báo ngữ nghĩa cho cấu trúc âm nhạc và mã thông báo âm thanh cho chi tiết âm thanh.
Về cơ bản, MusicLM xử lý nhiệm vụ tạo ra âm nhạc như thế nào?
MusicLM định hình việc tạo nhạc là dự đoán tự hồi quy đối với các mã thông báo âm thanh riêng biệt, tương tự như cách mô hình ngôn ngữ dự đoán các từ.
Vai trò của mã thông báo ngữ nghĩa trong MusicLM là gì?
Mã thông báo ngữ nghĩa (từ w2v-BERT) nắm bắt cấu trúc thô, thay đổi chậm như giai điệu và nhịp điệu trong một khoảng thời gian dài.
Thành phần nào cung cấp chi tiết âm thanh tốt như âm sắc và kết cấu?
Mã thông báo âm thanh đến từ codec thần kinh SoundStream và mã hóa các chi tiết tinh tế như âm sắc và kết cấu.
MusicLM kết nối lời nhắc văn bản với âm thanh âm nhạc bằng cách nào?
MuLan được đào tạo để mô tả văn bản và khớp bản đồ âm thanh với các điểm lân cận trong không gian nhúng chung, cho phép điều chỉnh văn bản.
Tại sao thiết kế phân cấp, theo giai đoạn lại giúp ích cho cấu trúc tầm xa?
Các mã thông báo ngữ nghĩa thưa thớt thay đổi chậm, do đó, Máy biến áp có thể lập mô hình dạng dài hạn một cách hiệu quả trước khi chi tiết âm thanh dày đặc được lấp đầy.