HƯỚNG DẪN AI âm thanh

Âm nhạcGen

MusicGen là mô hình AI của Meta tạo ra âm nhạc từ mô tả văn bản và tùy chọn giai điệu mà bạn ngân nga hoặc tải lên.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Lặn sâu

Được phát hành bởi Meta AI vào năm 2023 như một phần của dự án AudioCraft, MusicGen biến những lời nhắc như "một bản nhạc synth-pop sôi động của thập niên 80 với âm trầm sôi động" thành các đoạn nhạc dài khoảng 12 giây (có thể kéo dài). Không giống như các hệ thống nhiều giai đoạn, MusicGen sử dụng một mô hình ngôn ngữ Transformer duy nhất để dự đoán mã thông báo âm thanh được tạo bởi bộ giải mã thần kinh EnCodec của Meta. Đóng góp thông minh của nó là mô hình xen kẽ mã thông báo (được gọi là xen kẽ độ trễ) cho phép một mô hình xử lý nhiều luồng mã thông báo song song của EnCodec một cách hiệu quả, tránh việc xếp chồng các mô hình riêng biệt mà các phương pháp tiếp cận trước đó cần thiết. MusicGen có thể được điều khiển theo hai cách cùng một lúc: bằng mô tả văn bản và bằng giai điệu tham chiếu, vì vậy bạn có thể yêu cầu 'phiên bản jazz' của giai điệu mà bạn ngân nga. Meta đã phát hành mã và trọng số một cách công khai, thúc đẩy làn sóng thử nghiệm và công cụ cộng đồng.

Hiểu biết kỹ thuật

MusicGen thể hiện âm thanh dưới dạng các luồng song song của các mã thông báo riêng biệt từ codec EnCodec, mỗi luồng ghi lại các chi tiết khác nhau. Thay vì lập mô hình các luồng bằng các mô hình riêng biệt, MusicGen xen kẽ chúng với độ trễ được kiểm soát để một Transformer tự hồi quy duy nhất dự đoán chúng trong một lần truyền. Điều hòa văn bản đến từ bộ mã hóa văn bản T5, trong khi điều hòa giai điệu tùy chọn sử dụng sắc ký đồ (cấu hình cấp cao độ của âm thanh) để mô hình tuân theo giai điệu mà không sao chép bản ghi chính xác của nó.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của âm nhạcGen

Bản phát hành mở của MusicGen đặt ra một tiêu chuẩn cơ bản mà các phiên bản kế nhiệm nhắm tới với đầu ra âm thanh nổi dài hơn, độ trung thực cao hơn, cùng với khả năng kiểm soát tốt hơn đối với cấu trúc, nhạc cụ và các phần bài hát. Mong đợi sự tích hợp chặt chẽ hơn vào phần mềm sản xuất âm nhạc, tạo tương tác theo thời gian thực và các công cụ tốt hơn để chỉnh sửa hoặc mở rộng các bản nhạc hiện có. Giống như tất cả các loại nhạc sáng tạo, nó đặt ra các câu hỏi về bản quyền dữ liệu đào tạo, bồi thường cho nghệ sĩ và cách gắn nhãn các bài hát do AI tạo ra trong một thị trường tràn ngập.

Triển khai trong thế giới thực

Tạo nhạc nền miễn phí bản quyền cho video YouTube từ lời nhắc văn bản

Ngâm nga một giai điệu và yêu cầu MusicGen soạn lại giai điệu đó cho dàn nhạc đầy đủ

Các nhà phát triển trò chơi tạo mẫu nhạc nền ở nhiều thể loại khác nhau một cách nhanh chóng

Các nhà nghiên cứu và những người có sở thích chạy các ứng dụng nguồn mở để thử nghiệm tính năng chuyển văn bản thành nhạc

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Căn chỉnh bắt buộc

Câu hỏi thường gặp

What is MusicGen?

MusicGen là mô hình AI của Meta tạo ra âm nhạc từ mô tả văn bản và tùy chọn giai điệu mà bạn ngân nga hoặc tải lên. Nó quan trọng vì nó đặt việc tạo nhạc chất lượng cao, có thể kiểm soát được vào một mô hình duy nhất, được phát hành công khai mà những người có sở thích và nhà nghiên cứu thực sự có thể vận hành.

Hai loại đầu vào nào có thể điều khiển MusicGen cùng một lúc?

MusicGen chấp nhận lời nhắc văn bản và giai điệu tùy chọn, vì vậy bạn có thể yêu cầu phiên bản đầy phong cách của giai điệu mà bạn cung cấp.

Bộ giải mã thần kinh nào tạo ra mã thông báo âm thanh mà MusicGen dự đoán?

MusicGen mô hình hóa các mã thông báo riêng biệt được tạo bởi codec EnCodec của Meta, mã này cũng giải mã các mã thông báo được dự đoán trở lại thành âm thanh.

Sự đơn giản hóa kiến trúc quan trọng của MusicGen so với các phương pháp trước đó là gì?

Bằng cách xen kẽ các luồng mã thông báo song song của EnCodec với độ trễ được kiểm soát, một Transformer tự hồi quy có thể lập mô hình chúng trong một lần truyền duy nhất, tránh việc xếp chồng các mô hình.

Làm cách nào MusicGen tuân theo giai điệu được cung cấp mà không cần sao chép bản ghi chính xác?

Sắc ký ghi lại các loại cao độ hiện diện theo thời gian, cho phép MusicGen khớp với sự hài hòa và đường nét của giai điệu mà không tái tạo âm sắc ban đầu.

Dự án và công ty nào phát hành MusicGen?

MusicGen được phát hành vào năm 2023 như một phần của dự án AudioCraft của Meta AI, với mã mở và trọng lượng mô hình.