HƯỚNG DẪN AI âm thanh

Thế hệ âm nhạc tượng trưng

Việc tạo nhạc tượng trưng tạo ra âm nhạc dưới dạng ký hiệu có cấu trúc — nốt, cao độ, thời lượng và thời gian (thường là MIDI) — thay vì dưới dạng âm thanh thô.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It gives composers editable, instrument-agnostic output they can tweak note by note.

Lặn sâu

Thay vì tạo ra dạng sóng hoàn chỉnh, hệ thống ký hiệu tạo ra 'điểm': chuỗi các nốt có cao độ, thời lượng, vận tốc và thời gian, thường ở dạng MIDI hoặc piano cuộn. Vì đầu ra mang tính biểu tượng nên nó hoàn toàn có thể chỉnh sửa được — bạn có thể thay đổi một nốt nhạc, hoán đổi nhạc cụ, phím chuyển cung hoặc giao nó cho người biểu diễn. Các dự án mang tính bước ngoặt bao gồm MelodyRNN và MusicVAE của Google Magenta, MuseNet (2019) của OpenAI, tạo ra các sáng tác nhiều nhạc cụ theo nhiều phong cách và tác phẩm Biến đổi âm nhạc đáng mong đợi. Sự đánh đổi giữa các công cụ âm thanh thô như Suno là các mô hình mang tính biểu tượng không tạo ra âm thanh thực tế hoặc giọng hát trung thực; họ cần một bộ tổng hợp hoặc bộ lấy mẫu để có thể nghe được. Nhưng chúng cung cấp độ chính xác, khả năng kiểm soát và các biểu diễn nhỏ, nhanh.

Hiểu biết kỹ thuật

Các mô hình này coi âm nhạc giống như một ngôn ngữ: các nốt nhạc (hoặc các sự kiện ghi chú chẳng hạn như 'nút bật', 'tắt nốt', dịch chuyển thời gian) trở thành mã thông báo và mô hình trình tự — trước đây là RNN/LSTM, giờ đây thường là Máy biến áp — dự đoán sự kiện tiếp theo. Một số sử dụng VAE để tìm hiểu không gian tiềm ẩn mượt mà để bạn có thể nội suy giữa các giai điệu. Vì chuỗi ký hiệu ngắn hơn hàng nghìn lần so với dạng sóng thô nên các mô hình này sẽ huấn luyện và tạo ra nhanh hơn nhiều so với mô hình âm thanh và đầu ra của chúng có thể chỉnh sửa trực tiếp trong bất kỳ phần mềm ký hiệu nào.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của thế hệ âm nhạc tượng trưng

Việc tạo biểu tượng ngày càng được kết hợp với âm thanh: Transformer tổng hợp bản nhạc, sau đó bộ tổng hợp thần kinh chất lượng cao hoặc bộ lấy mẫu sẽ kết xuất nó, kết hợp khả năng chỉnh sửa với âm thanh trung thực. Mong đợi sự tích hợp chặt chẽ hơn vào DAW và các công cụ ký hiệu với tư cách là người điều khiển phụ gợi ý hòa âm, điền vào các cách sắp xếp hoặc tiếp tục giai điệu theo yêu cầu. Khi khả năng kiểm soát được cải thiện, các nhạc sĩ có thể sẽ coi AI mang tính biểu tượng như một đối tác sáng tác tương tác, với đường dẫn âm thanh và biểu tượng sẽ thu hẹp khoảng cách với đầu ra chất lượng phòng thu.

Triển khai trong thế giới thực

Một nhà soạn nhạc sử dụng công cụ Google Màu đỏ tươi để tạo ra các ý tưởng về giai điệu hoặc hòa âm, sau đó họ chỉnh sửa từng nốt trong DAW.

Studio trò chơi tạo nhạc nền MIDI theo quy trình để thích ứng với lối chơi và được hiển thị bằng bất kỳ bộ nhạc cụ nào.

Phần mềm giáo dục âm nhạc tự động tạo các bài tập thực hành và đệm theo phím và độ khó đã chọn.

Một nhà sản xuất sử dụng các mô hình kiểu MuseNet để soạn thảo các cách sắp xếp nhiều nhạc cụ cho nhiều thể loại, sau đó tinh chỉnh và sắp xếp lại chúng.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Symbolic Music Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

MusicLM Thế hệ âm nhạc phân cấp

Câu hỏi thường gặp

What is Symbolic Music Generation?

Việc tạo nhạc tượng trưng tạo ra âm nhạc dưới dạng ký hiệu có cấu trúc — nốt, cao độ, thời lượng và thời gian (thường là MIDI) — thay vì dưới dạng âm thanh thô. Nó cung cấp cho các nhà soạn nhạc đầu ra có thể chỉnh sửa, không liên quan đến nhạc cụ, họ có thể điều chỉnh từng nốt một.

Thế hệ âm nhạc mang tính biểu tượng thực sự tạo ra điều gì?

Các hệ thống biểu tượng tạo ra 'điểm' - ghi chú các sự kiện như cao độ, thời lượng và thời gian - thay vì âm thanh thực tế.

Lợi thế chính của đầu ra tượng trưng so với việc tạo âm thanh thô là gì?

Bởi vì đầu ra là ký hiệu tượng trưng nên mọi nốt đều có thể chỉnh sửa và có thể được chuyển đổi, chỉnh lại nhạc cụ hoặc biểu diễn bởi con người.

Mô hình nào sau đây là mô hình âm nhạc biểu tượng nổi tiếng của OpenAI?

MuseNet (2019) đã tạo ra các tác phẩm biểu tượng đa nhạc cụ trên nhiều phong cách âm nhạc.

Các mô hình biểu tượng hiện đại thường xử lý âm nhạc bằng máy tính như thế nào?

Các mô hình tượng trưng mã hóa các sự kiện ghi chú (như ghi chú bật, tắt ghi chú, dịch chuyển thời gian) và sử dụng các mô hình trình tự như Transformers để dự đoán sự kiện tiếp theo.

Tại sao các mô hình biểu tượng thường huấn luyện và tạo ra nhanh hơn các mô hình âm thanh thô?

Một chuỗi ký hiệu nhỏ gọn hơn rất nhiều so với hàng triệu mẫu âm thanh, do đó các mô hình xử lý nó hiệu quả hơn nhiều.