máy hát tự động
Jukebox là mạng thần kinh năm 2020 của OpenAI tạo ra âm thanh nhạc thô — hoàn chỉnh với giọng hát, nhạc cụ và thậm chí cả lời bài hát theo phong cách của các nghệ sĩ cụ thể.
Tổng quan
Đây là một bằng chứng quan trọng rằng AI có thể mô phỏng hình dạng sóng thực tế của nhạc dài bằng bài hát, không chỉ là các nốt nhạc.
Lặn sâu
Được phát hành bởi OpenAI vào tháng 4 năm 2020, Jukebox tạo ra âm nhạc dưới dạng âm thanh thô chứ không phải các nốt tượng trưng, nghĩa là nó tạo ra âm thanh thực tế bao gồm cả giọng hát. Nó được đào tạo dựa trên khoảng 1,2 triệu bài hát (khoảng một nửa là tiếng Anh) được lấy từ web, kết hợp với lời bài hát và siêu dữ liệu từ LyricWiki. Bạn có thể đặt điều kiện cho nó dựa trên thể loại, phong cách nghệ sĩ và lời bài hát, và nó sẽ hát một cách dễ nhận biết (nếu mơ hồ) giống như nghệ sĩ đó. Đầu ra chạy dài vài phút. Điều đáng chú ý là tốc độ và độ trung thực: quá trình tạo cực kỳ chậm, mất khoảng chín giờ để hiển thị một phút âm thanh và kết quả là chất lượng bị bóp nghẹt, ồn ào. Jukebox là một nghiên cứu, không phải một sản phẩm bóng bẩy, nhưng nó định hình lại những kỳ vọng về những gì có thể xảy ra.
Hiểu biết kỹ thuật
Jukebox nén âm thanh thô bằng bộ mã hóa tự động VQ-VAE ở độ phân giải ba lần, biến dạng sóng dài thành chuỗi mã rời rạc ngắn hơn nhiều. Sau đó, Bộ biến đổi tự động dự đoán lần lượt các mã này tùy thuộc vào nghệ sĩ, thể loại và lời bài hát, đồng thời bộ lấy mẫu bổ sung sẽ thêm chi tiết tần số cao. Việc giải mã các mã cấp dưới trở lại dạng sóng 44,1 kHz là nguyên nhân khiến quá trình tạo trở nên chậm chạp vì hàng triệu mẫu âm thanh phải được tạo ra tuần tự.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Jukebox
Bản thân Jukebox giờ đây phần lớn đã là một cột mốc lịch sử, được thay thế bằng các mô hình âm thanh tiềm ẩn và khuếch tán nhanh hơn giống như các mô hình đằng sau Suno và Udio tạo ra các bài hát có chất lượng gần như CD chỉ trong vài giây. Ý tưởng cốt lõi của nó – mã thông báo âm thanh riêng biệt và điều chỉnh lời bài hát – vẫn tồn tại trong các hệ thống hiện đại. Mong đợi các mẫu âm thanh thô trong tương lai sẽ tiếp tục rút ngắn thời gian tạo, làm sắc nét giọng hát và bổ sung các điều khiển tốt, trong khi các câu hỏi về bản quyền mà Jukebox lần đầu tiên nêu ra về việc đào tạo về các bản ghi âm có bản quyền chỉ ngày càng lớn hơn.
Triển khai trong thế giới thực
Các nhà nghiên cứu đang nghiên cứu cách mạng lưới thần kinh có thể mô hình hóa âm thanh thô và giọng hát dạng dài, sử dụng Jukebox làm kiến trúc tham chiếu.
Các nhạc sĩ và những người có sở thích tạo ra những 'bản cover AI' kỳ lạ, lo-fi hát lời bài hát mới theo phong cách thô của một nghệ sĩ đã chọn.
Các nhà giáo dục thể hiện bước nhảy vọt từ việc tạo nốt theo phong cách MIDI sang tổng hợp âm thanh thô hoàn chỉnh bằng giọng hát.
Các nhà thiết kế âm thanh và nghệ sĩ thử nghiệm khai thác các kết cấu mơ hồ, đẹp như mơ của Jukebox làm nguyên liệu thô cho việc phối lại và cắt dán.
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Thế hệ âm nhạc tượng trưng
Câu hỏi thường gặp
Jukebox là gì?
Jukebox là mạng thần kinh năm 2020 của OpenAI tạo ra âm thanh nhạc thô — hoàn chỉnh với giọng hát, nhạc cụ và thậm chí cả lời bài hát theo phong cách của các nghệ sĩ cụ thể. Đó là bằng chứng mang tính bước ngoặt cho thấy AI có thể mô hình hóa dạng sóng thực tế của âm nhạc có độ dài bài hát chứ không chỉ các nốt nhạc.
Điều gì khiến Jukebox khác biệt so với các hệ thống AI âm nhạc tượng trưng trước đó phát ra MIDI?
Jukebox mô hình hóa âm thanh thực tế của âm nhạc dưới dạng âm thanh thô, do đó, nó có thể tạo ra giọng hát và âm sắc của nhạc cụ, không giống như các hệ thống biểu tượng chỉ xuất ra dữ liệu nốt nhạc.
Ai đã phát hành Jukebox và khoảng khi nào?
OpenAI đã phát hành Jukebox vào tháng 4 năm 2020 dưới dạng mô hình nghiên cứu để tạo nhạc bằng giọng hát.
Hạn chế thực tế lớn của Jukebox là gì?
Vì giải mã từng mẫu âm thanh thô nên Jukebox phải mất chín giờ để tạo ra một phút âm nhạc, khiến việc sử dụng trong thời gian thực trở nên không thực tế.
Jukebox sử dụng kỹ thuật cốt lõi nào để giúp quản lý âm thanh thô dài cho Transformers của nó?
Jukebox sử dụng bộ mã hóa tự động VQ-VAE để nén dạng sóng thành các mã thông báo riêng biệt, sau đó Transformers sẽ lập mô hình tự động hồi quy trước khi lấy mẫu trở lại âm thanh.
Bạn có thể điều chỉnh đầu ra của Jukebox dựa trên điều gì?
Jukebox chấp nhận một thể loại, một nghệ sĩ để bắt chước, lời bài hát và sẽ cố gắng hát những lời đó theo phong cách đó.