HƯỚNG DẪN AI âm thanh

Mở rộng và tiếp tục âm nhạc AI

Tiện ích mở rộng âm nhạc AI sử dụng mô hình tổng hợp để tiếp tục một đoạn âm thanh hiện có, tạo lại một phần ở giữa (inpainting), tạo kiểu lại cho nó hoặc thêm và thay thế các thân nhạc cụ riêng lẻ.

  • đọc 4 phút
  • Cập nhật lần cuối
Trên trang nàyđọc 4 phút
  1. Tổng quan
  2. Lặn sâu
  3. Tác động chiến lược
  4. Tương lai của việc mở rộng và tiếp tục âm nhạc AI
  5. Triển khai trong thế giới thực
  6. Rủi ro & lan can
  7. Lộ trình thực hiện
  8. Tiếp tục khám phá
  9. Câu hỏi thường gặp

Tổng quan

Nó cho phép một ý tưởng ngắn phát triển thành một bản nhạc đầy đủ hoặc một bản nhạc thiếu sót được sửa chữa mà không cần ghi lại. Điều này quan trọng vì nó thay đổi cách mọi người soạn thảo và chỉnh sửa nhạc nhưng nó có giới hạn chất lượng rõ ràng và không loại bỏ quyền của bất kỳ ai sở hữu âm thanh gốc.

Lặn sâu

Tiện ích mở rộng lấy clip hiện có và tạo clip tiếp theo. Một cách tiếp cận phổ biến là tiếp tục tự thoái lui. MusicGen của Meta, được phát hành vào năm 2023 như một phần của AudioCraft, chuyển đổi âm thanh thành các mã thông báo rời rạc bằng một codec thần kinh có tên là EnCodec và dự đoán các mã thông báo tiếp theo sau mã thông báo bạn cung cấp, giống như mô hình ngôn ngữ tiếp tục một câu. Các dịch vụ tiêu dùng như Suno và Udio cung cấp tính năng này như một tính năng Mở rộng, thường cho phép bạn chọn điểm bắt đầu và thay đổi lời bài hát hoặc phong cách cho phần mới. Inpainting tái tạo vùng bị che ở giữa trong khi vẫn giữ được âm thanh ở cả hai bên, hữu ích cho việc sửa lời bài hát hoặc thay thế bốn ô nhịp. Các mô hình khuếch tán phù hợp với điều này vì âm thanh đã biết có thể được giữ cố định trong khi chỉ khoảng âm bị che được khử nhiễu. Các chế độ chuyển âm thanh thành âm thanh hoặc phối lại, giống như chế độ Stability AI được giới thiệu với Stable Audio 2.0 vào năm 2024, thêm một phần tiếng ồn vào đầu vào và tái tạo nó theo lời nhắc mới, nhờ đó cấu trúc vẫn tồn tại trong khi âm sắc và phong cách thay đổi. Cài đặt cường độ kiểm soát lượng bản gốc còn lại. Công việc gốc kết hợp sự phân tách và thế hệ. Các mô hình phân tách nguồn như Demucs mã nguồn mở của Meta phân chia hỗn hợp thành giọng hát, trống, âm trầm và các loại khác; sau đó máy phát điện có thể thêm hoặc thay thế một bộ phận được điều chỉnh trên phần còn lại. Các giới hạn là có thật. Độ lệch phần mở rộng dài: nhịp độ, phím, độ cân bằng phối âm và âm sắc giọng hát có thể bị lệch. Các tham gia có thể nhấp hoặc nhảy với âm lượng lớn. Người mẫu nhìn thấy một cửa sổ ngữ cảnh hạn chế nên mô-típ ngay từ phút đầu tiên có thể bị quên. Một quan niệm sai lầm phổ biến là người mẫu hiểu cấu trúc bài hát theo cách của một nhạc sĩ; nó phù hợp với các mẫu trong âm thanh gần đây. Các quyền cũng vẫn tồn tại: việc mở rộng bản ghi thương mại mà bạn không sở hữu sẽ tạo ra một bản ghi âm bắt nguồn từ bản ghi đó và các điều khoản của nhiều dịch vụ cấm tải lên âm thanh mà bạn không có quyền.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của việc mở rộng và tiếp tục âm nhạc AI

Nghiên cứu đang hướng tới bối cảnh dài hơn, nhận thức về cấu trúc tốt hơn và kiểm soát tốt hơn đối với các thân riêng lẻ, điều này sẽ làm giảm sự trôi dạt và khiến các chỉnh sửa ở cấp độ phần dễ dự đoán hơn. Tích hợp vào các máy trạm âm thanh kỹ thuật số là một hướng đi khả thi vì việc chỉnh sửa bên trong một dự án hiện có sẽ hữu ích hơn việc tạo toàn bộ bài hát trong trình duyệt. Chất lượng từng bước và việc bảo tồn bản sắc của một ca sĩ cụ thể vẫn là những vấn đề khó khăn. Về mặt quyền, các thỏa thuận sàng lọc và cấp phép tải lên giữa các dịch vụ và chủ sở hữu quyền vẫn đang phát triển, do đó, những gì người dùng có thể gia hạn hợp pháp sẽ phụ thuộc vào các điều khoản đang phát triển và kết quả của tòa án thay vì chỉ dựa vào công nghệ.

Triển khai trong thế giới thực

Một nhạc sĩ ngân nga ý tưởng điệp khúc dài 20 giây, tải nó lên một trình tạo nhạc và sử dụng tính năng Mở rộng từ mốc 0:18 để tạo ra một đoạn thơ và nhịp cầu nối tiếp theo cùng một phím và nhịp độ.

Một biên tập viên podcast có một bản nhạc được cấp phép dài 30 giây, quá ngắn so với phần giới thiệu, vì vậy cô ấy tạo phần tiếp theo và xen kẽ nó ở một vạch nhịp để đạt được 60 giây.

Một nhà sản xuất tách bản demo cũ thành giọng hát, trống, bass và các phần khác bằng Demucs, tắt tiếng phần thân trống yếu và yêu cầu một mô hình tạo ra phần trống mới được điều chỉnh trên các phần còn lại.

Một ban nhạc sơn hai ô nhịp trong đó ca sĩ đánh vần lời bài hát, giữ nguyên âm thanh ở cả hai bên, sau đó kiểm tra xem giọng hát được tái tạo có còn giống với cùng một ca sĩ hay không.

Rủi ro & lan can

  • Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

  • Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

  • Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

  1. Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

  2. Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

  3. Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

  4. Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Music Extension and Continuation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

Mở rộng và tiếp tục âm nhạc AI là gì?

Tiện ích mở rộng âm nhạc AI sử dụng mô hình tổng hợp để tiếp tục một đoạn âm thanh hiện có, tạo lại một phần ở giữa (inpainting), tạo kiểu lại cho nó hoặc thêm và thay thế các thân nhạc cụ riêng lẻ. Nó cho phép một ý tưởng ngắn phát triển thành một bản nhạc đầy đủ hoặc một bản nhạc thiếu sót được sửa chữa mà không cần ghi lại. Điều này quan trọng vì nó thay đổi cách mọi người soạn thảo và chỉnh sửa nhạc nhưng nó có giới hạn chất lượng rõ ràng và không loại bỏ quyền của bất kỳ ai sở hữu âm thanh gốc.

Làm thế nào để một mô hình tự hồi phục như MusicGen tiếp tục một đoạn âm thanh?

Đoạn clip được chuyển đổi thành các mã thông báo riêng biệt và mô hình dự đoán mã thông báo nào sẽ xuất hiện tiếp theo, tương tự như cách mô hình ngôn ngữ tiếp tục văn bản.

MusicGen sử dụng codec thần kinh nào để biến âm thanh thành mã thông báo?

MusicGen dựa vào EnCodec, một codec âm thanh thần kinh từ Meta, để thể hiện âm thanh dưới dạng mã thông báo riêng biệt.

Âm thanh inpainting làm gì?

Inpainting lấp đầy hoặc thay thế một khoảng đã chọn, chẳng hạn như lời bài hát bị lỗi, trong khi vẫn giữ nguyên âm thanh xung quanh.

Tại sao các mô hình khuếch tán lại phù hợp với inpainting?

Sự khuếch tán có thể hạn chế các vùng đã biết trong quá trình khử nhiễu, do đó chỉ phần bị thiếu được tái tạo để phù hợp với môi trường xung quanh.

Trong chế độ phối lại hoặc chuyển âm thanh sang âm thanh, cài đặt cường độ sẽ kiểm soát điều gì?

Cường độ cao hơn sẽ tạo ra nhiều tiếng ồn hơn và tái tạo nhiều hơn, thay đổi đầu vào nhiều hơn; sức mạnh thấp hơn giữ nhiều cấu trúc của nó.