HƯỚNG DẪN AI âm thanh

Tổng hợp chuyển văn bản thành âm thanh AudioGen

AudioGen là mô hình Meta biến mô tả văn bản thành âm thanh môi trường thực tế và hiệu ứng âm thanh, chẳng hạn như 'chó sủa trong khi chim hót'. Nó quan trọng vì nó cho phép người sáng tạo tạo ra âm thanh không phải lời nói từ ngôn ngữ đơn giản, một khả năng đã bị thiếu trong AI sáng tạo.

Đọc trong 2 phútCập nhật lần cuối

Lặn sâu

AudioGen, do Meta AI phát hành vào năm 2022, là một mô hình ngôn ngữ tự hồi quy, tạo ra âm thanh chung (hiệu ứng âm thanh, cảnh xung quanh, âm thanh động vật và đồ vật) trực tiếp từ lời nhắc văn bản. Không giống như các hệ thống chuyển văn bản thành giọng nói, nó nhắm đến thế giới hỗn độn của âm thanh hàng ngày. Đầu tiên, nó nén âm thanh thô thành một chuỗi các mã thông báo rời rạc bằng cách sử dụng bộ giải mã thần kinh (bộ mã hóa tự động kiểu EnCodec với lượng tử hóa vectơ dư). Sau đó, mô hình ngôn ngữ Transformer sẽ học cách dự đoán các mã thông báo âm thanh này dựa trên mô tả văn bản được mã hóa bằng bộ mã hóa văn bản riêng biệt. Để nâng cao hiểu biết về thành phần, các tác giả đã trộn và ghép các mẫu âm thanh trong quá trình đào tạo để mô hình có thể học các cách kết hợp như các âm thanh chồng chéo. AudioGen sau này trở thành một phần của thư viện AudioCraft của Meta cùng với mô hình âm nhạc MusicGen.

Hiểu biết kỹ thuật

AudioGen có hai giai đoạn. Đầu tiên, bộ mã hóa âm thanh tự động học cách ánh xạ dạng sóng thành một luồng nhỏ gồm các mã thông báo rời rạc và ngược lại. Thứ hai, Transformer được đào tạo với mục tiêu mô hình hóa ngôn ngữ để dự đoán mã thông báo âm thanh tiếp theo được cung cấp mã thông báo trước cùng với điều kiện văn bản. Hướng dẫn không cần phân loại và mô hình hóa sổ mã đa luồng cải thiện độ trung thực và căn chỉnh văn bản. Tạo âm thanh có nghĩa là lấy mẫu mã thông báo một cách tự động, sau đó giải mã chúng trở lại dạng sóng bằng codec.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của tổng hợp văn bản thành âm thanh AudioGen

Chuyển văn bản thành âm thanh đang hướng tới tốc độ mẫu cao hơn, cảnh mạch lạc dài hơn và kiểm soát chặt chẽ hơn về thời gian cũng như vị trí không gian của âm thanh. Mong đợi sự tích hợp vào các công cụ video tự động thêm hiệu ứng âm thanh phù hợp, công cụ trợ năng mô tả cảnh một cách rõ ràng và công cụ trò chơi tổng hợp âm thanh xung quanh theo yêu cầu. Việc kết hợp các mô hình mã thông báo kiểu AudioGen với các phương pháp khuếch tán và bộ mã hóa văn bản mạnh hơn sẽ cải thiện tính chân thực, trong khi các công cụ tạo hình mờ và xuất xứ sẽ giúp phân biệt âm thanh tổng hợp với âm thanh đã ghi.

Triển khai trong thế giới thực

Tạo Foley và hiệu ứng âm thanh cho phim và trò chơi từ lời nhắc văn bản

Tạo cảnh quan âm thanh xung quanh (mưa, giao thông, rừng) cho các ứng dụng và công cụ thiền

Tạo nguyên mẫu âm thanh cho các dự án video mà không cần cấp phép thư viện chứng khoán

Tạo âm thanh thông báo và cảnh báo tùy chỉnh được mô tả bằng ngôn ngữ đơn giản

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioGen Text-to-Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tổng hợp âm thanh có thể phân biệt DDSP

Câu hỏi thường gặp

What is AudioGen Text-to-Audio Synthesis?

AudioGen là mô hình Meta biến mô tả văn bản thành âm thanh môi trường thực tế và hiệu ứng âm thanh, chẳng hạn như 'chó sủa trong khi chim hót'. Nó quan trọng vì nó cho phép người sáng tạo tạo ra âm thanh không phải lời nói từ ngôn ngữ đơn giản, một khả năng đã bị thiếu trong AI sáng tạo.

AudioGen chủ yếu tạo ra những gì?

AudioGen chuyên về âm thanh chung, không có lời nói như âm thanh môi trường và các hiệu ứng được tạo ra từ lời nhắc văn bản.

Giai đoạn đầu tiên trong quy trình của AudioGen là gì?

Bộ mã hóa tự động codec thần kinh sẽ nén âm thanh thô thành các mã thông báo riêng biệt mà mô hình ngôn ngữ sau đó có thể dự đoán.

Loại mô hình nào dự đoán mã thông báo âm thanh?

AudioGen sử dụng một Transformer tự hồi quy để dự đoán lần lượt các mã thông báo âm thanh, dựa trên văn bản.

Tại sao tác giả trộn và ghép âm thanh trong quá trình đào tạo?

Việc tăng cường các clip hỗn hợp và ghép nối đã cải thiện khả năng của AudioGen trong việc tạo ra nhiều âm thanh được mô tả cùng nhau trong một lời nhắc.

Thư viện Meta nào lớn hơn bao gồm AudioGen?

AudioGen là một phần của thư viện AudioCraft của Meta, thư viện này cũng chứa mô hình MusicGen.