Mô hình khuếch tán cho âm thanh
Mô hình khuếch tán tạo ra âm thanh bằng cách học cách đảo ngược quy trình tạo tiếng ồn từng bước, biến tiếng ồn ngẫu nhiên thành lời nói, âm nhạc hoặc hiệu ứng âm thanh mạch lạc.
Tổng quan
Chúng cung cấp năng lượng cho nhiều hệ thống tạo nhạc và chuyển văn bản thành âm thanh thực tế nhất hiện nay.
Lặn sâu
Các mô hình khuếch tán âm thanh mượn cùng một ý tưởng cốt lõi đã cách mạng hóa việc tạo ra hình ảnh. Trong quá trình huấn luyện, âm thanh sạch dần dần bị hỏng do thêm nhiễu Gaussian qua nhiều bước cho đến khi nó trở thành tĩnh thuần túy. Mạng lưới thần kinh học cách dự đoán và loại bỏ nhiễu đó ở mỗi bước. Tại thời điểm tạo, mô hình bắt đầu từ nhiễu ngẫu nhiên và khử nhiễu lặp đi lặp lại, thường được hướng dẫn bởi lời nhắc văn bản để tạo ra tín hiệu rõ ràng. Nhiều hệ thống hoạt động không phải trên dạng sóng thô mà trên các biểu diễn hoặc biểu đồ phổ tiềm ẩn được nén, giúp việc tạo ra nhanh hơn và dễ điều khiển hơn. Các ví dụ đáng chú ý bao gồm AudioLDM, Stable Audio và Riffusion. Kết quả là sự tổng hợp âm thanh có độ trung thực cao, có thể kiểm soát được qua lời nói, âm nhạc và âm thanh môi trường.
Hiểu biết kỹ thuật
Thay vì trực tiếp tạo ra các dạng sóng thô dài, hầu hết các mô hình khuếch tán âm thanh đều hoạt động trong không gian tiềm ẩn đã học được tạo ra bởi bộ mã hóa tự động biến thiên hoặc trên các biểu đồ mel sau đó được chuyển đổi thành âm thanh bởi bộ mã hóa như HiFi-GAN. Điều hòa văn bản được đưa vào thông qua sự chú ý chéo, thường sử dụng phần nhúng CLAP để căn chỉnh âm thanh và ngôn ngữ. Tốc độ lấy mẫu được cải thiện nhờ các kỹ thuật như DDIM và chưng cất, cắt giảm hàng trăm bước khử nhiễu xuống chỉ còn một số ít.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của các mô hình khuếch tán âm thanh
Mong đợi việc lấy mẫu nhanh hơn thông qua các mô hình nhất quán và quá trình chưng cất, thúc đẩy quá trình tạo luồng và thời gian thực. Các tác phẩm âm nhạc dài hơn, có cấu trúc hơn với sự mạch lạc giữa câu-điệp khúc đang nổi lên, bên cạnh khả năng kiểm soát tốt hơn thông qua nội dung, thân cây và âm thanh tham chiếu. Các hệ thống đa phương thức cùng tạo ra video và nhạc đồng bộ đang phát triển nhanh chóng. Khi chất lượng tăng lên, các công cụ tạo hình mờ và xuất xứ sẽ trở nên cần thiết để giải quyết các vấn đề về deepfake, sao chép giọng nói và các mối lo ngại về bản quyền âm nhạc.
Triển khai trong thế giới thực
Âm thanh ổn định tạo nhạc nền và hiệu ứng âm thanh miễn phí bản quyền từ lời nhắc văn bản dành cho người tạo video
AudioLDM tạo ra các âm thanh môi trường thực tế như tiếng mưa, tiếng bước chân hoặc tiếng chó sủa cho trò chơi và phim
Riffusion tạo ra các đoạn nhạc ngắn bằng cách khử nhiễu hình ảnh quang phổ dựa trên lời nhắc về thể loại và nhạc cụ
Hệ thống chuyển văn bản thành giọng nói dựa trên sự khuếch tán tổng hợp lời tường thuật tự nhiên, biểu cảm cho sách nói và trợ lý giọng nói
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models for Audio quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình âm thanh tạo Bark
Câu hỏi thường gặp
Mô hình khuếch tán cho âm thanh là gì?
Mô hình khuếch tán tạo ra âm thanh bằng cách học cách đảo ngược quy trình tạo tiếng ồn từng bước, biến tiếng ồn ngẫu nhiên thành lời nói, âm nhạc hoặc hiệu ứng âm thanh mạch lạc. Chúng cung cấp năng lượng cho nhiều hệ thống tạo nhạc và chuyển văn bản thành âm thanh thực tế nhất hiện nay.
Quá trình cốt lõi mà một mô hình khuếch tán học được trong quá trình đào tạo là gì?
Các mô hình khuếch tán được đào tạo để dự đoán và loại bỏ nhiễu Gaussian được thêm vào ở mỗi bước để sau này chúng có thể biến tiếng ồn thuần túy thành âm thanh sạch.
Tại sao nhiều mô hình khuếch tán âm thanh hoạt động trên tiềm ẩn hoặc biểu đồ phổ thay vì dạng sóng thô?
Làm việc trong không gian tiềm ẩn bị nén hoặc trên biểu đồ phổ giúp giảm đáng kể kích thước, giúp cho việc đào tạo và lấy mẫu hiệu quả hơn nhiều so với việc lập mô hình trực tiếp các dạng sóng thô dài.
Lời nhắc văn bản thường được sử dụng như thế nào để điều khiển quá trình tạo âm thanh trong các mô hình này?
Điều hòa văn bản thường được đưa vào mạng khử nhiễu thông qua sự chú ý chéo, thường xuyên sử dụng các phần nhúng CLAP để căn chỉnh ngôn ngữ và âm thanh.
Khi một quang phổ được tạo ra, nó thường được chuyển thành âm thanh như thế nào?
Bộ phát âm như HiFi-GAN chuyển đổi biểu đồ mel được tạo thành dạng sóng có thể nghe được.
Kỹ thuật nào giúp tăng tốc độ tạo bằng cách giảm số bước khử nhiễu?
Các mô hình chưng cất và nhất quán nén hàng trăm bước khử nhiễu chỉ trong một vài bước, cho phép lấy mẫu theo thời gian thực nhanh hơn nhiều.