HƯỚNG DẪN AI âm thanh

Mô hình âm thanh tạo Bark

Bark là một mô hình chuyển văn bản thành âm thanh mã nguồn mở của Suno, không chỉ tạo ra lời nói mà còn tạo ra tiếng cười, tiếng thở dài, âm nhạc và hiệu ứng âm thanh trực tiếp từ lời nhắc văn bản.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it treats audio as one continuous creative medium rather than just narration.

Lặn sâu

Bark, do Suno phát hành vào năm 2023, phá vỡ tính năng chuyển văn bản thành giọng nói truyền thống bằng cách tạo ra âm thanh dưới dạng một chuỗi các mã thông báo riêng biệt, giống như mô hình ngôn ngữ tạo ra từ. Thay vì một quy trình rõ ràng chỉ tạo ra lời nói rõ ràng, Bark có thể nói một câu có cảm xúc, đưa vào các tín hiệu trong ngoặc như [cười], [thở dài] hoặc [âm nhạc] và thậm chí ngân nga một giai điệu. Nó hỗ trợ nhiều ngôn ngữ và có thể chuyển đổi giữa chúng chỉ bằng một lời nhắc. Bởi vì nó hoàn toàn mang tính khái quát và xác suất, cùng một gợi ý sẽ mang lại những yêu cầu khác nhau mỗi lần. Sự đánh đổi là nó có thể tạo ra thêm âm thanh ảo giác hoặc trôi dạt, đồng thời nó chậm hơn và khó điều khiển hơn so với động cơ TTS chuyên dụng. Sức hấp dẫn của nó là âm thanh mang tính biểu cảm, sống động như thật và đáng ngạc nhiên.

Hiểu biết kỹ thuật

Bark sử dụng kiến ​​trúc kiểu GPT hoạt động trên mã thông báo âm thanh thay vì dạng sóng thô. Đầu tiên, văn bản được chuyển đổi thành mã thông báo ngữ nghĩa thô, sau đó thành mã thông báo codec âm thanh tinh tế, cuối cùng được giải mã thành dạng sóng bằng bộ giải mã thần kinh EnCodec của Meta. Bởi vì nó dự đoán các mã thông báo theo cách tự động giống như một mô hình ngôn ngữ, nên các tín hiệu phi ngôn ngữ như [tiếng cười] chỉ trở thành nhiều mã thông báo hơn để tạo ra, đó là lý do tại sao nó tạo ra âm thanh ngoài lời nói.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của mô hình âm thanh tạo Bark

Các mô hình âm thanh sáng tạo như Bark hướng tới một tương lai nơi mọi văn bản, bao gồm hướng dẫn sân khấu và thiết kế âm thanh, đều trở thành âm thanh chỉ trong một lần truyền. Mong đợi các biến thể thời gian thực nhanh hơn, khả năng kiểm soát giọng nói và cảm xúc chặt chẽ hơn cũng như các biện pháp bảo vệ mạnh mẽ hơn. Bản thân Suno tập trung chủ yếu vào thế hệ âm nhạc AI, báo hiệu rằng các mô hình âm thanh dựa trên mã thông báo sẽ ngày càng làm mờ ranh giới giữa tổng hợp giọng nói, hiệu ứng âm thanh và sáng tác âm nhạc đầy đủ trong các hệ thống hợp nhất.

Triển khai trong thế giới thực

Tạo bản tường thuật sách nói mang tính biểu cảm bao gồm tiếng cười tự nhiên và những khoảng dừng cảm xúc

Sản xuất clip thoại đa ngôn ngữ cho ứng dụng nguyên mẫu mà không cần thuê diễn viên lồng tiếng

Tạo hiệu ứng âm thanh và tín hiệu âm thanh xung quanh cho các dự án video và trò chơi độc lập

Xây dựng nội dung dễ tiếp cận trong đó văn bản bao gồm các tín hiệu phi ngôn ngữ được đọc to một cách tự nhiên

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bark Generative Audio Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình khuếch tán cho âm thanh

Câu hỏi thường gặp

What is Bark Generative Audio Model?

Bark là một mô hình chuyển văn bản thành âm thanh mã nguồn mở của Suno, không chỉ tạo ra lời nói mà còn tạo ra tiếng cười, tiếng thở dài, âm nhạc và hiệu ứng âm thanh trực tiếp từ lời nhắc văn bản. Điều này quan trọng vì nó coi âm thanh là một phương tiện sáng tạo liên tục thay vì chỉ là lời tường thuật.

Điều gì khiến Bark khác biệt với công cụ chuyển văn bản thành giọng nói truyền thống?

Bark là một mô hình âm thanh tổng hợp có thể tạo ra tiếng cười, tiếng thở dài, âm nhạc và hiệu ứng âm thanh ngoài lời nói.

Ai đã phát hành mô hình Bark?

Bark được Suno phát hành vào năm 2023 dưới dạng mô hình chuyển văn bản thành âm thanh nguồn mở.

Về cơ bản Bark tạo ra âm thanh như thế nào?

Bark dự đoán chuỗi mã thông báo âm thanh giống như mô hình ngôn ngữ kiểu GPT dự đoán từ.

Bark sử dụng codec thần kinh nào để biến mã thông báo thành dạng sóng?

Bark giải mã các mã thông báo âm thanh tốt của nó thành dạng sóng bằng cách sử dụng bộ giải mã thần kinh EnCodec của Meta.

Tại sao cùng một lời nhắc Bark có thể tạo ra các kết quả khác nhau mỗi lần?

Bởi vì Bark tạo ra các mã thông báo theo xác suất, nên các lần chạy lặp lại của cùng một lời nhắc sẽ mang lại những kết quả khác nhau.