HƯỚNG DẪN AI âm thanh

Căn chỉnh từ theo dấu thời gian thì thầm

Căn chỉnh từ thì thầm ghim từng từ được phiên âm vào thời gian bắt đầu và kết thúc chính xác trong âm thanh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Điều này biến bản ghi phẳng thành dòng thời gian có thể nhấp vào và tìm kiếm được, dùng để tạo phụ đề, lồng tiếng và chỉnh sửa.

Lặn sâu

OpenAI's Whisper là một biến áp mã hóa-giải mã có chức năng phiên âm giọng nói nhưng đầu ra gốc của nó chỉ cung cấp dấu thời gian thô cho mỗi phân đoạn chứ không cung cấp dấu thời gian cho mỗi từ. Căn chỉnh cấp độ từ sẽ lấp đầy khoảng trống đó. Thủ thuật phổ biến nhất (được sử dụng bởi tính năng đánh dấu thời gian thì thầm và WhisperX) đọc trọng số chú ý chéo của mô hình: bộ giải mã chú ý đến các khung âm thanh cụ thể khi nó phát ra từng mã thông báo và vị trí chú ý cao nhất đánh dấu đại khái thời điểm từ đó được nói. Sau đó, Dynamic Time Warping buộc ánh xạ các mã thông báo đơn điệu, không chồng chéo vào cửa sổ âm thanh 30 giây. Thay vào đó, WhisperX chạy một mô hình căn chỉnh bắt buộc dựa trên âm vị riêng biệt (như wav2vec 2.0) trên văn bản của Whisper để có ranh giới rõ ràng hơn. Kết quả là mỗi từ được đóng dấu với độ chính xác hàng chục mili giây.

Hiểu biết kỹ thuật

Whisper xử lý âm thanh theo từng đoạn 30 giây, chuyển thành biểu đồ phổ log-Mel, được mã hóa ở tốc độ 50 khung hình/giây (cứ 20 mili giây thì có một khung hình). Sự chú ý chéo liên kết từng mã thông báo được giải mã với các khung đó; khung argmax trở thành thời gian của từ. Dynamic Time Warping thực thi việc căn chỉnh đơn điệu để dấu thời gian không bao giờ bị lùi lại. Các lựa chọn thay thế căn chỉnh bắt buộc khớp bản ghi đã biết với âm thanh ở cấp độ âm vị, mang lại các góc cạnh rõ ràng hơn so với mức độ chú ý thô.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của việc căn chỉnh từ theo dấu thời gian thì thầm

Mong đợi sự căn chỉnh được đưa trực tiếp vào bộ giải mã thay vì được chốt sau đó, cộng với điểm tin cậy đáng tin cậy trên mỗi từ để người biên tập biết nên tin cậy dấu thời gian nào. Việc căn chỉnh luồng cho phụ đề trực tiếp đang được cải thiện, cũng như khả năng chống chồng chéo loa, âm nhạc và chuyển đổi mã. Khi các mô hình đa ngôn ngữ phát triển, chất lượng căn chỉnh giữa các ngôn ngữ có nguồn tài nguyên thấp sẽ thu hẹp khoảng cách với tiếng Anh, khiến cho việc lồng tiếng tự động và chú thích kiểu karaoke trở nên đáng tin cậy hơn nhiều.

Triển khai trong thế giới thực

Tạo chú thích trên YouTube và TikTok trong đó các từ xuất hiện trên màn hình chính xác như khi chúng được nói

Hỗ trợ trình chỉnh sửa phụ đề cho phép bạn nhấp vào một từ và chuyển đến khoảnh khắc âm thanh đó

Căn chỉnh các tập lệnh đã dịch thành âm thanh gốc để tự động lồng tiếng và đồng bộ hóa thời gian hát nhép

Xây dựng kho lưu trữ podcast có thể tìm kiếm trong đó truy vấn văn bản đến đúng giây mà nó được nói

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Timestamped Word Alignment quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Nhận dạng giọng nói thì thầm

Câu hỏi thường gặp

Căn chỉnh từ được đánh dấu thời gian thì thầm là gì?

Căn chỉnh từ thì thầm ghim từng từ được phiên âm vào thời gian bắt đầu và kết thúc chính xác trong âm thanh. Điều này biến bản ghi phẳng thành dòng thời gian có thể nhấp vào và tìm kiếm được, dùng để tạo phụ đề, lồng tiếng và chỉnh sửa.

Căn chỉnh cấp độ từ bổ sung thêm điều gì mà đầu ra gốc của Whisper thiếu?

Whisper vốn cung cấp dấu thời gian thô cho mỗi phân đoạn; căn chỉnh thêm thời gian bắt đầu và kết thúc chính xác của mỗi từ.

Dấu thời gian thì thầm sử dụng tín hiệu nội bộ nào để định vị các từ kịp thời?

Sự chú ý chéo cho biết khung âm thanh nào mà bộ giải mã tập trung vào khi phát ra từng mã thông báo, cho biết thời gian.

Tại sao Dynamic Time Warping được áp dụng trong quá trình căn chỉnh?

DTW đảm bảo các dấu thời gian tiến triển theo thứ tự và các từ không trùng nhau, tạo ra dòng thời gian hợp lý.

WhisperX làm sắc nét ranh giới từ so với sự chú ý thô sơ như thế nào?

WhisperX căn chỉnh văn bản của Whisper bằng cách sử dụng mô hình âm vị như wav2vec 2.0 để có các cạnh rõ ràng hơn so với mức thu hút sự chú ý cao nhất.

Bộ mã hóa của Whisper tạo ra khung âm thanh với tốc độ bao nhiêu?

Whisper mã hóa quang phổ log-Mel với tốc độ khoảng 50 khung hình mỗi giây, hoặc một khung hình cứ sau 20 mili giây.