Phân loại thời gian theo chủ nghĩa kết nối
Phân loại theo thời gian của nhà kết nối (CTC) là một phương pháp giải mã và chức năng mất mát cho phép mạng thần kinh biến một chuỗi âm thanh dài thành văn bản mà không cần ai căn chỉnh từng âm thanh cho từng chữ cái.
Tổng quan
It made end-to-end speech recognition practical by solving the brutal alignment problem.
Lặn sâu
Lời nói rất lộn xộn: từ 'xin chào' có thể kéo dài 40 khung âm thanh và không ai gắn nhãn chính xác khung nào là 'h'. CTC, được Alex Graves giới thiệu vào năm 2006, đã bỏ qua điều này. Mạng đưa ra xác suất trên các ký tự (cộng với mã thông báo 'trống' đặc biệt) cho mỗi khung hình. Sau đó, CTC xác định căn chỉnh hợp lệ là bất kỳ đường dẫn từng khung hình nào thu gọn vào văn bản đích sau hai quy tắc: hợp nhất các ký tự lặp lại, sau đó xóa khoảng trống. Vì nhiều đường dẫn ánh xạ tới cùng một văn bản nên CTC tính tổng xác suất của tất cả chúng bằng thuật toán lập trình động (thuật toán tiến-lùi) và huấn luyện mạng để tối đa hóa tổng đó. Mã thông báo trống là thủ thuật thông minh cho phép mô hình nói 'không có gì mới ở đây' và phân tách các phần lặp lại thực sự như chữ L kép trong 'xin chào'.
Hiểu biết kỹ thuật
Giả định cốt lõi của CTC là sự độc lập có điều kiện: với âm thanh, đầu ra của mỗi khung hình được dự đoán độc lập, không có mô hình ngôn ngữ nào được cài đặt sẵn. Điều đó làm cho phép tính tổng xuôi ngược có thể xử lý được nhưng có nghĩa là CTC có xu hướng tạo ra các đầu ra có nhiều gai nhọn (hầu hết là trống, có các gai ký tự sắc nét) và được hưởng lợi từ mô hình ngôn ngữ bên ngoài tại thời điểm giải mã. Tìm kiếm chùm tia với LM hợp nhất, thường được gọi là giải mã chùm tiền tố, cải thiện đáng kể độ chính xác so với giải mã argmax tham lam.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của sự phân loại theo thời gian theo chủ nghĩa kết nối
CTC vẫn là một công cụ hữu ích, đặc biệt là khi phát trực tuyến và độ trễ thấp đóng vai trò quan trọng, đồng thời nó ngày càng được sử dụng như một phần mất mát phụ trợ cùng với các mục tiêu chú ý hoặc bộ chuyển đổi trong các mô hình 'CTC/chú ý' kết hợp. Mong đợi CTC sẽ tồn tại như một nhánh giải mã nhanh, đơn giản bên trong các hệ thống giọng nói đa nhiệm lớn hơn và là công cụ căn chỉnh đằng sau các công cụ căn chỉnh bắt buộc đánh dấu thời gian cho các từ. Các bộ mã hóa tự giám sát như wav2vec 2.0 thường được tinh chỉnh bằng đầu CTC.
Triển khai trong thế giới thực
Tinh chỉnh wav2vec 2.0 với đầu CTC để xây dựng mô hình chuyển giọng nói thành văn bản nguồn mở bằng ngôn ngữ tài nguyên thấp
Tạo dấu thời gian ở cấp độ từ và âm vị cho phụ đề và karaoke thông qua căn chỉnh bắt buộc CTC
Chú thích theo thời gian thực trên thiết bị trong đó mô hình CTC phát trực tuyến sẽ phiên âm với độ trễ tối thiểu
Nhận dạng chữ viết tay, trong đó CTC đọc một dòng chữ thảo mà không phân đoạn trước các chữ cái riêng lẻ
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Connectionist Temporal Classification quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Phân loại thể loại âm nhạc
Câu hỏi thường gặp
What is Connectionist Temporal Classification?
Phân loại theo thời gian của nhà kết nối (CTC) là một phương pháp giải mã và chức năng mất mát cho phép mạng thần kinh biến một chuỗi âm thanh dài thành văn bản mà không cần ai căn chỉnh từng âm thanh cho từng chữ cái. Nó làm cho việc nhận dạng giọng nói từ đầu đến cuối trở nên thực tế bằng cách giải quyết vấn đề căn chỉnh khắc nghiệt.
CTC được thiết kế để giải quyết vấn đề cốt lõi nào cho việc nhận dạng giọng nói?
CTC cho phép mạng đào tạo các cặp (âm thanh, văn bản) mà không cần ai gắn nhãn khung nào tương ứng với ký tự nào, giải quyết vấn đề căn chỉnh.
Mã thông báo 'trống' đặc biệt trong CTC được sử dụng để làm gì?
Mã thông báo trống cho phép mô hình phát ra 'không có gì mới' trên một khung và quan trọng là phân tách các lần lặp lại thực sự như chữ L kép trong 'xin chào' khỏi các lần lặp lại được thu gọn.
CTC tính toán tổn thất cho phiên mã mục tiêu như thế nào?
CTC sử dụng thuật toán lập trình động tiến-lùi để tính tổng xác suất trên mỗi căn chỉnh ánh xạ tới mục tiêu sau khi hợp nhất các lần lặp lại và xóa các khoảng trống.
Hai quy tắc thu gọn mà CTC áp dụng để biến đường dẫn khung thành văn bản cuối cùng là gì?
Đường dẫn thô trên mỗi khung được giải mã bằng cách trước tiên hợp nhất các ký tự trùng lặp liền kề rồi xóa tất cả các mã thông báo trống.
CTC tiêu chuẩn đưa ra giả định đơn giản hóa nào về kết quả đầu ra của nó?
CTC giả định tính độc lập có điều kiện trên mỗi khung, điều này làm cho phép tính tổng dễ thực hiện nhưng có nghĩa là không có mô hình ngôn ngữ tích hợp.