HƯỚNG DẪN AI âm thanh

Jasper và QuartzNet ASR

Jasper và QuartzNet là các mô hình nhận dạng giọng nói tích chập đầu cuối của NVIDIA, trong đó QuartzNet là một thiết kế lại nhỏ hơn, hiệu quả hơn đáng kể của Jasper.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Lặn sâu

Jasper (Chỉ là một công cụ nhận dạng giọng nói khác), được NVIDIA phát hành vào năm 2019, là mạng tích chập 1D sâu, lên tới 54 lớp, ánh xạ các tính năng mel-spectrogram tới các ký tự sử dụng mất CTC. Nó giới thiệu các kết nối dư dày đặc để độ dốc chảy rõ ràng qua các ngăn xếp rất sâu. QuartzNet, được phát hành cùng năm, giữ nguyên cấu trúc khối của Jasper nhưng thay thế các tích chập tiêu chuẩn bằng các tích chập có thể phân tách theo kênh thời gian, chia từng bộ lọc thành một tích chập theo thời gian theo chiều sâu và một bước trộn kênh theo chiều kim đồng hồ. Hệ số hóa này đã cắt giảm các tham số từ khoảng 333 triệu của Jasper xuống còn khoảng 19 triệu trong khi khớp với độ chính xác trên Librispeech. Cả hai đều được cung cấp trong bộ công cụ NeMo của NVIDIA và được điều chỉnh để đào tạo GPU nhanh và suy luận thời gian thực, khiến chúng trở thành các khối xây dựng phổ biến cho ASR sản xuất.

Hiểu biết kỹ thuật

Hiệu quả của QuartzNet đến từ các kết cấu tích chập có thể phân tách theo kênh thời gian, ý tưởng tương tự đằng sau MobileNet. Một phép tích chập 1D thông thường kết hợp thời gian và các kênh với nhau, tiêu tốn K nhân C-in nhân với trọng số C-out. Việc tách nó thành tích chập theo chiều sâu theo thời gian cộng với tích chập theo điểm 1x1 trên các kênh sẽ giảm các tham số xuống K nhân C cộng với C-in nhân C-out. Được xếp chồng thành các khối dư và được huấn luyện bằng CTC, điều này mang lại độ chính xác gần như Jasper ở một phần nhỏ so với kích thước mô hình và tính toán.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của Jasper và QuartzNet ASR

Dòng tích chập có thể tách rời của QuartzNet đã dẫn trực tiếp đến Citrinet của NVIDIA và các mô hình Conformer được sử dụng rộng rãi, giúp tăng cường khả năng tự chú ý để nắm bắt bối cảnh toàn cầu cùng với các tích chập cục bộ. Mong đợi xu hướng tiếp tục hướng tới các kiến ​​trúc kết hợp tích chập cộng với sự chú ý và bộ giải mã bộ chuyển đổi (RNN-T) để phát trực tuyến. Bài học cốt lõi, các phép tích chập hiệu quả về tham số để triển khai ở biên và theo thời gian thực, vẫn là trọng tâm khi ASR được áp dụng trên điện thoại, ô tô và các thiết bị nhúng.

Triển khai trong thế giới thực

Trợ lý giọng nói và phiên âm thời gian thực được triển khai trên GPU NVIDIA thông qua bộ công cụ NeMo

Edge và ASR nhúng nơi kích thước nhỏ của QuartzNet phù hợp với các thiết bị có bộ nhớ hạn chế

Tinh chỉnh các điểm kiểm tra QuartzNet đã được huấn luyện trước cho các từ vựng dành riêng cho từng miền như thuật ngữ y tế hoặc pháp lý

Phân tích của trung tâm cuộc gọi phiên âm khối lượng lớn âm thanh một cách nhanh chóng và tiết kiệm chi phí

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

ASR tích chập Wav2Letter

Câu hỏi thường gặp

What is Jasper and QuartzNet ASR?

Jasper và QuartzNet là các mô hình nhận dạng giọng nói tích chập đầu cuối của NVIDIA, trong đó QuartzNet là một thiết kế lại nhỏ hơn, hiệu quả hơn đáng kể của Jasper. Chúng quan trọng trong việc chỉ ra cách đạt được độ chính xác cao với ít tham số hơn, lý tưởng cho việc triển khai.

Cải tiến quan trọng nào cho phép QuartzNet sử dụng ít tham số hơn nhiều so với Jasper?

QuartzNet thay thế các tích chập tiêu chuẩn bằng các tích chập có thể phân tách theo kênh thời gian, cắt giảm đáng kể số lượng tham số trong khi vẫn duy trì độ chính xác.

QuartzNet có khoảng bao nhiêu thông số so với ~333 triệu của Jasper?

QuartzNet giảm xuống còn khoảng 19 triệu tham số, giảm khoảng 17 lần, đồng thời phù hợp với độ chính xác của Librispeech của Jasper.

Công ty nào đã phát triển cả Jasper và QuartzNet?

Cả hai mô hình đều được NVIDIA phát triển và được phân phối thông qua bộ công cụ AI đàm thoại NeMo.

Jasper và QuartzNet sử dụng hàm mất mát nào để huấn luyện mà không cần căn chỉnh rõ ràng?

Cả hai đều sử dụng tính năng mất CTC, giúp căn chỉnh âm thanh có độ dài thay đổi theo chuỗi ký tự mà không yêu cầu nhãn trên mỗi khung hình.

Đặc điểm cấu trúc nào giúp độ dốc chảy qua mạng rất sâu (lên đến 54 lớp) của Jasper?

Jasper sử dụng các kết nối dư (bỏ qua) dày đặc để độ dốc lan truyền rõ ràng thông qua ngăn chập sâu của nó.