HƯỚNG DẪN ứng dụng

AI trong việc đọc môi và nhận dạng giọng nói bằng hình ảnh

Nhận dạng giọng nói bằng hình ảnh sử dụng AI để đọc môi, dự đoán lời nói từ chuyển động của miệng, hàm và khuôn mặt của một người, đôi khi không có bất kỳ âm thanh nào.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

Lặn sâu

Đọc môi cũng khó khăn ngay cả đối với con người vì nhiều âm thanh trông giống hệt nhau trên môi. Ví dụ: các âm /p/, /b/ và /m/ tạo thành một nhóm 'viseme' duy nhất không thể phân biệt được bằng mắt thường, vì vậy ngữ cảnh là điều cần thiết. Các mô hình AI như Google LipNet của DeepMind và các hệ thống 'Xem, Tham dự và Đánh vần' sau này học cách ánh xạ chuỗi khung hình video ở vùng miệng thành các ký tự hoặc từ, đôi khi hoạt động tốt hơn các trình đọc môi chuyên nghiệp của con người trên các tập dữ liệu chuẩn. Hệ thống mạnh nhất là nghe nhìn: chúng kết hợp video của môi với tín hiệu âm thanh để khi tiếng ồn làm hỏng âm thanh, luồng hình ảnh sẽ lấp đầy khoảng trống. Hiệu suất vẫn giảm mạnh do ánh sáng kém, quay đầu, bịt kín như tay hoặc mặt nạ và loa không quen thuộc.

Hiểu biết kỹ thuật

Một mô hình điển hình sẽ cắt một vùng chặt chẽ xung quanh miệng, sau đó chuyển chuỗi khung hình qua giao diện người dùng tích chập 3D để ghi lại các mẫu chuyển động ngắn, tiếp theo là một mạng biến áp hoặc mạng lặp lại mô hình bối cảnh thời gian dài hơn. Đầu ra được giải mã thành văn bản bằng cách sử dụng CTC hoặc các phương pháp tuần tự dựa trên sự chú ý. Sự kết hợp nghe nhìn kết hợp hai phương thức để mỗi phương thức có thể bù đắp cho những điểm yếu của phương thức kia.

Tác động chiến lược

Xây dựng lựa chọn

Thiết kế cấp ứng dụng xác định liệu AI có cải thiện kết quả thực tế hay không.

Nhóm và quy trình làm việc

Tích hợp quy trình làm việc tốt sẽ giúp tăng năng suất mà người dùng có thể tin tưởng.

Rủi ro và an toàn

Các trường hợp sử dụng có phạm vi phù hợp giúp giảm bớt sự mệt mỏi khi thay đổi và rủi ro triển khai.

Tương lai của AI trong việc đọc môi và nhận dạng giọng nói bằng hình ảnh

Mong đợi tính năng đọc môi sẽ được nhúng chủ yếu như một công cụ trợ giúp cho hệ thống âm thanh thay vì một công cụ độc lập, cải thiện trợ lý giọng nói và chú thích ở những nơi ồn ào. Công việc vẫn tiếp tục trên các mẫu không có loa, độ bền trong điều kiện ánh sáng yếu và khả năng xử lý trên thiết bị để đảm bảo quyền riêng tư. Bởi vì việc đọc môi bí mật làm dấy lên những lo ngại rõ ràng về giám sát, nên các tiêu chuẩn quản trị và sự đồng ý có thể sẽ định hình nơi nó có thể được triển khai cũng như bản thân công nghệ.

Triển khai trong thế giới thực

Tăng cường độ chính xác của trợ lý giọng nói trong ô tô ồn ào hoặc phòng đông người bằng cách đọc môi của người nói cùng với âm thanh

Giúp phục hồi giọng nói cho người bị mất giọng bằng cách đọc cử động miệng

Cải thiện phụ đề tự động khi micrô thu được tiếng ồn xung quanh lớn

Phân tích pháp y hoặc lưu trữ cố gắng khôi phục đoạn hội thoại từ cảnh quay im lặng hoặc bị bóp nghẹt

Rủi ro & lan can

Tự động hóa một quy trình bị hỏng có thể khuếch đại các vấn đề hiện có.

Các nhóm có thể tự động hóa quá mức và loại bỏ sự phán xét cần thiết của con người.

Chất lượng có thể thay đổi nếu kết quả đầu ra không được đánh giá liên tục.

Lộ trình thực hiện

1

Lập sơ đồ quy trình làm việc hiện tại và xác định bước có mức độ ma sát cao nhất.

2

Xác định các điểm kiểm tra của con người trước khi tự động hóa hoàn toàn.

3

Đào tạo người dùng về lời nhắc, đường dẫn leo thang và tiêu chuẩn chất lượng.

4

Theo dõi kết quả ở cấp độ nhiệm vụ để xác nhận giá trị bền vững.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Nhận dạng cảm xúc lời nói

Câu hỏi thường gặp

What is AI in Lip Reading and Visual Speech Recognition?

Nhận dạng giọng nói bằng hình ảnh sử dụng AI để đọc môi, dự đoán lời nói từ chuyển động của miệng, hàm và khuôn mặt của một người, đôi khi không có bất kỳ âm thanh nào. Nó quan trọng đối với môi trường ồn ào, khả năng tiếp cận và kết hợp với âm thanh để nhận dạng giọng nói mạnh mẽ hơn.

"viseme" là gì?

Các âm giống như /p/, /b/ và /m/ tạo thành một hình vị vì miệng trông giống nhau, đó là lý do tại sao việc đọc môi thường mơ hồ nếu không có ngữ cảnh.

Tại sao các mẫu nghe nhìn thường mạnh mẽ hơn các mẫu chỉ có môi hoặc chỉ có âm thanh?

Việc kết hợp video và âm thanh cho phép mỗi phương thức bù đắp cho phương thức kia, đến mức tiếng ồn lớn làm hỏng âm thanh có thể được bù đắp bằng môi.

Mặt trước tích chập 3D trong mô hình đọc môi giúp ghi lại điều gì?

Cấu trúc 3D xử lý nhiều khung hình cùng nhau, ghi lại cách miệng di chuyển trong khoảng thời gian ngắn thay vì một hình ảnh tĩnh duy nhất.

Tình trạng nào làm giảm độ chính xác của việc đọc môi?

Bất cứ điều gì che giấu hoặc làm biến dạng vùng miệng, chẳng hạn như tắc nghẽn hoặc ánh sáng kém, sẽ làm giảm đáng kể độ chính xác.