Nhận dạng ký tự quang học
Nhận dạng ký tự quang học (OCR) biến hình ảnh của văn bản — tài liệu được quét, ảnh biển báo, tệp PDF — thành văn bản có thể đọc được bằng máy và có thể chỉnh sửa.
Tổng quan
Nó là cầu nối làm cho thế giới in và viết tay có thể tìm kiếm và tính toán được.
Lặn sâu
OCR chuyển đổi các pixel trông giống chữ cái thành mã ký tự thực tế mà máy tính có thể lưu trữ và chỉnh sửa. OCR cổ điển hoạt động theo các giai đoạn: làm sạch và khử nghiêng hình ảnh, tìm vùng văn bản, phân đoạn chúng thành các dòng và các ký tự riêng lẻ, sau đó phân loại từng ký tự bằng cách khớp hình dạng của nó với các mẫu đã biết. OCR hiện đại phần lớn là thần kinh: mạng tích chập đọc các đặc điểm trực quan và mô hình trình tự (thường bị mất CTC hoặc bộ giải mã dựa trên sự chú ý) dự đoán toàn bộ chuỗi mà không cần phân đoạn ký tự hoàn hảo. Điều này xử lý các chữ thảo, chữ cái chồng chéo và phông chữ đa dạng tốt hơn nhiều. Các công cụ như Tesseract, cùng với các dịch vụ đám mây từ Google, Amazon và Microsoft, hiện đạt độ chính xác rất cao khi in rõ ràng và xử lý hàng chục ngôn ngữ và tập lệnh.
Hiểu biết kỹ thuật
Một bước đột phá lớn là Phân loại thời gian kết nối (CTC). Các hệ thống cũ hơn phải chia một từ thành các chữ cái riêng biệt trước khi nhận dạng chúng - dễ xảy ra lỗi khi các chữ cái chạm vào hoặc bị nhòe. CTC cho phép mạng lặp lại hoặc mạng biến áp xuất ra xác suất cho mỗi ký tự ở mỗi lát cắt ngang của hình ảnh, sau đó thu gọn các phần lặp lại và khoảng trống để tạo ra từ cuối cùng. Điều này loại bỏ bước phân đoạn dễ vỡ và cho phép mô hình tự động tìm hiểu sự căn chỉnh giữa các pixel và ký tự từ các cặp văn bản-hình ảnh được gắn nhãn.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của nhận dạng ký tự quang học
OCR đang hợp nhất thành các mô hình 'tài liệu AI' và ngôn ngữ thị giác rộng hơn để đọc một trang và trả lời trực tiếp các câu hỏi về trang đó, bỏ qua bước trích xuất văn bản riêng biệt. Mong đợi khả năng xử lý mạnh mẽ hơn đối với chữ viết tay lộn xộn, kho lưu trữ lịch sử, ảnh điện thoại có độ phân giải thấp và bố cục phức tạp như bảng, biểu mẫu và biên lai. Phạm vi phủ sóng đa ngôn ngữ và sử dụng ít tài nguyên sẽ tiếp tục mở rộng và OCR trên thiết bị sẽ nhanh hơn, cho phép dịch biển báo đường phố theo thời gian thực và chụp ngay bất kỳ văn bản nào mà máy ảnh nhìn thấy.
Triển khai trong thế giới thực
Các ứng dụng ngân hàng di động đọc các trường tài khoản, định tuyến và số tiền của séc giấy để người dùng có thể gửi tiền bằng ảnh
Google Lens và Apple Live Text cho phép bạn sao chép văn bản từ ảnh hoặc dịch menu nước ngoài trong thời gian thực
Số hóa kho lưu trữ báo chí và thư viện lịch sử để toàn bộ văn bản có thể tìm kiếm được bằng từ khóa
Xử lý hóa đơn và biên nhận tự động trong phần mềm kế toán trích xuất nhà cung cấp, ngày tháng và tổng số
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Character Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Nhận dạng hành động
Câu hỏi thường gặp
Nhận dạng ký tự quang học là gì?
Nhận dạng ký tự quang học (OCR) biến hình ảnh của văn bản — tài liệu được quét, ảnh biển báo, tệp PDF — thành văn bản có thể đọc được bằng máy và có thể chỉnh sửa. Nó là cầu nối làm cho thế giới in và viết tay có thể tìm kiếm và tính toán được.
Công việc cốt lõi của OCR là gì?
Nhiệm vụ xác định của OCR là biến các pixel mô tả các chữ cái thành mã văn bản thực tế mà máy tính có thể lưu trữ, tìm kiếm và chỉnh sửa.
Kỹ thuật nào cho phép OCR hiện đại tránh việc cắt một từ thành các chữ cái riêng biệt trước khi nhận dạng?
CTC cho phép mạng dự đoán các ký tự trên các lát hình ảnh và thu gọn kết quả, loại bỏ bước phân đoạn dễ vỡ theo từng chữ cái.
Tại sao 'khử lệch' là bước tiền xử lý phổ biến trong quy trình OCR?
Các trang được quét hoặc chụp ảnh thường bị xoay nhẹ; de-skewing căn chỉnh văn bản theo chiều ngang, cải thiện độ chính xác của nhận dạng.
Công cụ nào sau đây là công cụ OCR nguồn mở được sử dụng rộng rãi?
Tesseract là một công cụ OCR mã nguồn mở phổ biến hỗ trợ nhiều ngôn ngữ; những người khác phục vụ các mục đích không liên quan.
Tại sao văn bản viết tay thường khó OCR hơn văn bản in?
Chữ viết tay có sự thay đổi rất lớn về hình dạng, độ nghiêng và khoảng cách, đồng thời các chữ thảo kết nối với nhau, khiến việc phân đoạn và phân loại trở nên khó khăn hơn nhiều.