คู่มือ AI แบบเห็นภาพ

การรู้จำอักขระด้วยแสง

Optical Character Recognition (OCR) เปลี่ยนรูปภาพข้อความ เช่น เอกสารที่สแกน รูปภาพป้าย PDF ให้เป็นข้อความที่เครื่องอ่านและแก้ไขได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the bridge that makes the printed and handwritten world searchable and computable.

เจาะลึก

OCR แปลงพิกเซลที่ดูเหมือนตัวอักษรให้เป็นรหัสอักขระจริงที่คอมพิวเตอร์สามารถจัดเก็บและแก้ไขได้ OCR แบบคลาสสิกทำงานในขั้นตอนต่างๆ: ทำความสะอาดและลดความเอียงของรูปภาพ ค้นหาขอบเขตข้อความ แบ่งส่วนออกเป็นเส้นและสัญลักษณ์แต่ละอัน จากนั้นจำแนกแต่ละสัญลักษณ์โดยจับคู่รูปร่างกับรูปแบบที่รู้จัก OCR สมัยใหม่ส่วนใหญ่เป็นระบบประสาท: เครือข่ายแบบหมุนวนจะอ่านคุณลักษณะด้านภาพ และแบบจำลองลำดับ (มักมีการสูญเสีย CTC หรือตัวถอดรหัสตามความสนใจ) คาดการณ์สตริงทั้งหมดโดยไม่จำเป็นต้องแบ่งส่วนอักขระที่สมบูรณ์แบบ สิ่งนี้จะจัดการกับตัวอักษรที่ทับซ้อนกันและแบบอักษรที่หลากหลายได้ดีกว่ามาก เอ็นจิ้นเช่น Tesseract และบริการคลาวด์จาก Google, Amazon และ Microsoft ขณะนี้มีความแม่นยำสูงมากในการพิมพ์ที่สะอาดตา และรองรับภาษาและสคริปต์มากมาย

ข้อมูลเชิงลึกทางเทคนิค

ความก้าวหน้าครั้งสำคัญคือ Connectionist Temporal Classification (CTC) ระบบรุ่นเก่าต้องตัดคำเป็นตัวอักษรแยกกันก่อนจึงจะจดจำคำเหล่านั้นได้ ซึ่งมักเกิดข้อผิดพลาดเมื่อตัวอักษรสัมผัสหรือเปื้อน CTC ปล่อยให้เครือข่ายเกิดซ้ำหรือหม้อแปลงส่งสัญญาณความน่าจะเป็นสำหรับอักขระแต่ละตัวในแต่ละส่วนของภาพในแนวนอน จากนั้นยุบการทำซ้ำและเว้นว่างเพื่อสร้างคำสุดท้าย การดำเนินการนี้จะลบขั้นตอนการแบ่งส่วนแบบเปราะ และช่วยให้โมเดลเรียนรู้การจัดตำแหน่งระหว่างพิกเซลและอักขระโดยอัตโนมัติจากคู่ข้อความรูปภาพที่มีป้ายกำกับ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการรู้จำอักขระด้วยแสง

OCR กำลังผสานเข้ากับ 'เอกสาร AI' ที่กว้างขึ้นและโมเดลภาษาวิสัยทัศน์ที่อ่านหน้าและตอบคำถามเกี่ยวกับหน้านั้นโดยตรง โดยข้ามขั้นตอนการแยกข้อความที่แยกต่างหาก คาดหวังการจัดการที่แข็งแกร่งยิ่งขึ้นสำหรับลายมือที่ยุ่งเหยิง การเก็บถาวรในอดีต ภาพถ่ายในโทรศัพท์ความละเอียดต่ำ และเค้าโครงที่ซับซ้อน เช่น ตาราง แบบฟอร์ม และใบเสร็จรับเงิน การครอบคลุมสคริปต์หลายภาษาและทรัพยากรต่ำจะขยายเพิ่มขึ้นเรื่อยๆ และ OCR บนอุปกรณ์จะเร็วขึ้น ทำให้สามารถแปลป้ายถนนแบบเรียลไทม์และบันทึกข้อความใดๆ ที่กล้องเห็นได้ทันที

การใช้งานจริงในโลกแห่งความเป็นจริง

แอปธนาคารบนมือถือที่อ่านช่องบัญชีเช็คกระดาษ เส้นทาง และจำนวนเงิน เพื่อให้ผู้ใช้สามารถฝากเงินด้วยรูปถ่าย

Google Lens และ Apple Live Text ให้คุณคัดลอกข้อความจากรูปภาพหรือแปลเมนูภาษาต่างประเทศแบบเรียลไทม์

การแปลงหนังสือพิมพ์ประวัติศาสตร์และคลังข้อมูลห้องสมุดให้เป็นดิจิทัล เพื่อให้ข้อความฉบับเต็มสามารถค้นหาด้วยคำหลักได้

การประมวลผลใบแจ้งหนี้และใบเสร็จรับเงินอัตโนมัติในซอฟต์แวร์การบัญชีที่แยกผู้ขาย วันที่ และผลรวม

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรับรู้การกระทำ

คำถามที่พบบ่อย

What is Optical Character Recognition?

Optical Character Recognition (OCR) เปลี่ยนรูปภาพข้อความ เช่น เอกสารที่สแกน รูปภาพป้าย PDF ให้เป็นข้อความที่เครื่องอ่านและแก้ไขได้ เป็นสะพานที่ทำให้โลกที่พิมพ์และเขียนด้วยลายมือสามารถค้นหาและคำนวณได้

งานหลักของ OCR คืออะไร?

งานกำหนดของ OCR คือการเปลี่ยนพิกเซลที่แสดงตัวอักษรให้เป็นรหัสข้อความจริงที่คอมพิวเตอร์สามารถจัดเก็บ ค้นหา และแก้ไขได้

เทคนิคใดที่ช่วยให้ OCR สมัยใหม่หลีกเลี่ยงการตัดคำเป็นตัวอักษรแยกกันก่อนที่จะจดจำได้

CTC ช่วยให้เครือข่ายคาดเดาอักขระข้ามส่วนรูปภาพและยุบผลลัพธ์ โดยลบขั้นตอนการแบ่งส่วนที่เปราะบางต่อตัวอักษรออก

เหตุใด 'การเบี่ยงเบน' จึงเป็นขั้นตอนการประมวลผลล่วงหน้าทั่วไปในไปป์ไลน์ OCR

หน้าที่สแกนหรือถ่ายรูปมักจะถูกหมุนเล็กน้อย การลดการเอียงจะจัดข้อความในแนวนอน ช่วยเพิ่มความแม่นยำในการจดจำ

ข้อใดต่อไปนี้เป็นกลไก OCR แบบโอเพ่นซอร์สที่ใช้กันอย่างแพร่หลาย

Tesseract เป็นเอ็นจิ้น OCR โอเพ่นซอร์สยอดนิยมที่รองรับหลายภาษา ส่วนที่เหลือมีจุดประสงค์ที่ไม่เกี่ยวข้อง

เหตุใดข้อความที่เขียนด้วยลายมือโดยทั่วไปจึงยากสำหรับ OCR มากกว่าข้อความที่พิมพ์

การเขียนด้วยลายมือมีความหลากหลายอย่างมากทั้งในด้านรูปร่าง ความเอียง และการเว้นวรรค และตัวอักษรแบบตัวสะกดเชื่อมต่อกัน ทำให้การแบ่งส่วนและการจำแนกประเภททำได้ยากขึ้นมาก