Оптично разпознаване на знаци
Оптичното разпознаване на знаци (OCR) превръща изображения на текст – сканирани документи, снимки на знаци, PDF файлове – в машинно четим, редактируем текст.
Преглед
It is the bridge that makes the printed and handwritten world searchable and computable.
Дълбоко гмуркане
OCR преобразува пиксели, които изглеждат като букви, в действителни кодове на знаци, които компютърът може да съхранява и редактира. Класическото OCR работеше на етапи: изчистване и премахване на изкривяването на изображението, намиране на текстови области, сегментиране на линии и отделни глифове, след което класифициране на всеки глиф чрез съпоставяне на формата му с известни модели. Модерното OCR е до голяма степен невронно: конволюционна мрежа чете визуални характеристики, а модел на последователност (често със загуба на CTC или декодер, базиран на вниманието) предвижда цели низове, без да се нуждае от перфектно сегментиране на знаци. Това се справя много по-добре с курсив, припокриващи се букви и разнообразни шрифтове. Двигатели като Tesseract, плюс облачни услуги от Google, Amazon и Microsoft, вече достигат много висока точност при чист печат и обработват десетки езици и скриптове.
Техническа информация
Основен пробив беше Connectionist Temporal Classification (CTC). По-старите системи трябваше да разделят думата на отделни букви, преди да ги разпознаят - податливи на грешки, когато буквите се докосват или размазват. CTC позволява на рекурентна или трансформаторна мрежа да изведе вероятност за всеки знак във всеки хоризонтален срез на изображението, след което свива повторенията и празните места, за да произведе последната дума. Това премахва крехката стъпка на сегментиране и позволява на модела да научи автоматично подравняване между пиксели и знаци от етикетирани двойки изображение-текст.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на оптичното разпознаване на знаци
OCR се слива с по-широк „документен изкуствен интелект“ и модели на визуален език, които четат страница и отговарят директно на въпроси за нея, като пропускат отделна стъпка за извличане на текст. Очаквайте по-добро управление на разхвърлян почерк, исторически архиви, телефонни снимки с ниска разделителна способност и сложни оформления като таблици, формуляри и разписки. Многоезичното и нискоскриптово покритие ще продължи да се разширява, а OCR на устройството ще става по-бързо, позволявайки превод в реално време на улични знаци и незабавно заснемане на всеки текст, който камерата вижда.
Внедряване в реалния свят
Приложения за мобилно банкиране, които четат полетата за сметка, маршрут и сума на хартиен чек, така че потребителите да могат да депозират чрез снимка
Google Lens и Apple Live Text, които ви позволяват да копирате текст от снимка или да превеждате меню на чужд език в реално време
Дигитализиране на архиви на исторически вестници и библиотеки, така че пълният текст да стане достъпен за търсене по ключови думи
Автоматизирана обработка на фактури и разписки в счетоводен софтуер, който извлича доставчик, дата и общи суми
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Character Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Разпознаване на действие
Frequently asked questions
What is Optical Character Recognition?
Оптичното разпознаване на знаци (OCR) превръща изображения на текст – сканирани документи, снимки на знаци, PDF файлове – в машинно четим, редактируем текст. Това е мостът, който прави печатния и ръкописния свят годен за търсене и изчислим.
Каква е основната задача на OCR?
Определящата задача на OCR е превръщането на пикселите, които изобразяват букви, в действителни текстови кодове, които компютърът може да съхранява, търси и редактира.
Коя техника позволява на съвременния OCR да избегне нарязването на дума на отделни букви преди разпознаването?
CTC позволява на мрежата да предвижда символи в срезове на изображението и да свива резултата, премахвайки крехката стъпка на сегментиране по буква.
Защо „отстраняването на изкривяването“ е обичайна стъпка на предварителна обработка в конвейерите за OCR?
Сканираните или фотографирани страници често са леко завъртяни; отстраняването на изкривяването подравнява текста хоризонтално, подобрявайки точността на разпознаване.
Кое от тях е широко използван OCR двигател с отворен код?
Tesseract е популярна OCR машина с отворен код, която поддържа много езици; другите служат за несвързани цели.
Защо ръкописният текст обикновено е по-труден за OCR от печатния текст?
Почеркът има огромна променливост във формата, наклона и разстоянието, а курсивните букви се свързват, което прави сегментирането и класификацията много по-трудни.