Optické rozpoznávání znaků
Optické rozpoznávání znaků (OCR) mění obrázky textu – naskenované dokumenty, fotografie nápisů, PDF – na strojově čitelný a upravitelný text.
Přehled
It is the bridge that makes the printed and handwritten world searchable and computable.
Hluboký ponor
OCR převádí pixely, které vypadají jako písmena, na skutečné kódy znaků, které může počítač uložit a upravit. Klasické OCR fungovalo ve fázích: vyčistěte a odstraňte zkosení obrazu, vyhledejte textové oblasti, segmentujte je do čar a jednotlivých glyfů a poté klasifikujte každý glyf tak, že jeho tvar porovnáte se známými vzory. Moderní OCR je převážně neurální: konvoluční síť čte vizuální prvky a sekvenční model (často se ztrátou CTC nebo dekodérem založeným na pozornosti) předpovídá celé řetězce, aniž by potřeboval dokonalou segmentaci znaků. To mnohem lépe zvládá kurzíva, překrývající se písmena a různá písma. Motory jako Tesseract a cloudové služby od Google, Amazon a Microsoft nyní dosahují velmi vysoké přesnosti čistého tisku a zvládají desítky jazyků a skriptů.
Technický přehled
Velkým průlomem byla Connectionist Temporal Classification (CTC). Starší systémy musely rozřezat slovo na samostatná písmena, než je rozpoznaly – náchylné k chybám, když se písmena dotýkají nebo se rozmazávají. CTC umožňuje rekurentní nebo transformátorové síti vydávat pravděpodobnost pro každý znak na každém vodorovném řezu obrazu, poté sbalí opakování a vymaže poslední slovo. Tím se odstraní krok křehké segmentace a model se automaticky naučí zarovnání mezi pixely a znaky z označených párů obrázek-text.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost optického rozpoznávání znaků
OCR se spojuje do širších modelů „umělé inteligence dokumentů“ a vizuálních jazyků, které čtou stránku a přímo odpovídají na otázky o ní, přičemž přeskakují samostatný krok extrakce textu. Očekávejte lepší zacházení s neuspořádaným rukopisem, historickými archivy, fotografiemi z telefonu v nízkém rozlišení a složitými rozvrženími, jako jsou tabulky, formuláře a účtenky. Vícejazyčné pokrytí skripty s nízkými zdroji se bude neustále rozšiřovat a OCR na zařízení bude rychlejší, což umožní překlad dopravních značek v reálném čase a okamžité zachycení jakéhokoli textu, který kamera uvidí.
Real-World Implementace
Aplikace mobilního bankovnictví, které čtou účet papírového šeku, směrování a pole částky, takže uživatelé mohou vkládat peníze podle fotografie
Google Lens a Apple Live Text umožňují kopírovat text z fotografie nebo překládat cizí menu v reálném čase
Digitalizace archivů historických novin a knihoven, aby bylo možné v celém textu vyhledávat pomocí klíčových slov
Automatizované zpracování faktur a účtenek v účetním softwaru, který extrahuje dodavatele, datum a součty
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Character Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Rozpoznávání akcí
Často kladené otázky
What is Optical Character Recognition?
Optické rozpoznávání znaků (OCR) mění obrázky textu – naskenované dokumenty, fotografie nápisů, PDF – na strojově čitelný a upravitelný text. Je to most, díky kterému je tištěný a ručně psaný svět prohledávatelný a vyčíslitelný.
Co je hlavní prací OCR?
Definujícím úkolem OCR je přeměnit pixely znázorňující písmena na skutečné textové kódy, které může počítač ukládat, vyhledávat a upravovat.
Která technika umožňuje modernímu OCR vyhnout se řezání slova na samostatná písmena před rozpoznáním?
CTC umožňuje síti předvídat znaky napříč obrazovými řezy a sbalit výsledek, čímž odstraní křehký krok segmentace podle písmen.
Proč je „de-skewing“ běžným krokem předběžného zpracování v kanálech OCR?
Naskenované nebo vyfotografované stránky jsou často mírně otočené; odstranění zkosení zarovná text vodorovně, čímž se zlepší přesnost rozpoznávání.
Který z nich je široce používaný open-source OCR engine?
Tesseract je populární open-source OCR engine, který podporuje mnoho jazyků; ostatní slouží nesouvisejícím účelům.
Proč je ručně psaný text obecně pro OCR těžší než tištěný text?
Rukopis má obrovskou variabilitu ve tvaru, sklonu a mezerách a kurzívní písmena se spojují, což značně ztěžuje segmentaci a klasifikaci.