Vizuální průvodce AI

Optické rozpoznávání znaků

Optické rozpoznávání znaků (OCR) mění obrázky textu – naskenované dokumenty, fotografie nápisů, PDF – na strojově čitelný a upravitelný text.

2 minuty čteníNaposledy aktualizováno

Přehled

It is the bridge that makes the printed and handwritten world searchable and computable.

Hluboký ponor

OCR převádí pixely, které vypadají jako písmena, na skutečné kódy znaků, které může počítač uložit a upravit. Klasické OCR fungovalo ve fázích: vyčistěte a odstraňte zkosení obrazu, vyhledejte textové oblasti, segmentujte je do čar a jednotlivých glyfů a poté klasifikujte každý glyf tak, že jeho tvar porovnáte se známými vzory. Moderní OCR je převážně neurální: konvoluční síť čte vizuální prvky a sekvenční model (často se ztrátou CTC nebo dekodérem založeným na pozornosti) předpovídá celé řetězce, aniž by potřeboval dokonalou segmentaci znaků. To mnohem lépe zvládá kurzíva, překrývající se písmena a různá písma. Motory jako Tesseract a cloudové služby od Google, Amazon a Microsoft nyní dosahují velmi vysoké přesnosti čistého tisku a zvládají desítky jazyků a skriptů.

Technický přehled

Velkým průlomem byla Connectionist Temporal Classification (CTC). Starší systémy musely rozřezat slovo na samostatná písmena, než je rozpoznaly – náchylné k chybám, když se písmena dotýkají nebo se rozmazávají. CTC umožňuje rekurentní nebo transformátorové síti vydávat pravděpodobnost pro každý znak na každém vodorovném řezu obrazu, poté sbalí opakování a vymaže poslední slovo. Tím se odstraní krok křehké segmentace a model se automaticky naučí zarovnání mezi pixely a znaky z označených párů obrázek-text.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost optického rozpoznávání znaků

OCR se spojuje do širších modelů „umělé inteligence dokumentů“ a vizuálních jazyků, které čtou stránku a přímo odpovídají na otázky o ní, přičemž přeskakují samostatný krok extrakce textu. Očekávejte lepší zacházení s neuspořádaným rukopisem, historickými archivy, fotografiemi z telefonu v nízkém rozlišení a složitými rozvrženími, jako jsou tabulky, formuláře a účtenky. Vícejazyčné pokrytí skripty s nízkými zdroji se bude neustále rozšiřovat a OCR na zařízení bude rychlejší, což umožní překlad dopravních značek v reálném čase a okamžité zachycení jakéhokoli textu, který kamera uvidí.

Real-World Implementace

Aplikace mobilního bankovnictví, které čtou účet papírového šeku, směrování a pole částky, takže uživatelé mohou vkládat peníze podle fotografie

Google Lens a Apple Live Text umožňují kopírovat text z fotografie nebo překládat cizí menu v reálném čase

Digitalizace archivů historických novin a knihoven, aby bylo možné v celém textu vyhledávat pomocí klíčových slov

Automatizované zpracování faktur a účtenek v účetním softwaru, který extrahuje dodavatele, datum a součty

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is Optical Character Recognition?

Optické rozpoznávání znaků (OCR) mění obrázky textu – naskenované dokumenty, fotografie nápisů, PDF – na strojově čitelný a upravitelný text. Je to most, díky kterému je tištěný a ručně psaný svět prohledávatelný a vyčíslitelný.

Co je hlavní prací OCR?

Definujícím úkolem OCR je přeměnit pixely znázorňující písmena na skutečné textové kódy, které může počítač ukládat, vyhledávat a upravovat.

Která technika umožňuje modernímu OCR vyhnout se řezání slova na samostatná písmena před rozpoznáním?

CTC umožňuje síti předvídat znaky napříč obrazovými řezy a sbalit výsledek, čímž odstraní křehký krok segmentace podle písmen.

Proč je „de-skewing“ běžným krokem předběžného zpracování v kanálech OCR?

Naskenované nebo vyfotografované stránky jsou často mírně otočené; odstranění zkosení zarovná text vodorovně, čímž se zlepší přesnost rozpoznávání.

Který z nich je široce používaný open-source OCR engine?

Tesseract je populární open-source OCR engine, který podporuje mnoho jazyků; ostatní slouží nesouvisejícím účelům.

Proč je ručně psaný text obecně pro OCR těžší než tištěný text?

Rukopis má obrovskou variabilitu ve tvaru, sklonu a mezerách a kurzívní písmena se spojují, což značně ztěžuje segmentaci a klasifikaci.