Vizuális MI ÚTMUTATÓ

Optikai karakterfelismerés

Az optikai karakterfelismerés (OCR) a szöveg képeit – beolvasott dokumentumokat, jelképeket, PDF-eket – géppel olvasható, szerkeszthető szöveggé alakítja.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the bridge that makes the printed and handwritten world searchable and computable.

Mély merülés

Az OCR a betűknek látszó képpontokat tényleges karakterkódokká alakítja, amelyeket a számítógép tárolhat és szerkeszthet. A klasszikus OCR szakaszosan működött: a kép megtisztítása és torzításának megszüntetése, szövegrégiók keresése, vonalakra és egyedi karakterjelekre szegmentálása, majd az egyes karakterjelek osztályozása úgy, hogy az alakjukat az ismert mintákhoz illeszti. A modern OCR nagyrészt neurális: a konvolúciós hálózat beolvassa a vizuális jellemzőket, a sorozatmodell pedig (gyakran CTC veszteséggel vagy figyelemalapú dekóderrel) egész karakterláncokat jósol meg anélkül, hogy tökéletes karakterszegmentációra lenne szüksége. Ez sokkal jobban kezeli a kurzív, egymást átfedő betűket és a változatos betűtípusokat. Az olyan motorok, mint a Tesseract, valamint az Google, az Amazon és az Microsoft felhőszolgáltatásai, most nagyon nagy pontosságot érnek el tiszta nyomtatással, és több tucat nyelvet és szkriptet kezelnek.

Technikai betekintés

A nagy áttörést a Connectionist Temporal Classification (CTC) jelentette. A régebbi rendszereknek külön betűkre kellett vágniuk egy szót, mielőtt felismerték volna őket – hajlamosak voltak a hibákra, ha a betűk összeérnek vagy elkenődnek. A CTC lehetővé teszi, hogy a visszatérő vagy transzformátor hálózat minden karakterhez egy valószínűséget adjon ki a kép minden vízszintes szeleténél, majd összecsukja az ismétléseket és üreseket a végső szó létrehozásához. Ez eltávolítja a törékeny szegmentálási lépést, és lehetővé teszi, hogy a modell automatikusan megtanulja a pixelek és a karakterek közötti igazítást a címkézett kép-szöveg párokból.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

Az optikai karakterfelismerés jövője

Az OCR tágabb „dokumentum AI” és vision-nyelvi modellekké egyesül, amelyek elolvassák az oldalt, és közvetlenül válaszolnak a vele kapcsolatos kérdésekre, kihagyva egy külön szövegkivonási lépést. A rendetlen kézírások, a történelmi archívumok, az alacsony felbontású telefonos fényképek és az összetett elrendezések, például táblázatok, űrlapok és nyugták hatékonyabb kezelése várható. A többnyelvű és alacsony erőforrás-igényű szkriptek lefedettsége folyamatosan bővül, az eszközön lévő OCR pedig gyorsabb lesz, lehetővé téve az utcatáblák valós idejű fordítását és a kamera által látott szövegek azonnali rögzítését.

Valós megvalósítás

Mobilbanki alkalmazások, amelyek beolvasják a papíralapú csekk számláját, az útválasztást és az összeg mezőit, így a felhasználók fénykép alapján fizethetnek be

Google A Lens és az Apple Live Text segítségével szöveget másolhat egy fotóról, vagy lefordíthat egy idegen menüt valós időben

Történelmi újságok és könyvtári archívumok digitalizálása, így a teljes szöveg kulcsszavas kereshetővé válik

Automatizált számla- és nyugtafeldolgozás a számviteli szoftverben, amely kivonja a szállítót, a dátumot és a végösszegeket

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Optical Character Recognition?

Az optikai karakterfelismerés (OCR) a szöveg képeit – beolvasott dokumentumokat, jelképeket, PDF-eket – géppel olvasható, szerkeszthető szöveggé alakítja. Ez az a híd, amely kereshetővé és kiszámíthatóvá teszi a nyomtatott és kézzel írt világot.

Mi az OCR fő feladata?

Az OCR meghatározó feladata a betűket ábrázoló képpontok tényleges szövegkódokká alakítása, amelyeket a számítógép tárolhat, kereshet és szerkeszthet.

Melyik technika teszi lehetővé a modern OCR-nek, hogy elkerülje a szó külön betűkre vágását a felismerés előtt?

A CTC lehetővé teszi, hogy a hálózat előrejelezze a karaktereket a képszeletek között, és összecsukja az eredményt, eltávolítva a törékeny betűnkénti szegmentálási lépést.

Miért gyakori előfeldolgozási lépés az OCR-folyamatokban a „ferdítés-mentesítés”?

A beszkennelt vagy fényképezett oldalakat gyakran kissé elforgatják; A ferdeségmentesítés vízszintesen igazítja a szöveget, javítva a felismerés pontosságát.

Ezek közül melyik a széles körben használt nyílt forráskódú OCR motor?

A Tesseract egy népszerű nyílt forráskódú OCR-motor, amely számos nyelvet támogat; a többiek nem összefüggő célokat szolgálnak.

Miért nehezebb a kézzel írt szöveg az OCR-nél, mint a nyomtatott szöveg?

A kézírás alakja, dőlése és térköze rendkívül változatos, a kurzív betűk pedig összekapcsolódnak, ami sokkal nehezebbé teszi a szegmentálást és az osztályozást.