Visuele AI-GIDS

Optische karakterherkenning

Optical Character Recognition (OCR) zet afbeeldingen van tekst (gescande documenten, foto's van borden, PDF's) om in machinaal leesbare, bewerkbare tekst.

2 min readLaatst bijgewerkt

Overzicht

It is the bridge that makes the printed and handwritten world searchable and computable.

Diepe duik

OCR zet pixels die op letters lijken, om in daadwerkelijke tekencodes die een computer kan opslaan en bewerken. Klassieke OCR werkte in fasen: maak de afbeelding schoon en verwijder de scheeftrekkingen, zoek tekstgebieden, segmenteer ze in lijnen en individuele glyphs en classificeer vervolgens elke glyph door de vorm ervan af te stemmen op bekende patronen. Moderne OCR is grotendeels neuraal: een convolutioneel netwerk leest visuele kenmerken, en een sequentiemodel (vaak met een CTC-verlies of een op aandacht gebaseerde decoder) voorspelt hele reeksen zonder dat perfecte karaktersegmentatie nodig is. Dit verwerkt veel beter cursieve, overlappende letters en gevarieerde lettertypen. Engines zoals Tesseract, plus cloudservices van Google, Amazon en Microsoft, bereiken nu een zeer hoge nauwkeurigheid bij schoon afdrukken en kunnen tientallen talen en scripts verwerken.

Technisch inzicht

Een grote doorbraak was de Connectionist Temporal Classification (CTC). Oudere systemen moesten een woord in afzonderlijke letters hakken voordat ze het herkenden – foutgevoelig als letters elkaar raken of uitsmeren. CTC laat een terugkerend of transformerend netwerk een waarschijnlijkheid uitvoeren voor elk teken in elk horizontaal deel van het beeld, en vouwt vervolgens herhalingen en spaties samen om het laatste woord te produceren. Hierdoor wordt de broze segmentatiestap verwijderd en kan het model automatisch de uitlijning tussen pixels en tekens leren uit gelabelde afbeelding-tekstparen.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van optische karakterherkenning

OCR versmelt met bredere 'document AI'- en vision-taalmodellen die een pagina lezen en vragen daarover direct beantwoorden, waarbij een afzonderlijke stap voor het extraheren van tekst wordt overgeslagen. Verwacht een betere verwerking van rommelig handschrift, historische archieven, telefoonfoto's met een lage resolutie en complexe lay-outs zoals tabellen, formulieren en bonnen. De dekking voor meertalige scripts en scripts met weinig middelen zal blijven uitbreiden, en OCR op het apparaat zal sneller worden, waardoor realtime vertaling van straatnaamborden en onmiddellijke registratie van elke tekst die een camera ziet mogelijk wordt.

Implementatie in de echte wereld

Apps voor mobiel bankieren die de rekening-, routerings- en bedragvelden van een papieren cheque lezen, zodat gebruikers per foto kunnen storten

Google Lens en Apple Live Text waarmee je in realtime tekst uit een foto kunt kopiëren of een buitenlands menu kunt vertalen

Digitaliseren van historische kranten- en bibliotheekarchieven zodat de volledige tekst op trefwoorden doorzoekbaar wordt

Geautomatiseerde factuur- en ontvangstverwerking in boekhoudsoftware die leverancier, datum en totalen extraheert

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Actieherkenning

Frequently asked questions

What is Optical Character Recognition?

Optical Character Recognition (OCR) zet afbeeldingen van tekst (gescande documenten, foto's van borden, PDF's) om in machinaal leesbare, bewerkbare tekst. Het is de brug die de gedrukte en handgeschreven wereld doorzoekbaar en berekenbaar maakt.

Wat is de kerntaak van OCR?

De bepalende taak van OCR is het omzetten van pixels die letters weergeven in daadwerkelijke tekstcodes die een computer kan opslaan, doorzoeken en bewerken.

Met welke techniek kan moderne OCR voorkomen dat een woord in afzonderlijke letters wordt gesplitst voordat het wordt herkend?

Met CTC kan het netwerk tekens voorspellen in verschillende beeldsegmenten en het resultaat samenvouwen, waardoor de broze segmentatiestap per letter wordt geëlimineerd.

Waarom is 'de-skewing' een gebruikelijke voorverwerkingsstap in OCR-pijplijnen?

Gescande of gefotografeerde pagina's zijn vaak lichtjes gedraaid; Door het rechtzetten wordt de tekst horizontaal uitgelijnd, waardoor de herkenningsnauwkeurigheid wordt verbeterd.

Welke van deze is een veelgebruikte open-source OCR-engine?

Tesseract is een populaire open-source OCR-engine die vele talen ondersteunt; de anderen dienen niet-gerelateerde doeleinden.

Waarom is handgeschreven tekst over het algemeen moeilijker voor OCR dan gedrukte tekst?

Handschrift kent een enorme variabiliteit in vorm, helling en spatiëring, en cursieve letters verbinden zich, waardoor segmentatie en classificatie veel moeilijker wordt.