Görsel Yapay Zeka KILAVUZU

Optik Karakter Tanıma

Optik Karakter Tanıma (OCR), metin görüntülerini (taranmış belgeler, işaret fotoğrafları, PDF'ler) makine tarafından okunabilen, düzenlenebilir metne dönüştürür.

2 min readSon güncelleme

Genel Bakış

It is the bridge that makes the printed and handwritten world searchable and computable.

Derin Dalış

OCR, harflere benzeyen pikselleri bilgisayarın depolayabileceği ve düzenleyebileceği gerçek karakter kodlarına dönüştürür. Klasik OCR aşamalar halinde çalışıyordu: görüntüyü temizleyin ve çarpıklığını giderin, metin bölgelerini bulun, bunları çizgilere ve ayrı ayrı gliflere bölün, ardından her bir glifi, şeklini bilinen desenlerle eşleştirerek sınıflandırın. Modern OCR büyük ölçüde sinirseldir: evrişimli bir ağ görsel özellikleri okur ve bir dizi modeli (genellikle bir CTC kaybı veya dikkat tabanlı bir kod çözücüyle), mükemmel karakter segmentasyonuna ihtiyaç duymadan tüm dizileri tahmin eder. Bu, el yazısı, üst üste binen harfler ve çeşitli yazı tiplerini çok daha iyi işler. Tesseract gibi motorların yanı sıra Google, Amazon ve Microsoft bulut hizmetleri artık temiz baskıda çok yüksek doğruluğa ulaşıyor ve düzinelerce dil ve komut dosyasını işliyor.

Teknik Bilgi

Büyük bir atılım Bağlantıcı Zamansal Sınıflandırma (CTC) idi. Eski sistemler, bir kelimeyi tanımadan önce ayrı harflere bölmek zorundaydı; harfler birbirine değdiğinde veya bulaştığında hataya açıktı. CTC, tekrarlayan veya transformatör ağının, görüntünün her yatay dilimindeki her karakter için bir olasılık çıktısı almasına izin verir, ardından son sözcüğü üretmek için tekrarları ve boşlukları daraltır. Bu, kırılgan segmentasyon adımını ortadan kaldırır ve modelin, etiketli görüntü-metin çiftlerinden pikseller ve karakterler arasındaki hizalamayı otomatik olarak öğrenmesine olanak tanır.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Optik Karakter Tanıma Teknolojisinin Geleceği

OCR, ayrı bir metin çıkarma adımını atlayarak bir sayfayı okuyan ve bu sayfayla ilgili soruları doğrudan yanıtlayan daha geniş "belge yapay zekası" ve görsel dil modelleriyle birleşiyor. Dağınık el yazılarının, tarihi arşivlerin, düşük çözünürlüklü telefon fotoğraflarının ve tablolar, formlar ve makbuzlar gibi karmaşık düzenlerin daha güçlü bir şekilde ele alınacağını bekleyebilirsiniz. Çok dilli ve düşük kaynak kodlu komut dosyası kapsamı genişlemeye devam edecek ve cihazdaki OCR daha hızlı hale gelecek ve sokak tabelalarının gerçek zamanlı çevirisine ve kameranın gördüğü herhangi bir metnin anında yakalanmasına olanak tanıyacak.

Gerçek Dünya Uygulaması

Kullanıcıların fotoğrafla para yatırabilmesi için kağıt çekin hesabını, yönlendirmesini ve tutar alanlarını okuyan mobil bankacılık uygulamaları

Google Lens ve Apple Live Text, bir fotoğraftan metin kopyalamanıza veya yabancı bir menüyü gerçek zamanlı olarak çevirmenize olanak tanır

Tam metnin anahtar kelimeyle aranabilir hale gelmesi için tarihi gazete ve kütüphane arşivlerinin dijitalleştirilmesi

Satıcıyı, tarihi ve toplamları çıkaran muhasebe yazılımında otomatik fatura ve makbuz işleme

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Sık sorulan sorular

What is Optical Character Recognition?

Optik Karakter Tanıma (OCR), metin görüntülerini (taranmış belgeler, işaret fotoğrafları, PDF'ler) makine tarafından okunabilen, düzenlenebilir metne dönüştürür. Basılı ve el yazısıyla yazılan dünyayı aranabilir ve hesaplanabilir kılan köprüdür.

OCR'nin temel işi nedir?

OCR'nin tanımlayıcı görevi, harfleri gösteren pikselleri bir bilgisayarın depolayabileceği, arayabileceği ve düzenleyebileceği gerçek metin kodlarına dönüştürmektir.

Hangi teknik, modern OCR'nin bir kelimeyi tanınmadan önce ayrı harflere bölmekten kaçınmasını sağlar?

CTC, ağın görüntü dilimlerindeki karakterleri tahmin etmesine ve sonucu daraltmasına olanak tanıyarak harf başına kırılgan segmentasyon adımını ortadan kaldırır.

OCR işlem hatlarında 'çarpıklık giderme' neden yaygın bir ön işleme adımıdır?

Taranan veya fotoğrafı çekilen sayfalar genellikle hafifçe döndürülür; çarpıklık giderme metni yatay olarak hizalayarak tanıma doğruluğunu artırır.

Bunlardan hangisi yaygın olarak kullanılan açık kaynaklı bir OCR motorudur?

Tesseract, birçok dili destekleyen popüler bir açık kaynaklı OCR motorudur; diğerleri ilgisiz amaçlara hizmet eder.

El yazısı metinler OCR için neden genellikle basılı metinlerden daha zordur?

El yazısının şekli, eğimi ve aralığı açısından büyük değişkenlik vardır ve el yazısı harfleri birbirine bağlanarak bölümlendirmeyi ve sınıflandırmayı çok daha zorlaştırır.