PANDUAN AI Visual

Pengenalan Karakter Optik

Pengenalan Karakter Optik (OCR) mengubah gambar teks — dokumen yang dipindai, foto tanda, PDF — menjadi teks yang dapat dibaca mesin dan dapat diedit.

2 min readTerakhir diperbarui

Ikhtisar

It is the bridge that makes the printed and handwritten world searchable and computable.

Menyelam Lebih Dalam

OCR mengubah piksel yang terlihat seperti huruf menjadi kode karakter sebenarnya yang dapat disimpan dan diedit oleh komputer. OCR klasik bekerja secara bertahap: membersihkan dan menghilangkan kemiringan gambar, menemukan wilayah teks, mengelompokkannya menjadi garis dan mesin terbang individual, lalu mengklasifikasikan setiap mesin terbang dengan mencocokkan bentuknya dengan pola yang diketahui. OCR modern sebagian besar bersifat neural: jaringan konvolusional membaca fitur visual, dan model urutan (seringkali dengan kehilangan CTC atau decoder berbasis perhatian) memprediksi keseluruhan string tanpa memerlukan segmentasi karakter yang sempurna. Ini menangani huruf kursif, tumpang tindih, dan font yang bervariasi dengan jauh lebih baik. Mesin seperti Tesseract, ditambah layanan cloud dari Google, Amazon, dan Microsoft, kini mencapai akurasi sangat tinggi pada pencetakan bersih dan menangani lusinan bahasa dan skrip.

Wawasan Teknis

Sebuah terobosan besar adalah Connectionist Temporal Classification (CTC). Sistem yang lebih lama harus memotong sebuah kata menjadi huruf-huruf terpisah sebelum mengenalinya — rawan kesalahan ketika huruf-huruf bersentuhan atau tercoreng. CTC memungkinkan jaringan berulang atau transformator menghasilkan probabilitas untuk setiap karakter pada setiap irisan horizontal gambar, kemudian menciutkan pengulangan dan mengosongkan untuk menghasilkan kata akhir. Hal ini menghilangkan langkah segmentasi yang rapuh dan memungkinkan model mempelajari penyelarasan antara piksel dan karakter secara otomatis dari pasangan gambar-teks berlabel.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Pengenalan Karakter Optik

OCR bergabung menjadi 'AI dokumen' yang lebih luas dan model bahasa visi yang membaca halaman dan menjawab pertanyaan tentang halaman tersebut secara langsung, tanpa melakukan langkah ekstraksi teks terpisah. Harapkan penanganan yang lebih baik terhadap tulisan tangan yang berantakan, arsip sejarah, foto ponsel beresolusi rendah, dan tata letak yang rumit seperti tabel, formulir, dan tanda terima. Cakupan multibahasa dan skrip dengan sumber daya rendah akan terus berkembang, dan OCR pada perangkat akan menjadi lebih cepat, memungkinkan terjemahan rambu jalan secara real-time dan menangkap teks apa pun yang dilihat kamera secara instan.

Implementasi Dunia Nyata

Aplikasi perbankan seluler yang membaca bidang rekening, perutean, dan jumlah cek kertas sehingga pengguna dapat menyetor melalui foto

Google Lensa dan Apple Live Text memungkinkan Anda menyalin teks dari foto atau menerjemahkan menu asing secara real-time

Mendigitalkan arsip surat kabar dan perpustakaan bersejarah sehingga teks lengkapnya dapat dicari dengan kata kunci

Pemrosesan faktur dan tanda terima otomatis dalam perangkat lunak akuntansi yang mengekstrak vendor, tanggal, dan total

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pengakuan Tindakan

Pertanyaan yang sering diajukan

What is Optical Character Recognition?

Pengenalan Karakter Optik (OCR) mengubah gambar teks — dokumen yang dipindai, foto tanda, PDF — menjadi teks yang dapat dibaca mesin dan dapat diedit. Ini adalah jembatan yang membuat dunia cetak dan tulisan tangan dapat dicari dan dihitung.

Apa tugas inti OCR?

Tugas utama OCR adalah mengubah piksel yang menggambarkan huruf menjadi kode teks sebenarnya yang dapat disimpan, dicari, dan diedit oleh komputer.

Teknik manakah yang memungkinkan OCR modern menghindari pemotongan kata menjadi huruf-huruf terpisah sebelum dikenali?

CTC memungkinkan jaringan memprediksi karakter di seluruh potongan gambar dan menciutkan hasilnya, menghilangkan langkah segmentasi per huruf yang rapuh.

Mengapa 'menghilangkan kemiringan' merupakan langkah pra-pemrosesan yang umum dalam pipeline OCR?

Halaman yang dipindai atau difoto sering kali diputar sedikit; menghilangkan kemiringan menyelaraskan teks secara horizontal, meningkatkan akurasi pengenalan.

Manakah dari mesin OCR sumber terbuka berikut yang banyak digunakan?

Tesseract adalah mesin OCR sumber terbuka populer yang mendukung banyak bahasa; yang lain melayani tujuan yang tidak terkait.

Mengapa teks tulisan tangan umumnya lebih sulit untuk OCR dibandingkan teks cetak?

Tulisan tangan memiliki variabilitas yang sangat besar dalam bentuk, kemiringan, dan spasi, serta huruf kursif yang terhubung, membuat segmentasi dan klasifikasi menjadi lebih sulit.