Mwongozo wa AI unaoonekana

Utambuzi wa Tabia ya Macho

Utambuzi wa Tabia za Macho (OCR) hubadilisha picha za maandishi - hati zilizochanganuliwa, picha za ishara, PDF - kuwa maandishi yanayoweza kusomeka na mashine, na yanayoweza kuhaririwa.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the bridge that makes the printed and handwritten world searchable and computable.

Dive ya kina

OCR hubadilisha saizi zinazofanana na herufi kuwa misimbo halisi ya herufi ambayo kompyuta inaweza kuhifadhi na kuhariri. OCR ya Kawaida ilifanya kazi kwa hatua: safisha na uondoe alama kwenye picha, tafuta sehemu za maandishi, uzigawanye katika mistari na glyfu mahususi, kisha uainisha kila glyfu kwa kulinganisha umbo lake dhidi ya mifumo inayojulikana. OCR ya kisasa kwa kiasi kikubwa ni ya neural: mtandao wa kubadilisha husoma vipengele vya kuona, na modeli ya mfuatano (mara nyingi ikiwa na hasara ya CTC au avkodare inayozingatia umakini) hutabiri mifuatano yote bila kuhitaji mgawanyo wa herufi kamili. Hii hushughulikia herufi za laana, zinazopishana, na fonti anuwai bora zaidi. Injini kama vile Tesseract, pamoja na huduma za wingu kutoka Google, Amazon, na Microsoft, sasa zinafikia usahihi wa juu sana wa kuchapisha safi na kushughulikia kadhaa za lugha na hati.

Ufahamu wa Kiufundi

Mafanikio makubwa yalikuwa Uainishaji wa Muda wa Connectionist (CTC). Mifumo ya zamani ilibidi kukata neno katika herufi tofauti kabla ya kuzitambua - huwa na makosa wakati herufi zinagusa au kupaka rangi. CTC huruhusu utoaji wa mtandao unaorudiwa au wa kibadilishaji nguvu uwezekano wa kila herufi katika kila kipande cha mlalo cha picha, kisha hukunja marudio na nafasi zilizo wazi ili kutoa neno la mwisho. Hii huondoa hatua ya mgawanyiko usio na nguvu na huruhusu kielelezo kujifunza upangaji kati ya pikseli na herufi kiotomatiki kutoka kwa jozi za maandishi ya picha zilizo na lebo.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Utambuzi wa Tabia ya Macho

OCR inaunganishwa kuwa 'hati AI' pana zaidi na miundo ya lugha ya maono ambayo husoma ukurasa na kujibu maswali kuuhusu moja kwa moja, na kuruka hatua tofauti ya kutoa maandishi. Tarajia ushughulikiaji thabiti zaidi wa mwandiko mbaya, kumbukumbu za kihistoria, picha za simu za ubora wa chini, na miundo changamano kama vile majedwali, fomu na stakabadhi. Utoaji wa hati kwa lugha nyingi na rasilimali za chini utaendelea kupanuka, na OCR ya kifaa itakua kwa kasi zaidi, kuwezesha utafsiri wa wakati halisi wa ishara za barabarani na kunasa papo hapo maandishi yoyote ambayo kamera inaona.

Utekelezaji wa Ulimwengu Halisi

Programu za benki ya simu zinazosoma akaunti ya hundi ya karatasi, uelekezaji na sehemu za kiasi ili watumiaji waweze kuweka pesa kwa picha

Google Lenzi na Maandishi ya Apple Live hukuruhusu kunakili maandishi kutoka kwa picha au kutafsiri menyu ya kigeni kwa wakati halisi.

Kuweka kidijitali kumbukumbu za kihistoria za magazeti na maktaba ili maandishi kamili yaweze kutafutwa na neno kuu

Uchakataji otomatiki wa ankara na risiti katika programu ya uhasibu ambayo hutoa muuzaji, tarehe na jumla.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Character Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Utambuzi wa Kitendo

Maswali yanayoulizwa mara kwa mara

What is Optical Character Recognition?

Utambuzi wa Tabia za Macho (OCR) hubadilisha picha za maandishi - hati zilizochanganuliwa, picha za ishara, PDF - kuwa maandishi yanayoweza kusomeka na mashine, na yanayoweza kuhaririwa. Ni daraja linalofanya ulimwengu uliochapishwa na kuandikwa kwa mkono kutafutwa na kutafutwa.

Kazi kuu ya OCR ni nini?

Jukumu la kufafanua la OCR ni kugeuza pikseli zinazoonyesha herufi kuwa misimbo halisi ya maandishi ambayo kompyuta inaweza kuhifadhi, kutafuta na kuhariri.

Ni mbinu gani huruhusu OCR ya kisasa kuepuka kukata neno katika herufi tofauti kabla ya kutambuliwa?

CTC huruhusu mtandao kutabiri herufi kwenye vipande vya picha na kukunja tokeo, na kuondoa hatua ndogo ya mgawanyo kwa kila herufi.

Kwa nini 'de-skewing' ni hatua ya kawaida ya usindikaji katika mabomba ya OCR?

Kurasa zilizochanganuliwa au zilizopigwa picha mara nyingi huzungushwa kidogo; de-skewing hupanga maandishi kwa mlalo, kuboresha usahihi wa utambuzi.

Ni ipi kati ya hizi inayotumika sana chanzo-wazi cha injini ya OCR?

Tesseract ni injini ya chanzo huria maarufu ya OCR inayoauni lugha nyingi; wengine hutumikia madhumuni yasiyohusiana.

Kwa nini maandishi yaliyoandikwa kwa mkono kwa ujumla ni magumu kwa OCR kuliko maandishi yaliyochapishwa?

Mwandiko una tofauti kubwa katika umbo, mteremko, na nafasi, na herufi za laana kuunganishwa, hivyo kufanya ugawaji na uainishaji kuwa mgumu zaidi.