광학 문자 인식
광학 문자 인식(OCR)은 스캔한 문서, 표지판 사진, PDF 등 텍스트 이미지를 기계가 읽을 수 있고 편집 가능한 텍스트로 변환합니다.
개요
It is the bridge that makes the printed and handwritten world searchable and computable.
심층 분석
OCR은 문자처럼 보이는 픽셀을 컴퓨터가 저장하고 편집할 수 있는 실제 문자 코드로 변환합니다. 클래식 OCR은 단계적으로 작동했습니다. 이미지를 정리하고 기울기를 조정하고, 텍스트 영역을 찾아 선과 개별 문자 모양으로 분할한 다음, 알려진 패턴과 모양을 일치시켜 각 문자 모양을 분류합니다. 최신 OCR은 대체로 신경적입니다. 컨벌루션 네트워크는 시각적 특징을 읽고 시퀀스 모델(종종 CTC 손실 또는 주의 기반 디코더 포함)은 완벽한 문자 분할 없이 전체 문자열을 예측합니다. 이는 필기체, 겹치는 문자 및 다양한 글꼴을 훨씬 더 잘 처리합니다. Tesseract와 같은 엔진과 Google, Amazon 및 Microsoft의 클라우드 서비스는 이제 깔끔한 인쇄에서 매우 높은 정확성을 달성하고 수십 개의 언어와 스크립트를 처리합니다.
기술적 통찰력
주요 혁신은 CTC(Connectionist Temporal Classification)였습니다. 이전 시스템은 단어를 인식하기 전에 단어를 별도의 문자로 잘라야 했으며 문자가 닿거나 번질 때 오류가 발생하기 쉽습니다. CTC를 사용하면 순환 또는 변환기 네트워크가 이미지의 각 수평 슬라이스에서 각 문자에 대한 확률을 출력한 다음 반복 및 공백을 축소하여 최종 단어를 생성합니다. 이렇게 하면 깨지기 쉬운 분할 단계가 제거되고 모델이 레이블이 지정된 이미지-텍스트 쌍에서 픽셀과 문자 간의 정렬을 자동으로 학습할 수 있습니다.
전략적 영향
속도와 규모
Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.
빌드 선택
크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.
팀과 워크플로우
이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.
광학 문자 인식의 미래
OCR은 별도의 텍스트 추출 단계를 건너뛰고 페이지를 읽고 이에 대한 질문에 직접 대답하는 광범위한 '문서 AI' 및 비전 언어 모델로 병합되고 있습니다. 지저분한 필기, 기록 보관소, 저해상도 전화 사진, 테이블, 양식, 영수증과 같은 복잡한 레이아웃을 더욱 강력하게 처리할 수 있습니다. 다국어 및 리소스가 적은 스크립트 범위는 계속 확장될 것이며, 기기 내 OCR은 더욱 빨라져 거리 표지판을 실시간으로 번역하고 카메라가 보는 모든 텍스트를 즉시 캡처할 수 있습니다.
실제 구현
종이 수표의 계좌, 라우팅, 금액 필드를 읽어 사용자가 사진으로 입금할 수 있는 모바일 뱅킹 앱
Google 사진에서 텍스트를 복사하거나 외국 메뉴를 실시간으로 번역할 수 있는 렌즈 및 Apple 라이브 텍스트
전체 텍스트를 키워드로 검색할 수 있도록 역사 신문과 도서관 기록 보관소를 디지털화
공급업체, 날짜 및 합계를 추출하는 회계 소프트웨어에서 자동 송장 및 영수증 처리
위험 및 가드레일
출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.
모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.
신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.
구현 로드맵
정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.
실제 생산 조건과 일치하는 데이터로 테스트합니다.
신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.
모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Optical Character Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
행동 인식
자주 묻는 질문
What is Optical Character Recognition?
광학 문자 인식(OCR)은 스캔한 문서, 표지판 사진, PDF 등 텍스트 이미지를 기계가 읽을 수 있고 편집 가능한 텍스트로 변환합니다. 인쇄되고 손으로 쓴 세계를 검색하고 계산할 수 있게 만드는 다리입니다.
OCR의 핵심업무는 무엇인가요?
OCR의 정의 작업은 문자를 묘사하는 픽셀을 컴퓨터가 저장, 검색 및 편집할 수 있는 실제 텍스트 코드로 바꾸는 것입니다.
현대 OCR이 인식되기 전에 단어를 별도의 문자로 자르는 것을 방지할 수 있는 기술은 무엇입니까?
CTC를 사용하면 네트워크가 이미지 조각 전체에서 문자를 예측하고 결과를 축소하여 깨지기 쉬운 문자별 분할 단계를 제거할 수 있습니다.
OCR 파이프라인에서 '기울어짐 보정'이 일반적인 전처리 단계인 이유는 무엇입니까?
스캔하거나 사진을 찍은 페이지는 종종 약간 회전됩니다. 기울기를 조정하면 텍스트가 수평으로 정렬되어 인식 정확도가 향상됩니다.
다음 중 널리 사용되는 오픈 소스 OCR 엔진은 무엇입니까?
Tesseract는 다양한 언어를 지원하는 인기 있는 오픈 소스 OCR 엔진입니다. 다른 것들은 관련없는 목적으로 사용됩니다.
일반적으로 손으로 쓴 텍스트가 인쇄된 텍스트보다 OCR에 더 어려운 이유는 무엇입니까?
손글씨는 모양, 기울기, 간격이 매우 다양하고 필기체 문자가 연결되어 분할 및 분류가 훨씬 더 어려워집니다.