СледваСледващо ръководство
Разпознаване на математически формули (изображение към LaTeX)
Визуален AI
РЪКОВОДСТВО за визуален AI
Четенето на текст в сцена съчетава намирането на текст в естествени изображения с разпознаване на знаци или последователности от думи.
Текстът може да е извит, завъртян, малък, замъглен, стилизиран или вграден в бъркотия; откриването намира региони, докато разпознаването преобразува изрязване или последователност от функции в текст. И двата етапа могат да се провалят и успешното четене не установява, че текстът е правилен или безопасен за действие.
Откриването и разпознаването на сцена-текст са свързани, но отделни задачи. Детекторът локализира текстови области в изображение, често чрез създаване на кутии, многоъгълници или карти с точки. Устройството за разпознаване чете изрязан регион и извежда последователност от знаци или думи. Пълната система трябва да свързва етапите: пропуснатите региони не могат да бъдат разпознати, а лошо изрязаният текст може да обърка разпознаващия. Естествените изображения добавят перспектива, извити базови линии, променливи шрифтове, отблясъци, сенки, ниска разделителна способност и безпорядък на фона. CRAFT, описан в документ на CVPR, предсказва резултати за характер-регион и характер-афинитет. Индивидуалните региони на знаци могат да бъдат групирани в текстови екземпляри, което може да помогне с извити или неправилни форми в сравнение с твърдите кутии с думи. Отделно устройство за разпознаване след това чете всяка открита област. По-ранни изследвания на CRNN съчетават конволюционни характеристики с моделиране на последователност и транскрипция за текст на сцена. Това са примери за дизайнерски подходи, а не гаранции, че всеки конвейер използва една и съща архитектура. Оценяването трябва да оценява откриването и разпознаването поотделно, както и от край до край. Мерките за откриване могат да оценят регионално припокриване или прецизност и извикване; разпознаването може да бъде оценено с грешка в знак или дума. Включете ориентация, извит текст, езици, осветление и качество на изображението, представително за употреба. Запазете оригиналното изображение и покажете несигурни четения за корекция, особено за адреси, продуктови кодове или етикети за безопасност. Системите сцена-текст интерпретират пиксели; те не проверяват авторитета, истинността или контекста на дадена инструкция. Тествайте както изрязани текстови области, така и пълни изображения от край до край.
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Четенето на текстови сцени се движи към по-стабилни многоезични и цялостни системи, докато тръбопроводите за откриване плюс разпознаване остават полезни за отстраняване на грешки и специализирани контроли. По-добрите синтетични данни и по-големите визуални модели могат да подобрят покритието, но текстът в природата остава повлиян от качеството на заснемане и необичайните скриптове. Екипите трябва да тестват новите версии на модел върху местни изображения, да запазят сигналите за несигурност и да дадат на потребителите начин да коригират текст, преди той да задвижи последващ работен процес. Поддържайте версии на тестовите изображения и правилата за анотации, така че промените да останат сравними.
Приложението за превод първо открива регион на знак, изрязва го, разпознава текста, след което показва резултата до оригиналното изображение за корекция.
Складова камера тества OCR върху етикети под множество ъгли и разстояния, преди да използва четения за маршрутизиране на пакети.
Разработчикът оценява извитите букви на витрината отделно от хоризонталния печатен текст.
Рецензент потвърждава разпознат адрес или инструкция за безопасност спрямо изображението, преди да предприеме действие.
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Четенето на текст в сцена съчетава намирането на текст в естествени изображения с разпознаване на знаци или последователности от думи. Текстът може да е извит, завъртян, малък, замъглен, стилизиран или вграден в бъркотия; откриването намира региони, докато разпознаването преобразува изрязване или последователност от функции в текст. И двата етапа могат да се провалят и успешното четене не установява, че текстът е правилен или безопасен за действие.
Откриването локализира текста; разпознаването чете открития регион.
CRAFT комбинира региони на знаци и резултати за афинитет за групиране на текст.
Отделна оценка разкрива дали регионите са намерени и след това прочетени правилно.
Документът на CRNN описва конволюция, моделиране на последователности и транскрипция.
CER оценява текстови последователности, но не всички неуспешни откривания.
Продължавай да учиш
Още ръководства, избрани за тази тема
СледваСледващо ръководство
Разпознаване на математически формули (изображение към LaTeX)
Визуален AI