Візуальний AI GUIDE

Візуалізація тексту в зображеннях, створених штучним інтелектом

Генератори зображень зі штучним інтелектом створювали спотворений текст, оскільки їхні текстові кодери, такі як CLIP, перетворювали підказки на підсловні маркери, які фіксували загальне значення, але не орфографію по буквах, через що модель зображення не мала точного сигналу про форми літер.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє відтворення тексту в зображеннях, створених штучним інтелектом
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Розбірливі написи надійшли через більші кодери тексту на основі мовної моделі, кодери з розпізнаванням символів, орієнтовані на текст навчальні дані та нові архітектури. Це важливо для тих, хто створює плакати, логотипи, меми чи макети упаковки.

Глибоке занурення

Письменництво є невблаганною мішенню. Обличчя може бути трохи зміщеним і все одно читатися як обличчя, але одне неправильне наведення перетворює «е» на «с». Ранні дифузійні моделі дізналися, що вивіски магазинів, обкладинки книг і футболки містять літери, тому вони створювали фігури з ритмом тексту, в той час як фактичні літери вводили неправильно. Основною причиною став кодувальник тексту. Stable Diffusion 1.x використовував текстовий кодувальник CLIP OpenAI, який був навчений зіставляти цілі підписи з зображеннями. CLIP розділяє слова на лексеми підслова, тому таке слово, як «пекарня», може стати єдиним лексемом, а модель зображення отримує представлення значення, а не послідовність літер. Ніщо в цьому сигналі не говорить «b, потім a, потім k». Дослідження Imagen, проведене Google у 2022 році, виявило, що великий заморожений кодер мовної моделі T5 покращив підказку, а його зразки відтворювали текст помітно краще. Подальше дослідження Google на символьних моделях показало, що кодери на рівні байтів, такі як ByT5, які бачать окремі символи, пишуться набагато краще. Розв’язка також мала значення. Маленькі літери займають дуже мало клітинок у стиснутому латентному вигляді, тому тонкі штрихи розпливаються. Ще одним обмеженням були навчальні дані. Підписи рідко виписували текст, видимий на зображенні, тому модель не могла зв’язати слова з літерами. Прогрес відбувався з кількох напрямків. DeepFloyd IF і Stable Diffusion 3 поєднали свої моделі зображення з кодерами T5. Дослідницькі системи, такі як TextDiffuser і GlyphControl, надавали моделі чіткі макети або попередньо відрендерені зображення літер для наслідування. Продукти, зокрема Ideogram, DALL-E 3 і пізніші авторегресійні генератори зображень, зробили розбірливий текст рутиною, чому допомогли навчальні підписи, які включають слова, показані на зображенні. Одне з помилкових уявлень полягає в тому, що сучасні моделі зчитують букви з файлу шрифту. Вони все ще генерують літери як пікселі, тому довгі уривки, рідкісні слова та дрібний шрифт все ще йдуть неправильно.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє відтворення тексту в зображеннях, створених штучним інтелектом

Провідні моделі тепер надійно справляються з короткими заголовками та знаками, а складніші проблеми перемістилися на довші уривки, багатомовні сценарії, узгоджені шрифти в серії та точний текст у відео. Письма з тисячами символів, як-от китайська, або зі складним з’єднанням букв, як-от арабська, історично відставали від англійської, і прогрес залежить від даних навчання цим мовам. Розбірливий згенерований текст також викликає занепокоєння зловживання, оскільки реалістичні підроблені документи, квитанції та знімки екрана стає легше зробити. Це робить водяні знаки та маркування походження більш важливими.

Реалізація в реальному світі

Рання підказка Stable Diffusion для вивіски пекарні з написом «Fresh Bread» повертає завивки, схожі на букви, наприклад «FRESSH BRAED», оскільки модель знає, що вивіски містять текст, але не знають, як це пишеться.

Маркетолог, який використовує новішу модель, зберігає заголовок плаката до трьох коротких слів у лапках і отримує правильне написання протягом перших кількох спроб.

Дизайнер створює ілюстрацію без тексту, а потім додає справжні написи в програмі верстки, щоб шрифт, інтервали та написання були точними.

Користувач виправляє одне неправильно написане слово на створеній вітрині магазину, маскуючи цю область і зафарбовуючи її правильним словом.

Ризики та огорожі

  • Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

  • Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

  • Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

  1. Визначте критерії прийнятності для точності, відкликання та вартості помилок.

  2. Тестуйте з даними, які відповідають реальним умовам виробництва.

  3. Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

  4. Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Rendering in AI-Generated Images quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Що таке рендеринг тексту в зображеннях, створених штучним інтелектом?

Генератори зображень зі штучним інтелектом створювали спотворений текст, оскільки їхні текстові кодери, такі як CLIP, перетворювали підказки на підсловні маркери, які фіксували загальне значення, але не орфографію по буквах, через що модель зображення не мала точного сигналу про форми літер. Розбірливі написи надійшли через більші кодери тексту на основі мовної моделі, кодери з розпізнаванням символів, орієнтовані на текст навчальні дані та нові архітектури. Це важливо для тих, хто створює плакати, логотипи, меми чи макети упаковки.

Чому моделям зображень на основі CLIP важко правильно писати слова?

Таке слово, як «пекарня», може стати одним токеном, тому модель зображення отримує своє значення, але не містить інформації про окремі літери.

Дослідження Google з усвідомленням символів знайшло заклинання в якому типі кодувальника краще?

Кодери байтового рівня розкривають кожен символ, надаючи моделі зображення буквено-літерну інформацію, яку приховують токени підслів.

Чому невелика помилка допустима у згенерованому обличчі, але не в згенерованому тексті?

Літери визначаються точними формами, тому невелика зміна, наприклад перетворення «e» на «c», розриває слово.

Яке обмеження в навчальних даних ускладнювало зв’язування слів із літерами?

Якщо підпис ніколи не говорить про те, що читає знак, модель не може зв’язати ці слова з літерами, які вона бачить.

Що дослідницькі системи, такі як TextDiffuser і GlyphControl, додали до створення зображень?

Вони надали просторові вказівки щодо того, куди йде кожен персонаж і як він виглядає, і модель дотримувалася цих вказівок під час генерації.