ДаліНаступний посібник
Перетворення тексту в зображення Imagen
Візуальний ШІ
Візуальний AI GUIDE
Генератори зображень зі штучним інтелектом створювали спотворений текст, оскільки їхні текстові кодери, такі як CLIP, перетворювали підказки на підсловні маркери, які фіксували загальне значення, але не орфографію по буквах, через що модель зображення не мала точного сигналу про форми літер.
Розбірливі написи надійшли через більші кодери тексту на основі мовної моделі, кодери з розпізнаванням символів, орієнтовані на текст навчальні дані та нові архітектури. Це важливо для тих, хто створює плакати, логотипи, меми чи макети упаковки.
Письменництво є невблаганною мішенню. Обличчя може бути трохи зміщеним і все одно читатися як обличчя, але одне неправильне наведення перетворює «е» на «с». Ранні дифузійні моделі дізналися, що вивіски магазинів, обкладинки книг і футболки містять літери, тому вони створювали фігури з ритмом тексту, в той час як фактичні літери вводили неправильно. Основною причиною став кодувальник тексту. Stable Diffusion 1.x використовував текстовий кодувальник CLIP OpenAI, який був навчений зіставляти цілі підписи з зображеннями. CLIP розділяє слова на лексеми підслова, тому таке слово, як «пекарня», може стати єдиним лексемом, а модель зображення отримує представлення значення, а не послідовність літер. Ніщо в цьому сигналі не говорить «b, потім a, потім k». Дослідження Imagen, проведене Google у 2022 році, виявило, що великий заморожений кодер мовної моделі T5 покращив підказку, а його зразки відтворювали текст помітно краще. Подальше дослідження Google на символьних моделях показало, що кодери на рівні байтів, такі як ByT5, які бачать окремі символи, пишуться набагато краще. Розв’язка також мала значення. Маленькі літери займають дуже мало клітинок у стиснутому латентному вигляді, тому тонкі штрихи розпливаються. Ще одним обмеженням були навчальні дані. Підписи рідко виписували текст, видимий на зображенні, тому модель не могла зв’язати слова з літерами. Прогрес відбувався з кількох напрямків. DeepFloyd IF і Stable Diffusion 3 поєднали свої моделі зображення з кодерами T5. Дослідницькі системи, такі як TextDiffuser і GlyphControl, надавали моделі чіткі макети або попередньо відрендерені зображення літер для наслідування. Продукти, зокрема Ideogram, DALL-E 3 і пізніші авторегресійні генератори зображень, зробили розбірливий текст рутиною, чому допомогли навчальні підписи, які включають слова, показані на зображенні. Одне з помилкових уявлень полягає в тому, що сучасні моделі зчитують букви з файлу шрифту. Вони все ще генерують літери як пікселі, тому довгі уривки, рідкісні слова та дрібний шрифт все ще йдуть неправильно.
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Провідні моделі тепер надійно справляються з короткими заголовками та знаками, а складніші проблеми перемістилися на довші уривки, багатомовні сценарії, узгоджені шрифти в серії та точний текст у відео. Письма з тисячами символів, як-от китайська, або зі складним з’єднанням букв, як-от арабська, історично відставали від англійської, і прогрес залежить від даних навчання цим мовам. Розбірливий згенерований текст також викликає занепокоєння зловживання, оскільки реалістичні підроблені документи, квитанції та знімки екрана стає легше зробити. Це робить водяні знаки та маркування походження більш важливими.
Рання підказка Stable Diffusion для вивіски пекарні з написом «Fresh Bread» повертає завивки, схожі на букви, наприклад «FRESSH BRAED», оскільки модель знає, що вивіски містять текст, але не знають, як це пишеться.
Маркетолог, який використовує новішу модель, зберігає заголовок плаката до трьох коротких слів у лапках і отримує правильне написання протягом перших кількох спроб.
Дизайнер створює ілюстрацію без тексту, а потім додає справжні написи в програмі верстки, щоб шрифт, інтервали та написання були точними.
Користувач виправляє одне неправильно написане слово на створеній вітрині магазину, маскуючи цю область і зафарбовуючи її правильним словом.
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Генератори зображень зі штучним інтелектом створювали спотворений текст, оскільки їхні текстові кодери, такі як CLIP, перетворювали підказки на підсловні маркери, які фіксували загальне значення, але не орфографію по буквах, через що модель зображення не мала точного сигналу про форми літер. Розбірливі написи надійшли через більші кодери тексту на основі мовної моделі, кодери з розпізнаванням символів, орієнтовані на текст навчальні дані та нові архітектури. Це важливо для тих, хто створює плакати, логотипи, меми чи макети упаковки.
Таке слово, як «пекарня», може стати одним токеном, тому модель зображення отримує своє значення, але не містить інформації про окремі літери.
Кодери байтового рівня розкривають кожен символ, надаючи моделі зображення буквено-літерну інформацію, яку приховують токени підслів.
Літери визначаються точними формами, тому невелика зміна, наприклад перетворення «e» на «c», розриває слово.
Якщо підпис ніколи не говорить про те, що читає знак, модель не може зв’язати ці слова з літерами, які вона бачить.
Вони надали просторові вказівки щодо того, куди йде кожен персонаж і як він виглядає, і модель дотримувалася цих вказівок під час генерації.
Продовжуйте вчитися
Інші посібники, вибрані для цієї теми
ДаліНаступний посібник
Перетворення тексту в зображення Imagen
Візуальний ШІ