ПОСІБНИК З ОСНОВ
Чому магістрам важко підрахувати букви
Великі мовні моделі важко підрахувати літери, оскільки вони не читають текст по одному символу за раз.
На цій сторінці4 хвилини читання
Огляд
Вони зчитують токени, які є фрагментами символів, тому окремі літери всередині слова часто ніколи не видно безпосередньо моделі. Цей факт пояснює цілу групу дивних помилок під час орфографії, рахунку, реверсування та римування, а також підкаже, як їх обійти.
Глибоке занурення
Перш ніж мовна модель побачить будь-який текст, токенізатор розбиває його на токени. Більшість сучасних токенізаторів використовують такий метод, як кодування пар байтів, який вивчає загальні послідовності символів із великої частини тексту. Часті слова часто перетворюються на одну лексему, а більш рідкісні слова розбиваються на кілька частин. Потім модель отримує кожен маркер як число і перетворює його на вектор. Він ніколи не отримує літери всередині цього маркера як окремі вхідні дані. Отже, коли ви запитуєте, скільки r у слові «суниця», модель не сканує десять символів. Він бачить, мабуть, два або три фрагменти, і він повинен згадати, за шаблонами, вивченими під час навчання, які літери містять ці фрагменти. Ці знання існують, але вони опосередковані та нечіткі, як коли вас запитують, скільки разів літера e з’являється в слові, яке ви бачили лише на малюнку. Запитання про полуницю стало широко поширеним прикладом у 2024 році саме тому, що відповідь очевидна для людей і напрочуд складна для чат-ботів. Та сама причина породжує пов’язані помилки: орфографічні помилки, коли їх просять промовити вголос, неправильне перевертання слів, недотримання обмежень на основі літер, таких як акровірші чи ліпограми, і неправильний підрахунок символів для обмеження довжини. Точні розподіли різняться між токенізерами, тому одна модель може правильно отримати задане слово, а інша — невдало. Поширена помилкова думка полягає в тому, що це показує, що моделі не можуть міркувати або просто необережні. Обмеження здебільшого стосується формату введення, а не загальних міркувань. Коли моделі пропонується спочатку вимовити слово, кожна літера стає окремим маркером, а підрахунок стає набагато легшим завданням. Новіші моделі міркувань часто виконують цей етап орфографії самостійно, що є однією з причин, чому вони частіше відповідають на ці запитання. Для всього, де точність має значення, запуск короткого фрагмента коду залишається найнадійнішим методом.
Стратегічний вплив
Чіткіші рішення
Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.
Вартість і бюджет
Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.
Команда та робочий процес
Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.
Майбутнє того, чому магістрам важко рахувати літери
Дослідники досліджують моделі, які працюють безпосередньо з байтами або символами, і гібридні проекти, які динамічно групують байти, що може зробити завдання на рівні символів більш природними. Ці підходи мають компроміси, оскільки довші послідовності введення коштують більше обчислень. Тим часом моделі міркування, які крок за кроком вимовляють слова, і моделі, які викликають інструменти коду, вже зменшують багато з цих помилок на практиці. Розумно очікувати, що з часом буде менше незручних помилок підрахунку літер, але для завдань, які потребують точної кількості символів, використання коду, а не довіра відкликанню моделі, ймовірно, залишиться хорошою практикою.
Реалізація в реальному світі
На запитання, скільки разів літера r з’являється в слові «суниця», чат-бот відповідає два замість трьох, тому що слово потрапляє до моделі у вигляді кількох багатолітерних фрагментів, а не десяти окремих літер.
Учитель просить модель написати речення, у якому кожне слово починається з літери s, і вона проскакує слова, які цього не роблять, оскільки їй доводиться виводити першу літеру кожного слова, а не бачити її.
Розробник запитує слово «енциклопедія», написане задом наперед, і отримує версію з поміняними або відсутніми літерами; запит моделі спочатку перерахувати літери по одній у рядку, а потім перевернути список, це виправляє.
Додатку-головоломці потрібна точна кількість букв для гри в слова, тому він обчислює їх за допомогою одного рядка звичайного коду та використовує модель лише для написання підказок.
Ризики та огорожі
Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.
Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.
Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.
Дорожня карта впровадження
Почніть із простого визначення необхідного результату.
Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.
Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.
Задокументуйте, де чому допомагає LLM-ам важко підрахувати букви, а де простіші методи кращі.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Why LLMs Struggle to Count Letters quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Часті запитання
Чому магістрам важко підрахувати букви?
Великі мовні моделі важко підрахувати літери, оскільки вони не читають текст по одному символу за раз. Вони зчитують токени, які є фрагментами символів, тому окремі літери всередині слова часто ніколи не видно безпосередньо моделі. Цей факт пояснює цілу групу дивних помилок під час орфографії, рахунку, реверсування та римування, а також підкаже, як їх обійти.
Яка основна причина, чому мовні моделі неправильно враховують букви в слові?
Моделі отримують жетони, які часто містять кілька символів. Букви всередині токена не є окремими вхідними даними, тому модель повинна викликати їх опосередковано.
Що токенизатор створює з фрагмента тексту?
Токенізатор розбиває текст на частини з фіксованого словника та відображає кожну з цілочисельним ідентифікатором, який потім перетворюється на вектор.
Яка зміна підказки найбільше допомагає моделі правильно рахувати букви?
Написання слова з роздільниками, як-от s-t-r-a-w, зазвичай поміщає кожну літеру в окремий знак, що значно полегшує підрахунок.
За допомогою чого кодування пар байтів створює свій словниковий запас?
BPE починається з байтів або символів і продовжує об’єднувати найчастішу сусідню пару, тому загальні рядки стають окремими маркерами.
Чому "полуниця" та "полуниця" можуть оброблятися моделлю по-різному?
Токенізатори часто включають пробіли та регістр у токенах, тому невеликі зміни на поверхні можуть призвести до різних розділень токенів.
Продовжуйте вчитися
Пов'язані посібники
Інші посібники, вибрані для цієї теми