РУКОВОДСТВО ПО ОСНОВАМ

Почему выпускникам LLM трудно считать буквы

Большие языковые модели с трудом подсчитывают буквы, поскольку они не читают текст по одному символу за раз.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее того, почему магистрантам трудно считать буквы
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Они считывают токены, которые представляют собой фрагменты символов, поэтому отдельные буквы внутри слова часто никогда не видны модели напрямую. Этот факт объясняет целый ряд странных ошибок в написании, счете, перестановке и рифме, а также подсказывает, как их обойти.

Глубокое погружение

Прежде чем языковая модель увидит какой-либо текст, токенизатор разбивает его на токены. Большинство современных токенизаторов используют такой метод, как кодирование парами байтов, который изучает общие последовательности символов из большого объема текста. Часто встречающиеся слова часто становятся одним токеном, а более редкие слова разбиваются на несколько частей. Затем модель получает каждый токен как число и преобразует его в вектор. Он никогда не получает буквы внутри этого токена как отдельные входные данные. Поэтому, когда вы спрашиваете, сколько букв «r» в слове «клубника», модель не сканирует десять символов. Он видит, возможно, два или три фрагмента и должен вспомнить, исходя из шаблонов, полученных во время обучения, какие буквы содержат эти фрагменты. Это знание существует, но оно косвенное и нечеткое, как если бы вас спросили, сколько раз буква «е» появляется в слове, которое вы когда-либо видели только как картинку. Вопрос о клубнике стал широко распространенным примером в 2024 году именно потому, что ответ очевиден для людей и удивительно сложен для чат-ботов. Та же самая причина приводит к связанным ошибкам: орфографическим ошибкам, когда их просят произнести вслух, неправильному переворачиванию слов, несоблюдению буквенных ограничений, таких как акростихи или липограммы, а также неправильному подсчету символов для ограничения длины. Точные разделения различаются между токенизаторами, поэтому одна модель может правильно передать данное слово, а другая — нет. Распространенное заблуждение состоит в том, что это показывает, что модели не могут рассуждать или просто небрежны. Ограничение в основном касается формата ввода, а не общих рассуждений. Когда модели предлагается сначала произнести слово по буквам, каждая буква становится отдельной лексемой, и подсчет становится гораздо более простой задачей. Новые модели рассуждения часто выполняют этот этап написания самостоятельно, и это одна из причин, по которой они чаще отвечают на эти вопросы правильно. Во всем, где важна точность, запуск короткого фрагмента кода по-прежнему остается наиболее надежным методом.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее того, почему магистрантам трудно считать буквы

Исследователи изучают модели, которые работают непосредственно с байтами или символами, а также гибридные конструкции, которые динамически группируют байты, что может сделать задачи на уровне символов более естественными. Эти подходы имеют свои недостатки, поскольку более длинные входные последовательности требуют больше вычислений. Между тем, модели рассуждения, которые шаг за шагом объясняют слова, и модели, вызывающие инструменты кода, уже на практике уменьшают многие из этих ошибок. Разумно ожидать, что со временем будет меньше неловких ошибок при подсчете букв, но для задач, требующих точного подсчета символов, использование кода, а не доверие к отзыву модели, вероятно, останется хорошей практикой.

Реальная реализация

На вопрос, сколько раз буква r встречается в слове «клубника», чат-бот отвечает два, а не три, потому что слово попадает в модель в виде нескольких многобуквенных фрагментов, а не десяти отдельных букв.

Учитель просит модель написать предложение, в котором каждое слово начинается с буквы s, и в ней проскальзывают слова, которых нет, поскольку ей приходится выводить первую букву каждого слова, а не видеть ее.

Разработчик запрашивает слово «энциклопедия», написанное наоборот, и получает версию с замененными или отсутствующими буквами; Если попросить модель сначала перечислить буквы по одной в строке, а затем перевернуть список, это исправит ситуацию.

Приложению-головоломке для игры в слова требуется точное количество букв, поэтому оно вычисляет их с помощью одной строки обычного кода и использует модель только для написания подсказок.

Риски и ограничения

  • Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

  • Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

  • Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

  1. Начните с простого определения желаемого результата.

  2. Перед тестированием выберите один показатель успеха и одно условие отказа.

  3. Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

  4. Документ, в котором помогает «Почему магистрам права трудно считать буквы» и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Why LLMs Struggle to Count Letters quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Почему выпускникам LLM трудно считать буквы?

Большие языковые модели с трудом подсчитывают буквы, поскольку они не читают текст по одному символу за раз. Они считывают токены, которые представляют собой фрагменты символов, поэтому отдельные буквы внутри слова часто никогда не видны модели напрямую. Этот факт объясняет целый ряд странных ошибок в написании, счете, перестановке и рифме, а также подсказывает, как их обойти.

Какова основная причина, по которой языковые модели неправильно учитывают буквы в слове?

Модели получают жетоны, которые часто содержат несколько символов. Буквы внутри токена не являются отдельными входными данными, поэтому модель должна вызывать их косвенно.

Что токенизатор производит из фрагмента текста?

Токенизатор разбивает текст на части из фиксированного словаря и сопоставляет каждый из них с целочисленным идентификатором, который затем преобразуется в вектор.

Какое изменение подсказки больше всего помогает модели правильно считать буквы?

При написании слова с разделителями, такими как s-t-r-a-w, каждая буква обычно помещается в отдельный токен, что значительно упрощает задачу подсчета.

Кодирование пар байтов пополняет свой словарный запас, делая что?

BPE начинается с байтов или символов и продолжает объединять наиболее часто встречающиеся соседние пары, поэтому общие строки становятся отдельными токенами.

Почему модели могут по-разному обрабатывать слова «Клубника» и «клубника»?

Токенизаторы часто включают начальные пробелы и регистр в токенах, поэтому небольшие поверхностные изменения могут привести к различным разделениям токенов.