ПОСІБНИК З ОСНОВ

Токенізація

Токенізація — це крок, який розбиває текст на дрібніші фрагменти, які називаються токенами, одиниці, які фактично читає та передбачає мовна модель.

2 хвилини читанняОстаннє оновлення

Огляд

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

Глибоке занурення

Перш ніж модель побачить ваш текст, токенізатор розбиває його на токени, які зазвичай є фрагментами підслів, а не цілими словами чи окремими літерами. Слово «нещастя» може перетворитися на «un», «щастя» або «токенізація» може розділитися на «токен» і «ізація». Звичайні слова часто відображаються в одній лексемі, тоді як рідкісні слова, імена чи коди поділяються на кілька. Потім кожен маркер зіставляється з ідентифікаційним номером, який модель перетворює на вектор. Це має практичне значення, оскільки моделі мають фіксовані вікна контексту, які вимірюються в токенах, а API виставляє рахунок за токен, тому грубе емпіричне правило англійської мови становить близько 4 символів або 0,75 слова на токен. Токенізація також пояснює особливості класичної моделі: підрахувати літери чи точно написати складно, оскільки модель бачить фрагменти, а не окремі символи.

Технічне розуміння

Більшість сучасних LLM використовують токенізацію підслів, таку як кодування пари байтів (BPE) або його варіанти на рівні байтів. BPE починається з символів і постійно об’єднує найпоширеніші суміжні пари, щоб створити фіксований словник (часто від 30 000 до 100 000+ токенів). Це врівноважує дві крайнощі: токенізація на рівні слова не може обробляти невидимі слова, тоді як рівень символу робить послідовності дуже довгими. Підслова дозволяють моделі представляти будь-який рядок, включаючи помилки друку та нові слова, складаючи відомі частини, зберігаючи при цьому послідовності досить короткими.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Майбутнє токенізації

Токенізація є активною дослідницькою сферою саме тому, що вона обмежує ефективність і справедливість. Мови, які розділяються на більше частин, коштують дорожче та швидше використовують контекст, тому багатомовна справедливість є справжньою проблемою, яка вирішується за допомогою кращих, збалансованіших словників. Дослідники також вивчають моделі без токенів або байтових моделей (наприклад, ByT5) і вивчають токенізацію, яка може повністю усунути крихкий ручний крок. Наразі очікуйте більшого словника, розумніших багатомовних токенізаторів і зростання обізнаності користувачів про ціноутворення на основі токенів і контекстне бюджетування.

Реалізація в реальному світі

Ціни API для таких моделей, як GPT і Claude виставляються за вхідний і вихідний маркер, тому кількість маркерів безпосередньо впливає на вартість.

Обмеження вікна контексту (наприклад, 128 КБ або 200 КБ токенів) вимірюється в токенах, що обмежує кількість тексту або коду, які ви можете включити.

Розробники використовують токенізери (наприклад, tiktoken), щоб оцінити розмір підказки та обрізати вміст перед надсиланням запитів.

Токенізація пояснює, чому моделям важко підрахувати літери в слові або перевернути рядок, оскільки вони бачать фрагменти підслов, а не символи.

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де токенізація допомагає, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Токенізація SentencePiece

Часті запитання

What is Tokenization?

Токенізація — це крок, який розбиває текст на дрібніші фрагменти, які називаються токенами, одиниці, які фактично читає та передбачає мовна модель. Він тихо визначає вартість, контекстні обмеження та навіть те, наскільки добре модель обробляє правопис і рідкісні слова.

Що таке «токен» у контексті мовної моделі?

Лексеми — це одиниці, які обробляє модель, як правило, фрагменти підслів, іноді цілі слова або окремі символи.

Який підхід до токенізації використовують більшість сучасних LLM?

Методи підслів, такі як BPE, об’єднують часті пари символів, врівноважуючи слабкі сторони підходів чистого рівня слова та рівня символів.

Чому токенізація ускладнює такі завдання, як підрахунок літер у слові, для LLM?

Оскільки текст згруповано в маркери підслів, модель не сприймає кожен символ безпосередньо, що робить завдання на рівні літер схильними до помилок.

Чому токенізація має значення для обмежень вартості API та контексту?

Постачальники виставляють рахунки за токени, а контекстні вікна мають розмір у токенах, тому кількість токенів визначає як ціну, так і кількість, яку ви можете включити.

Чому те саме речення в деяких мовах може коштувати більше токенів, ніж в англійській?

Словники, навчені здебільшого англійською мовою, розділяють інші мови на більше токенів, що підвищує вартість і швидше використовує контекст.