РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Токенизация WordPiece

WordPiece — это алгоритм токенизации подслов, который поддерживает BERT и многие модели Google, разбивая слова на повторно используемые фрагменты, чтобы модель могла обрабатывать любой текст с фиксированным словарем.

2 минуты чтенияПоследнее обновление

Обзор

Вот почему модель, которая никогда не видела «несчастье», всё равно может понять его, прочитав «un», «##happy» и «##ness».

Глубокое погружение

WordPiece создает словарь из подслов, а не из целых слов или отдельных символов. Начиная с отдельных символов, он жадно объединяет пару символов, которая наиболее увеличивает вероятность обучающего корпуса, повторяя до тех пор, пока не достигнет целевого размера словаря (BERT использует около 30 000 токенов). При выводе он жадно токенизирует слева направо, сопоставляя самое длинное подслово в словаре, а затем продолжает остаток. Части продолжения внутри слова помечаются префиксом «##», поэтому «играть» становится «играть» + «##ing». Это решает проблему нехватки словарного запаса: редкие или невидимые слова просто разлагаются на известные фрагменты, при необходимости вплоть до отдельных символов, в то время как общие слова для повышения эффективности остаются отдельными токенами.

Техническая информация

WordPiece отличается от кодирования парами байтов критерием слияния. BPE объединяет наиболее часто встречающуюся соседнюю пару; WordPiece объединяет пару, которая максимизирует вероятность обучающих данных, грубо выбирая пару, чья совместная частота больше всего превышает произведение частот ее частей. Маркер «##» отличает начальные части слова от продолжений, позволяя токенизатору однозначно реконструировать границы слов при обратном декодировании в текст.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее токенизации WordPiece

В новых моделях больших языков все чаще отдается предпочтение моделям униграмм BPE на уровне байтов (семейство GPT) или SentencePiece, которые избегают предварительной обработки, специфичной для языка, и обрабатывают любой ввод Unicode. WordPiece остается основой кодировщиков на основе BERT, которые до сих пор широко используются для поиска и классификации. Ожидайте дальнейшего использования в производственном НЛП, наряду с исследованиями моделей байтов и символов без токенизаторов, которые могут в конечном итоге полностью снизить зависимость от фиксированных словарей подслов.

Реальная реализация

BERT токенизирует поисковые запросы в Google Поиске, разбивая незнакомые термины на подслова, чтобы модель могла по-прежнему соответствовать релевантным страницам.

BertTokenizer Hugging Face использует WordPiece для преобразования необработанного текста в идентификаторы токенов, передаваемые в BERT для анализа настроений и распознавания именованных объектов.

Многоязычный BERT использует общий словарь WordPiece на более чем 100 языках, позволяя повторно использовать фрагменты в связанных сценариях.

DistilBERT и клинические/биомедицинские варианты BERT наследуют WordPiece, обрабатывая редкие медицинские термины, такие как «пневмонокониоз», путем разделения их на известные части.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Токенизация подслов

Часто задаваемые вопросы

Что такое токенизация WordPiece?

WordPiece — это алгоритм токенизации подслов, который поддерживает BERT и многие модели Google, разбивая слова на повторно используемые фрагменты, чтобы модель могла обрабатывать любой текст с фиксированным словарем. Вот почему модель, которая никогда не видела «несчастья», все же может понять его, прочитав «не», «##счастлив» и «##нес».

Что означает префикс «##» в выводе WordPiece?

WordPiece помечает продолжение подслова знаком «##», поэтому «воспроизведение» становится «воспроизведением» + «##ing», позволяя декодеру реконструировать границы слов.

Насколько велик примерно словарный запас WordPiece, используемый в оригинальном BERT?

BERT использует словарь WordPiece, состоящий примерно из 30 000 единиц подслов, балансируя охват и размер таблицы внедрения.

Чем критерий слияния WordPiece отличается от стандартного кодирования парами байтов?

BPE объединяет наиболее часто встречающиеся соседние пары, а WordPiece объединяет пару, которая больше всего увеличивает вероятность появления корпуса, отдавая предпочтение парам, частота соединения которых превышает произведение их частей.

Как WordPiece обрабатывает слово, которое никогда не встречалось во время обучения?

Невидимые слова разбиваются на известные подслова с наибольшим совпадением, возвращаясь к отдельным символам, что решает проблему отсутствия словарного запаса.

Как WordPiece выбирает, как разделить слово во время вывода?

WordPiece жадно выполняет токенизацию, сопоставляя самую длинную словарную запись, начиная с текущей позиции, а затем повторяя оставшуюся часть.