ДалееСледующее руководство
Новые возможности больших языковых моделей
Языковой ИИ
РУКОВОДСТВО ПО ОБЩЕСТВУ
Различия в токенизации означают, что одно и то же сообщение может принимать гораздо больше токенов на некоторых языках, чем на английском, поскольку большинство токенизаторов были созданы из текста, который в основном состоит из английского языка.
Поскольку сервисы искусственного интеллекта взимают плату за токен и ограничивают количество токенов, помещающихся в контекстное окно, носители этих языков могут платить больше, помещать меньше текста и дольше ждать той же работы. Это делает разработку токенизатора не только технической, но и объективной проблемой.
Токенизатор узнает, какие фрагменты текста следует рассматривать как отдельные токены, изучая обучающий корпус. Общие строки получают свои собственные токены; редкие строки разбиваются на более мелкие части, иногда вплоть до отдельных байтов. Когда в этом корпусе доминируют английский и несколько других языков с высокими ресурсами, эти языки получают эффективные токены для целых слов и общих частей слов. Языки, которые появляются реже или используют сценарии, в которых каждый символ занимает несколько байтов в кодировке UTF-8, например, многие сценарии Южной Азии, Юго-Восточной Азии и Африки, разделяются на гораздо большее количество частей. Эффект измерим. Исследование, опубликованное в 2023 году, в том числе работа Петрова и его коллег о несправедливости токенизаторов, показало, что для перевода одного и того же текста на некоторых языках может потребоваться в несколько раз больше токенов, чем на английском, причем наибольшие разрывы для определенных языков и токенизаторов превышают десять раз. Это имеет значение в трех конкретных отношениях. Стоимость: цена API указана за токен, поэтому увеличение количества токенов означает прямое увеличение цены на тот же контент. Контекст: окно с фиксированным контекстом содержит меньше фактического текста, поэтому документы приходится сокращать, а предыдущие этапы разговоров теряются раньше. Скорость и качество: больше токенов означает больше шагов генерации, а сильная фрагментация может затруднить изучение модели хороших представлений слов, что может способствовать снижению производительности на этих языках. Провайдеры отреагировали частично. Когда OpenAI выпустила GPT-4o в 2024 году, она представила более крупный токенизатор и заявила, что использует меньше токенов для многих неанглийских языков. Больший словарный запас и более сбалансированные данные обучения помогают, но не устраняют разрыв полностью. Распространенным заблуждением является то, что некоторые языки просто более многословны. Переводы действительно различаются по длине, но большие пробелы в токенах обусловлены главным образом тем, как был построен токенизатор, а не самими языками.
Катастрофический и повседневный вред ИИ зависит от того, кто понимает риски и может действовать.
Общественная и профессиональная грамотность определяет, возможна ли с политической точки зрения сильная политика безопасности.
Четкие объяснения уменьшают влияние шумихи, лабораторного пиара и расплывчатого этического театра.
Словари токенизаторов растут, и некоторые поставщики теперь публикуют улучшения для неанглоязычного текста, поэтому разрыв, вероятно, будет продолжать сокращаться для широко распространенных языков. Языки с низким уровнем ресурсов могут продолжать отставать, если данные обучения и конструкция токенизатора не включают их намеренно. Исследования моделей на уровне байтов и динамически сгруппированных моделей могут снизить зависимость от фиксированного словаря, хотя эти конструкции имеют свои собственные вычислительные затраты. На данный момент организации, обслуживающие многоязычную аудиторию, должны измерять количество токенов на каждом поддерживаемом ими языке и рассматривать стоимость и контекстные ограничения для каждого языка как часть планирования доступности.
Некоммерческая организация здравоохранения переводит одну и ту же брошюру для пациента на английский, хинди и амхарский язык и обнаруживает, что неанглийские версии используют в несколько раз больше токенов, поэтому ее счет за API для этих языков намного выше.
Чат-бот для говорящих на бирманском языке достигает предела контекста после гораздо меньшего количества разговоров, чем английская версия, поэтому он быстрее забывает предыдущие сообщения.
Разработчик проверяет корейскую статью поддержки с помощью средства просмотра токенизаторов и видит, что многие слова разделены на короткие фрагменты, в то время как английский оригинал в основном отображает один токен на слово.
Исследовательская группа сравнивает старый и новый токенизатор от одного и того же поставщика и обнаруживает, что новый использует заметно меньше токенов для своих документов на арабском и тамильском языках.
Относитесь к экзистенциальному риску как к научной фантастике, в то время как возможности растут.
Сбивает с толку безопасность поверхности продукта и выравнивание при высокой автономности.
Оставляя неанглоязычную и неспециалистскую аудиторию только с некачественными источниками.
Отдельные риски повреждения продукта, неправильного использования и потери контроля/перекоса.
Спросите, какие доказательства могут изменить ваше мнение о сроках и серьезности.
Предпочитайте первоисточники и конкретные оценки маркетинговым заявлениям.
Определите один путь действий: карьера, политика, финансирование или навыки, а не только осведомленность.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Различия в токенизации означают, что одно и то же сообщение может принимать гораздо больше токенов на некоторых языках, чем на английском, поскольку большинство токенизаторов были созданы из текста, который в основном состоит из английского языка. Поскольку сервисы искусственного интеллекта взимают плату за токен и ограничивают количество токенов, помещающихся в контекстное окно, носители этих языков могут платить больше, помещать меньше текста и дольше ждать той же работы. Это делает разработку токенизатора не только технической, но и объективной проблемой.
Токенизаторы присваивают эффективные токены строкам, общим для их обучающего корпуса. Недостаточно представленные языки делятся на более мелкие части.
Каждый символ в этих скриптах представляет собой несколько байтов UTF-8. Если токенизатор редко объединял эти последовательности байтов, один символ может стать несколькими токенами.
В руководстве указаны стоимость, контекстное пространство, а также скорость или качество. Автоматический отказ не является следствием подсчета токенов.
Рождаемость измеряется жетонами на слово. Более высокая рождаемость означает, что текст разбивается на большее количество частей и стоит дороже.
GPT-4o поставляется с расширенным словарным токенизатором, который, по словам OpenAI, более эффективен для многих неанглийских языков.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Новые возможности больших языковых моделей
Языковой ИИ