Техническое РУКОВОДСТВО

Подсчет токенов и цены на LLM API

API-интерфейсы LLM взимают плату за токен — фрагмент текста, который составляет примерно три четверти английского слова.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее подсчета токенов и ценообразования LLM API
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Входные токены, которые вы отправляете, и выходные токены, которые генерирует модель, имеют отдельные ставки, а выходные обычно стоят в несколько раз дороже. Чтобы оценить стоимость, подсчитайте токены с помощью токенизатора поставщика или конечной точки подсчета и умножьте каждую сторону на ее ставку на миллион. Включите скрытые элементы, такие как системные подсказки, историю разговоров и рассуждения.

Глубокое погружение

Модели не читают символы или слова напрямую. Токенизатор разбивает текст на токены, которые представляют собой общие последовательности символов, полученные из обучающих данных. Обычное практическое правило для английского языка — около четырех символов или трех четвертей слова на токен. Таким образом, 1000 слов составляют примерно 1300–1400 токенов. Код, цифры, необычные имена и многие неанглийские языки используют больше токенов на слово. Каждое семейство моделей имеет свой собственный токенизатор, поэтому один и тот же текст может давать разные значения у разных поставщиков. Цены обычно указываются за миллион токенов с отдельными ставками ввода и вывода. Выходные токены стоят дороже, поскольку модель генерирует их по одному, а входные токены она может обрабатывать параллельно. Выходная мощность обычно оценивается в несколько раз дороже входной, часто в четыре-восемь раз, хотя соотношение варьируется в зависимости от модели. Вот проработанный пример с выдуманными ценами: ввод по 3 доллара за миллион токенов и выход по 15 долларов за миллион. Задача отправляет 6000 входных токенов (системное приглашение, инструкции и документ) и возвращает 800 выходных токенов. - Входные данные: 6000 x 3 доллара США / 1 000 000 = 0,018 доллара США - Выход: 800 x 15 долларов США / 1 000 000 = 0,012 доллара США - Итого: 0,03 доллара США за задачу. При выполнении 10 000 задач в день это составляет около 300 долларов США в день. Реальные счета часто удивляют людей по предсказуемым причинам: - Приложения чата пересылают весь разговор на каждом шагу, поэтому количество вводимых данных увеличивается с каждым сообщением. - Модели рассуждений генерируют жетоны внутреннего мышления, которые учитываются как выходные данные, даже если они не отображаются полностью. - Определения инструментов, полученные документы и изображения считаются входными данными. - Повторные попытки и неудачные вызовы тоже стоят денег. Распространены три заблуждения: что токены равны словам, что заполнение контекстного окна модели бесплатно и что модель с самой низкой ценой за токен всегда дешевле за задачу. Более мощная модель, которая завершается за меньшее количество попыток, в целом может стоить дешевле.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее подсчета токенов и ценообразования LLM API

Цены за токен для данного уровня возможностей существенно упали за последние несколько лет. Общие расходы в любом случае часто растут, поскольку приложения используют более длинные контексты, агенты совершают много вызовов, а модели рассуждения выдают больше результатов. Цены также становятся более разнообразными: отдельные ставки за кэшированный ввод, запросы с длинным контекстом, пакетные задания и рассуждения. Поэтому более важно измерять фактическое использование для каждой задачи, чем сравнивать общие цены. Инструменты расчета затрат, такие как бюджеты, отслеживание затрат на каждую функцию и автоматическая маршрутизация моделей, вероятно, станут стандартной частью приложений LLM.

Реальная реализация

Разработчик использует библиотеку tiktoken с открытым исходным кодом OpenAI для подсчета статьи поддержки объемом 3000 слов перед ее отправкой. Речь идет примерно о 4000 токенах, и она устанавливает соответствующее оповещение о бюджете.

Команда чат-ботов обнаружила, что большая часть их счетов приходится на повторную отправку системного приглашения на 2000 токенов и полную историю чата на каждом ходу. Это сокращает затраты за счет суммирования старых ходов и использования оперативного кэширования.

Компания, обрабатывающая 50 000 описаний продуктов за одну ночь, передает эту работу пакетному API поставщика. Пакетный API взимает меньшую плату, а результаты приходят в течение нескольких часов, а не секунд.

Команда, переводящая контент на хинди и японский язык, тратит больше на страницу, чем на английский. При использовании обычных токенизаторов одно и то же значение часто требует большего количества токенов на этих языках.

Риски и ограничения

  • Оптимизация одного теста может скрыть более широкие недостатки системы.

  • Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

  • Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

  1. Определите целевые показатели задержки, качества и стоимости перед внедрением.

  2. Тестирование при реалистичной нагрузке и условиях данных.

  3. Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

  4. Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Token Counting and LLM API Pricing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое подсчет токенов и цены на LLM API?

API-интерфейсы LLM взимают плату за токен — фрагмент текста, который составляет примерно три четверти английского слова. Входные токены, которые вы отправляете, и выходные токены, которые генерирует модель, имеют отдельные ставки, а выходные обычно стоят в несколько раз дороже. Чтобы оценить стоимость, подсчитайте токены с помощью токенизатора поставщика или конечной точки подсчета и умножьте каждую сторону на ее ставку на миллион. Включите скрытые элементы, такие как системные подсказки, историю разговоров и рассуждения.

Каково общее эмпирическое правило для английского текста и токенов?

В английском языке в среднем около четырех символов или 0,75 слова на токен, поэтому 1000 слов — это примерно от 1300 до 1400 токенов.

Почему выходные токены обычно стоят дороже, чем входные токены?

Генерация токенов один за другим требует больше вычислительного времени, чем параллельная обработка входных токенов.

Сколько будет стоить вызов с 6000 входными и 800 выходными токенами при искусственно созданных ценах в 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов?

6000 x 3 / 1 000 000 = 0,018 доллара США и 800 x 15 / 1 000 000 = 0,012 доллара США, что в сумме составляет 0,03 доллара США.

Почему стоимость чат-бота часто растет по мере продолжения разговора?

Каждое новое сообщение обычно включает в себя все предыдущие ходы, поэтому входные жетоны накапливаются, если история не обрезана или не суммирована.

Как обычно выставляются счета за жетоны внутреннего мышления модели рассуждения?

Токены мышления генерируются моделью, поэтому они учитываются как выходные данные, даже если вы не видите их все.