ДалееСледующее руководство
Оценка затрат LLM API и бюджетов токенов
Технический
Техническое РУКОВОДСТВО
API-интерфейсы LLM взимают плату за токен — фрагмент текста, который составляет примерно три четверти английского слова.
Входные токены, которые вы отправляете, и выходные токены, которые генерирует модель, имеют отдельные ставки, а выходные обычно стоят в несколько раз дороже. Чтобы оценить стоимость, подсчитайте токены с помощью токенизатора поставщика или конечной точки подсчета и умножьте каждую сторону на ее ставку на миллион. Включите скрытые элементы, такие как системные подсказки, историю разговоров и рассуждения.
Модели не читают символы или слова напрямую. Токенизатор разбивает текст на токены, которые представляют собой общие последовательности символов, полученные из обучающих данных. Обычное практическое правило для английского языка — около четырех символов или трех четвертей слова на токен. Таким образом, 1000 слов составляют примерно 1300–1400 токенов. Код, цифры, необычные имена и многие неанглийские языки используют больше токенов на слово. Каждое семейство моделей имеет свой собственный токенизатор, поэтому один и тот же текст может давать разные значения у разных поставщиков. Цены обычно указываются за миллион токенов с отдельными ставками ввода и вывода. Выходные токены стоят дороже, поскольку модель генерирует их по одному, а входные токены она может обрабатывать параллельно. Выходная мощность обычно оценивается в несколько раз дороже входной, часто в четыре-восемь раз, хотя соотношение варьируется в зависимости от модели. Вот проработанный пример с выдуманными ценами: ввод по 3 доллара за миллион токенов и выход по 15 долларов за миллион. Задача отправляет 6000 входных токенов (системное приглашение, инструкции и документ) и возвращает 800 выходных токенов. - Входные данные: 6000 x 3 доллара США / 1 000 000 = 0,018 доллара США - Выход: 800 x 15 долларов США / 1 000 000 = 0,012 доллара США - Итого: 0,03 доллара США за задачу. При выполнении 10 000 задач в день это составляет около 300 долларов США в день. Реальные счета часто удивляют людей по предсказуемым причинам: - Приложения чата пересылают весь разговор на каждом шагу, поэтому количество вводимых данных увеличивается с каждым сообщением. - Модели рассуждений генерируют жетоны внутреннего мышления, которые учитываются как выходные данные, даже если они не отображаются полностью. - Определения инструментов, полученные документы и изображения считаются входными данными. - Повторные попытки и неудачные вызовы тоже стоят денег. Распространены три заблуждения: что токены равны словам, что заполнение контекстного окна модели бесплатно и что модель с самой низкой ценой за токен всегда дешевле за задачу. Более мощная модель, которая завершается за меньшее количество попыток, в целом может стоить дешевле.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Цены за токен для данного уровня возможностей существенно упали за последние несколько лет. Общие расходы в любом случае часто растут, поскольку приложения используют более длинные контексты, агенты совершают много вызовов, а модели рассуждения выдают больше результатов. Цены также становятся более разнообразными: отдельные ставки за кэшированный ввод, запросы с длинным контекстом, пакетные задания и рассуждения. Поэтому более важно измерять фактическое использование для каждой задачи, чем сравнивать общие цены. Инструменты расчета затрат, такие как бюджеты, отслеживание затрат на каждую функцию и автоматическая маршрутизация моделей, вероятно, станут стандартной частью приложений LLM.
Разработчик использует библиотеку tiktoken с открытым исходным кодом OpenAI для подсчета статьи поддержки объемом 3000 слов перед ее отправкой. Речь идет примерно о 4000 токенах, и она устанавливает соответствующее оповещение о бюджете.
Команда чат-ботов обнаружила, что большая часть их счетов приходится на повторную отправку системного приглашения на 2000 токенов и полную историю чата на каждом ходу. Это сокращает затраты за счет суммирования старых ходов и использования оперативного кэширования.
Компания, обрабатывающая 50 000 описаний продуктов за одну ночь, передает эту работу пакетному API поставщика. Пакетный API взимает меньшую плату, а результаты приходят в течение нескольких часов, а не секунд.
Команда, переводящая контент на хинди и японский язык, тратит больше на страницу, чем на английский. При использовании обычных токенизаторов одно и то же значение часто требует большего количества токенов на этих языках.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
API-интерфейсы LLM взимают плату за токен — фрагмент текста, который составляет примерно три четверти английского слова. Входные токены, которые вы отправляете, и выходные токены, которые генерирует модель, имеют отдельные ставки, а выходные обычно стоят в несколько раз дороже. Чтобы оценить стоимость, подсчитайте токены с помощью токенизатора поставщика или конечной точки подсчета и умножьте каждую сторону на ее ставку на миллион. Включите скрытые элементы, такие как системные подсказки, историю разговоров и рассуждения.
В английском языке в среднем около четырех символов или 0,75 слова на токен, поэтому 1000 слов — это примерно от 1300 до 1400 токенов.
Генерация токенов один за другим требует больше вычислительного времени, чем параллельная обработка входных токенов.
6000 x 3 / 1 000 000 = 0,018 доллара США и 800 x 15 / 1 000 000 = 0,012 доллара США, что в сумме составляет 0,03 доллара США.
Каждое новое сообщение обычно включает в себя все предыдущие ходы, поэтому входные жетоны накапливаются, если история не обрезана или не суммирована.
Токены мышления генерируются моделью, поэтому они учитываются как выходные данные, даже если вы не видите их все.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Оценка затрат LLM API и бюджетов токенов
Технический