РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Масштабирование вычислений во время тестирования

Масштабирование вычислений во время тестирования означает предоставление модели больше времени на обдумывание и вычисления, когда она отвечает на вопрос, а не только увеличение ее размера во время обучения.

2 минуты чтенияПоследнее обновление

Обзор

It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.

Глубокое погружение

В течение многих лет прогресс ИИ означал масштабирование обучения: больше данных, больше параметров, больше предтренировочных вычислений. Масштабирование вычислений во время тестирования добавляет вторую ось, затрачивая больше вычислений на вывод. Вместо того, чтобы мгновенно выдать ответ, модель рассуждения генерирует длинную внутреннюю цепочку мыслей, изучая шаги, проверяя работу и возвращаясь назад. Методы включают в себя расширенную цепочку размышлений, выборку множества возможных решений и выбор лучшего (самосогласованность или лучшее из N), а также поиск в виде дерева, управляемый проверяющей моделью или моделью вознаграждения. Расширенное мышление OpenAI o1 и o3, DeepSeek-R1 и Claude популяризировало это: точность соревновательных математических вычислений и программирования резко возрастает, когда вы позволяете модели «думать дольше», жертвуя задержкой и затратами на правильность в задачах, где быстрый ответ невозможен.

Техническая информация

Модель обучается с помощью обучения с подкреплением для создания полезных жетонов рассуждения, а затем при выводе вы выделяете «бюджет на мышление». Больше токенов позволяет разложить проблемы, выявить собственные ошибки и выполнить самопроверку. Выборка «лучший из N» и поиск под руководством проверяющего добавляют параллельные вычисления: генерируйте множество попыток, оценивайте их и сохраняйте победителя. Важно отметить, что меньшие модели с большим объемом вычислений во время тестирования могут соответствовать гораздо более крупным моделям, которые отвечают мгновенно, изменяя кривую затрат.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее масштабирования вычислений во время тестирования

Вычисления во время тестирования теперь являются основным рычагом масштабирования наряду с обучением. Ожидайте адаптивных бюджетов, в которых модель решает, насколько сложно думать в зависимости от сложности, более дешевых рассуждений за счет разделения длинных цепочек на более короткие и «агентных» циклов, которые чередуют мышление с вызовами инструментов и поиском в Интернете. По мере совершенствования оборудования для вывода осознанное рассуждение станет стандартом для таких важных задач, как научные исследования, разработка программного обеспечения и сложное планирование, в то время как быстрый поиск останется быстрым и дешевым.

Реальная реализация

Модели o1 и o3 OpenAI шаг за шагом решают математические задачи олимпиадного уровня, значительно превосходя модели мгновенного ответа в тестах AIME и соревнованиях.

DeepSeek-R1 использовал обучение с подкреплением для обучения рассуждениям с длинной цепочкой мыслей, открыто демонстрируя большой прирост точности за счет дополнительных вычислений вывода.

Расширенный режим мышления Claude позволяет разработчикам устанавливать бюджет токенов, чтобы модель дольше думала над сложными задачами кодирования или анализа, прежде чем ответить.

AlphaCode и подобные системы отбирают тысячи программ-кандидатов во время тестирования, затем фильтруют и ранжируют их для решения конкурентных задач по программированию.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Compute Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Увеличение времени тестирования

Часто задаваемые вопросы

What is Test-Time Compute Scaling?

Масштабирование вычислений во время тестирования означает предоставление модели больше времени на обдумывание и вычисления, когда она отвечает на вопрос, а не только увеличение ее размера во время обучения. Это прорыв в области «моделей рассуждения», которые могут решать сложные математические задачи и проблемы кодирования путем размышления, прежде чем ответить.

Что означает «вычисление во время тестирования»?

Вычисления во время тестирования (времени вывода) — это работа, выполняемая при генерировании ответа, отличная от вычислений, используемых во время предварительного обучения.

Как модели рассуждения, такие как o1, используют дополнительные вычисления во время тестирования?

Они производят расширенные пошаговые рассуждения, исследуют и проверяют решения, прежде чем принять окончательный ответ.

В чем заключается основной компромисс при масштабировании вычислений во время тестирования?

Если дать модели возможность подумать дольше, это повысит правильность решения сложных задач, но увеличит время отклика и вычислительные затраты.

Что такое выборка «лучшая из N»?

Best-of-N генерирует несколько попыток решения параллельно и использует систему оценки или верификатора, чтобы сохранить самую сильную из них, что является формой масштабирования во время тестирования.

Почему вычисления во время тестирования считаются новой «осью масштабирования»?

В течение многих лет масштабирование означало более масштабные тренировочные прогоны; Вычисления во время тестирования добавляют второй способ повышения производительности — дополнительные вычисления при выводе.