Вернуться к новостям
ИнновацииAI Understanding брифинг

Препринт предлагает непрерывную оценку сложности для снижения затрат на самосогласованность LLM.

В новом препринте arXiv предлагается гибкая самосогласованность — метод, который оценивает степень неопределенности языковой модели в отношении вопроса и регулирует количество выбранных путей рассуждения. Авторы сообщают об экономии токенов до 76% при сохранении точности, сравнимой со стандартной самосогласованностью в различных…

5 min readRead the primary source
Primary-source image accompanying Preprint proposes continuous difficulty estimates to reduce LLM self-consistency costs
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.24590
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Классификация
Задача, в которой модель присваивает входные данные одной или нескольким предопределенным категориям.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Исследователи предлагают гибкую самосогласованность, или FSC, метод декодирования больших языковых моделей, который использует непрерывную оценку сложности проблемы, чтобы решить, сколько путей рассуждения следует сгенерировать. В документе говорится, что FSC может сэкономить до 76% токенов, сохраняя при этом точность, сравнимую со стандартной самосогласованностью.

В документе arXiv, представленном 25 августа 2026 г., рассматривается потребление токенов самосогласованности — стратегия декодирования для больших языковых моделей. В подходе, описанном авторами, модель генерирует несколько различных путей рассуждения для одного и того же вопроса и выбирает ответ, который кажется наиболее последовательным для всех этих путей. В статье это представляется полезным для решения сложных задач рассуждения, но определяет повторяющуюся генерацию как основное вычислительное ограничение. Такая структура позволяет сосредоточиться в статье на вычислении времени вывода и на количестве сгенерированных путей, используемых для каждого отдельного вопроса.

Авторы говорят, что более ранние методы повышения эффективности часто распределяли ресурсы, используя небольшое количество фиксированных категорий сложности. Их главный аргумент заключается в том, что сложность рассуждения постоянно меняется, поэтому бинарная или многоуровневая классификация может выделять слишком много путей для одних вопросов и слишком мало для других. FSC призван реагировать на это изменение, более гибко изменяя бюджет выборки при переходе от одного исходного материала к другому.

FSC использует предварительно обученный зонд для прогнозирования выходной энтропии входного вопроса. В статье предсказанная энтропия рассматривается как индикатор неопределенности модели и используется для определения количества путей рассуждения для выборки. С практической точки зрения предлагаемый метод направлен на то, чтобы затрачивать больше усилий на выборку по вопросам, в которых модель кажется менее достоверной, и меньше усилий, когда ее прогнозируемая неопределенность ниже.

Согласно аннотации, эксперименты с различными моделями и тестами показали, что FSC поддерживает точность, сравнимую со стандартной самосогласованностью, при этом достигая экономии токенов до 76%. Источник не приводит названий моделей и тестов, полных показателей точности, распределения экономии и условий, при которых наблюдалась максимальная экономия. Это существенные детали для оценки результата.

Подробности об источнике: arxiv.org ↗

Почему это важно

Стандартная самосогласованность может улучшить ответы за счет выборки нескольких путей рассуждения, но при этом используется значительно больше токенов. Если сообщаемые результаты выходят за рамки экспериментов, описанных в статье, выделение большего количества вычислений только тогда, когда модель кажется неопределенной, может сделать эту стратегию рассуждений более эффективной.

В статье рассматривается конкретная неэффективность широко обсуждаемого способа улучшения рассуждений с помощью языковой модели: создание нескольких возможных путей для каждой проблемы, независимо от того, насколько сложны входные данные. Метод, позволяющий различать вопросы, требующие обширной выборки, и вопросы, требующие меньшего количества данных, может сократить ненужную генерацию, сохраняя при этом преимущество сравнения нескольких путей.

Сообщаемый результат потенциально имеет важное значение, поскольку он касается количества сгенерированного текста, необходимого для стратегии рассуждения, а не просто небольшого изменения в оценочной оценке. В аннотации заявлена ​​экономия до 76%, хотя эта цифра является экспериментальным результатом препринта, сообщенным автором, и не должна рассматриваться как независимо установленная гарантия производительности.

FSC также иллюстрирует более широкий выбор дизайна в системах языковых моделей: использовать ли один и тот же бюджет вывода для каждого запроса или адаптировать вычисления к предполагаемой неопределенности. Если метод работает надежно, адаптивное распределение может помочь разработчикам систем сбалансировать качество ответов и эффективность вычислений. Источник не устанавливает влияние на задержку, финансовые затраты, использование энергии или доступность для пользователя, поэтому эти последствия остаются скорее условными, чем продемонстрированными.

Это предложение может быть особенно актуальным в тех случаях, когда пути рассуждения длинные или когда уже создается несколько выборок. В то же время оценка неопределенности сама по себе может быть несовершенной. Модель может быть уверена в сложном вопросе или не уверена в простом, и аннотация не показывает, как FSC работает в этих случаях. Поэтому заявленную сопоставимую точность необходимо интерпретировать в рамках конкретных экспериментов, о которых сообщается в полной статье.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Источником является недавно представленный препринт, и в его аннотации не указаны протестированные модели, тесты, процедура обучения зондов или подробные результаты сравнения. Независимая репликация и полная проверка документов потребуются, чтобы определить, насколько последовательно сохраняются сообщаемые сбережения и остается ли точность стабильной при выполнении различных задач.

Первым приоритетом является изучение всей экспериментальной установки. В аннотации не указаны языковые модели, типы задач, тесты, параметры выборки или базовые конфигурации, используемые при сравнении со стандартной самосогласованностью. Без этих подробностей невозможно сказать, применим ли результат в широком смысле или сконцентрирован на определенном наборе логических задач.

Предварительно обученный зонд — еще одно важное неизвестное. Источник утверждает, что он предсказывает выходную энтропию, но не объясняет, как он обучался, какие данные использовал, сколько дополнительных вычислений требуется или распространяется ли он на модели и задачи вне условий обучения. Эти факторы будут определять, перевесит ли экономия токенов от адаптивной выборки затраты на оценку сложности.

Независимая репликация должна проверять больше, чем просто наилучшую сообщаемую экономию. Полезные последующие результаты будут включать среднюю экономию токенов, точность при фиксированных бюджетах, производительность по вопросам с вводящими в заблуждение сигналами неопределенности, а также результаты по различным семействам моделей и типам тестов. Фраза в аннотации «до 76%» описывает максимальный, а не обязательно типичный результат.

Наконец, читателям следует следить за фактическими данными, полученными в результате применения или более широкой оценки. Источник представляет недавно представленное исследовательское предложение и сообщает о результатах экспериментов, но не устанавливает доступность производства, принятие поставщиком модели или улучшения в реальном приложении. Пока на эти вопросы не будут даны ответы, FSC лучше всего понимать как потенциально полезный метод вывода об эффективности, который еще подлежит проверке.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаОбучение искусственному интеллектуТрансформерыПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?