Вернуться к новостям
ИнновацииAI Understanding брифинг

Назначение кредитов с учетом архитектуры улучшает обучение языковых моделей с подкреплением

Препринт arXiv представляет CompPO, метод обучения с подкреплением, который использует собственные шаблоны внимания языковой модели для распределения баллов обучения между токенами. Авторы сообщают о более высокой точности и большей стабильности, чем настроенный GRPO в экспериментах на Qwen3-4B и Llama-3.1-8B-Instruct.

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.21501
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Исследователи представили транспорт кредитов, обусловленный вычислениями, — метод присвоения кредитов обучения с подкреплением отдельным токенам в соответствии с вычислениями, выполняемыми языковой моделью во время ответа. Их реализация, CompPO, использует концентрацию внимания для создания шлюза хранения каждого токена и объединяет его с критикой, которая повторно использует скрытые состояния актера и информацию о маршрутизации.

Препринт, отправленный на arXiv 21 августа, предлагает новый способ присвоения баллов во время обучения с подкреплением для больших языковых моделей. В документе распределение кредитов разделено на три части: свидетельство об успешном внедрении, транспортный оператор, который преобразует эти доказательства в преимущества на уровне токена, и геометрия обновления, которая превращает эти преимущества в изменения политики. Авторы утверждают, что недавняя работа улучшила первую и третью части, в то время как часто используемые правила транспорта остаются в значительной степени независимыми от архитектуры модели.

Предлагаемая структура, называемая транспортировкой кредитов, обусловленной вычислениями, использует статистику, отделенную от внутренних вычислений поведенческой политики, для параметризации того, как нисходящая ценность передается через развертывание. Конкретный алгоритм CompPO преобразует собственную концентрацию внимания в ограниченные ворота удержания для каждого токена. Этот шлюз используется как для одноэтапной начальной загрузки, так и для трассировки обобщенных преимуществ, зависящей от пути, называемой Comp-GAE. Авторы утверждают, что постоянный вентиль сводит метод к оценке обобщенного преимущества с фиксированным коэффициентом, обеспечивая связь со стандартным базовым уровнем.

CompPO также включает в себя транспортную критику (TAC). Вместо добавления второго Трансформера того же масштаба TAC повторно использует скрытые состояния актера и информацию о маршрутизации. В документе говорится, что вознаграждение за задание и цель политики PPO остаются неизменными; заявленное изменение заключается в том, как передается кредит и как критик согласуется с этим транспортом. В экспериментах с использованием пяти семян Qwen3-4B авторы сообщают о конечной выдерживаемой точности 61,4% с 95% доверительным интервалом от 60,8% до 62,0% по сравнению с 53,8% с интервалом от 52,9% до 54,7% для настроенного GRPO.

Результаты абляции, представленные в статье, объясняют результат комбинацией компонентов. Comp-GAE в паре со стандартным критиком достиг 55,2%, а TAC в паре с фиксированным гейтом достиг 56,4%; ни один из них не соответствовал полной системе. Авторы сообщают об эффекте взаимодействия в 2,4 балла при 95% доверительном интервале от 1,9 до 2,9 балла. Сообщалось, что органы управления перемешиванием и положением поддерживают выравнивание по конкретной траектории. CompPO был стабильным в 10 из 12 запусков сетки PPO по сравнению с 3 из 12 для сравнительной установки. По замороженным оценкам авторы сообщают об улучшении по сравнению с GRPO на 4,3 и 3,9 макробалла жадного прохода @ 1 на Qwen3-4B и Llama-3.1-8B-Instruct соответственно.

Подробности об источнике: arxiv.org ↗

Почему это важно

Результат устраняет практическое узкое место в обучении с подкреплением для больших языковых моделей: решение, какие части длинного ответа заслуживают похвалы или порицания за конечный результат. Авторы сообщают об улучшениях по сравнению с настроенным GRPO, но доказательства получены из препринта и ограниченного набора экспериментов, поэтому универсальность метода и эксплуатационные затраты остаются неопределенными.

Обучение с подкреплением для языковых моделей должно связывать финальную награду со многими отдельными токенами и промежуточными решениями. Ответ может содержать полезные и бесполезные шаги, но метод, который передает одну и ту же статистику результатов по всему ответу, может дать слабые рекомендации. Основное утверждение статьи заключается в том, что собственные вычисления модели могут предоставить более конкретный сигнал для принятия решения о том, насколько сильно кредит должен сохраняться от одного токена к другому.

Если сообщаемый эффект сохранится в более широких условиях, транспортировка кредитов с учетом архитектуры может сделать обновления обучения с подкреплением более целенаправленными, не требуя другого определения вознаграждения или цели политики. Это важно, поскольку изменения в распределении кредитов потенциально могут быть включены в существующие программы обучения в стиле PPO. Сообщаемое сравнение с GRPO особенно актуально для текущей практики обучения с подкреплением LLM, поскольку оно представляет собой предлагаемый метод как изменение обучающего сигнала, а не новое семейство моделей или продукт, ориентированный на пользователя.

Сообщаемые об абляции полезны, поскольку они предполагают, что результат не объясняется ни воротами, полученными вниманием, ни только повторным использованием критики. Полный метод показал лучшие результаты, чем оба частичных варианта в предоставленных результатах, и авторы говорят, что элементы управления перемешиванием и положением подтверждают идею о том, что выравнивание по конкретной траектории имеет значение. Сравнение стабильности также указывает на возможную практическую выгоду: меньшее количество нестабильных прогонов может сократить напрасные попытки обучения, хотя источник не предоставляет расчетных данных или измерений затрат.

Доказательства по-прежнему следует рассматривать как ранний результат исследования. Источником является препринт arXiv, а не рецензируемая публикация, и в аннотации не описываются основные задачи, размеры наборов данных, детали базовой реализации, бюджеты на обучение или статистические процедуры, выходящие за пределы указанных доверительных интервалов. Также не установлено, связаны ли преимущества с дополнительной памятью, задержкой, инженерной сложностью или чувствительностью к моделям внимания. Таким образом, общественное влияние метода зависит от того, смогут ли независимые исследователи воспроизвести результаты и будет ли этот подход перенесен на более крупные модели и различные цели обучения с подкреплением.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Следующими важными тестами станут независимая репликация, более широкий охват моделей и задач, а также сравнения, включающие стоимость обучения, использование памяти и время выполнения. Источник не устанавливает, работает ли CompPO надежно, помимо заявленных оценок Qwen3-4B и Llama-3.1-8B-Instruct, или же его сигнал, основанный на внимании, остается полезным в различных архитектурах моделей.

Первым приоритетом является репликация за пределами пяти семян Qwen3-4B и замороженные оценки. Независимые группы должны протестировать метод на моделях большего размера, учебных задачах, структурах вознаграждения и архитектурах языковых моделей. В источнике указаны названия Qwen3-4B и Llama-3.1-8B-Instruct, но не сообщается, оценивался ли метод на более широком диапазоне моделей или же сигнал внимания ведет себя одинаково в архитектурах с разными схемами маршрутизации или внимания.

Исследователи также должны оценить полный компромисс между обучением. В документе говорится, что TAC повторно использует скрытые состояния актеров и информацию о маршрутизации без второго трансформатора того же масштаба, но источник не дает количественной оценки потребления памяти, времени обучения настенных часов, требований к оборудованию или общего объема вычислений. Эти измерения определят, будет ли заявленный прирост точности и стабильности практичным для организаций, которые уже используют дорогостоящие конвейеры обучения с подкреплением.

Дальнейшая работа должна изучить, насколько надежны ворота удержания внимания. Сообщаемые элементы управления перетасовкой и положением поддерживают выравнивание по конкретной траектории в экспериментах, но источник не показывает, как ворота реагируют на длинные контексты, необычные следы рассуждений, редкие или шумные вознаграждения или изменения в подсказках и выборке. Также неизвестно, является ли концентрация внимания надежным показателем вычислительной важности или просто полезным сигналом для конкретных тестируемых моделей и задач.

Наконец, имеет значение статус метода как препринта. Источник не сообщает о независимой проверке, развертывании производства, доступности кода или результатах экспертной оценки. Эти упущения не делают выводы недействительными, но оставляют без ответа важные вопросы о воспроизводимости и обобщении. Более веский аргумент потребует обнародования подробностей реализации, базовых показателей согласованной стоимости, результатов для дополнительных архитектур и доказательств того, что улучшения сохраняются за пределами настройки оценки авторов.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаОбучение искусственному интеллектуТрансформерыБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?