Назад към Новини
ИновацияAI Understanding брифинг

Присвояването на кредити, съобразено с архитектурата, подобрява обучението за подсилване за езикови модели

Предпринт arXiv въвежда CompPO, метод за укрепване на обучението, който използва собствените модели на внимание на езиковия модел, за да присвои кредит за обучение между токени. Авторите съобщават за по-висока задържана точност и по-голяма стабилност от настроения GRPO в експерименти с Qwen3-4B и Llama-3.1-8B-Instruct.

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.21501
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Обучение с подсилване
Обучение чрез сигнали за възнаграждение, при което агент научава действия, които максимизират дългосрочната възвръщаемост.
Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователите въведоха кредитен транспорт, обусловен от изчисление, метод за присвояване на кредит за обучение за подсилване на отделни токени според изчислението, извършено от езиковия модел по време на отговор. Тяхното внедряване, CompPO, използва концентрация на вниманието, за да създаде порта за задържане на токен и го комбинира с критик, който използва повторно скритите състояния на актьора и информацията за маршрутизиране.

Предпечат, изпратен до arXiv на 21 август, предлага нов начин за присвояване на кредит по време на обучението за укрепване за големи езикови модели. Документът разделя присвояването на кредит на три части: доказателство за това дали внедряването е успешно, транспортен оператор, който преобразува това доказателство в предимства на ниво токен, и геометрията на актуализиране, която превръща тези предимства в промени в политиката. Авторите твърдят, че скорошната работа е подобрила първата и третата част, докато често използваните транспортни правила остават до голяма степен независими от архитектурата на модела.

Предложената рамка, наречена кредитен транспорт, обусловен от изчисление, използва отделна статистика от вътрешното изчисление на политиката за поведение, за да параметризира как стойността надолу по веригата се транспортира чрез внедряване. Конкретният алгоритъм, CompPO, преобразува естествената концентрация на вниманието в ограничена порта за задържане за всеки токен. Този гейт се използва както за едноетапно стартиране, така и за зависимо от пътя проследяване на обобщено предимство, наречено Comp-GAE. Авторите заявяват, че постоянният гейт намалява метода до обобщена оценка на предимството с фиксиран коефициент, осигурявайки връзка към стандартна базова линия.

CompPO също така включва критик, ориентиран към транспорта, или TAC. Вместо да добави втори трансформатор от същия мащаб, TAC използва повторно скритите състояния на актьора и информацията за маршрутизиране. Документът казва, че наградата за изпълнение на задачата и целта на ограничената политика на PPO остават непроменени; претендираната промяна е как кредитът се транспортира и как критикът е приведен в съответствие с този транспорт. В експерименти, използващи пет семена Qwen3-4B, авторите съобщават за 61,4% крайна задържана точност, с 95% доверителен интервал от 60,8% до 62,0%, в сравнение с 53,8%, с интервал от 52,9% до 54,7%, за настроен GRPO.

Резултатите от аблацията на хартията приписват резултата на комбинацията от компоненти. Comp-GAE в комбинация със стандартен критик достигна 55,2%, докато TAC в комбинация с фиксиран гейт достигна 56,4%; нито една от тях не съответства на пълната система. Авторите съобщават за ефект на взаимодействие от 2,4 точки, с 95% доверителен интервал от 1,9 до 2,9 точки. Съобщава се, че контролите за разбъркване и позициониране поддържат специфично за траекторията подравняване. CompPO беше стабилен при 10 от 12 изпълнения на PPO-мрежа, в сравнение с 3 от 12 за настройката за сравнение. При замразени оценки авторите съобщават за подобрения спрямо GRPO от 4,3 и 3,9 алчен пас@1 макро точки на Qwen3-4B и Llama-3.1-8B-Instruct, съответно.

Детайли за източника: arxiv.org ↗

Защо има значение

Резултатът е насочен към практическо затруднение в обучението за подсилване за големи езикови модели: решаване кои части от дълъг отговор заслужават признание или вина за крайния резултат. Авторите съобщават за подобрения в сравнение с настроения GRPO, но доказателствата идват от предпечат и ограничен набор от експерименти, така че общоприетостта на метода и оперативните разходи остават несигурни.

Обучението за подсилване за езикови модели трябва да свързва крайната награда с много индивидуални жетони и междинни решения. Отговорът може да съдържа полезни и безполезни стъпки, но метод, който излъчва една и съща статистика за резултатите в целия отговор, може да предостави слаби насоки. Основното твърдение на статията е, че собственото изчисление на модела може да предостави по-специфичен сигнал за вземане на решение колко силно кредитът трябва да продължи от един токен към следващия.

Ако отчетеният ефект се задържи в по-широки настройки, преносът на кредити, съобразен с архитектурата, може да направи актуализациите на обучението за подсилване по-целенасочени, без да изисква различно определение на възнаграждението или цел на политиката. Това има значение, тъй като промените в присвояването на кредити потенциално могат да бъдат включени в съществуващите обучителни линии в стил PPO. Докладваното сравнение с GRPO е особено подходящо за текущата практика на обучение за подсилване на LLM, тъй като очертава предложения метод като промяна на сигнала за обучение, а не като ново семейство модели или продукт, ориентиран към потребителя.

Докладваните аблации са полезни, защото предполагат, че резултатът не е обяснен нито от портата, получена от вниманието, нито от повторно използваната критика. Пълният метод се представи по-добре от двата частични варианта в предоставените резултати и авторите казват, че контролите за разбъркване и позициониране подкрепят идеята, че специфичното за траекторията подравняване има значение. Сравнението на стабилността също така сочи възможна практическа полза: по-малкото нестабилни изпълнения биха могли да намалят пропилените опити за обучение, въпреки че източникът не предоставя изчисления или измервания на разходите.

Доказателствата все още трябва да се четат като резултат от ранно изследване. Източникът е предпечат на arXiv, а не рецензирана публикация и резюмето не описва основните задачи, размерите на наборите от данни, детайлите на базовото изпълнение, бюджетите за обучение или статистическите процедури извън докладваните доверителни интервали. Той също така не установява дали печалбите идват с допълнителна памет, латентност, инженерна сложност или чувствителност към модели на внимание. Следователно общественото въздействие на метода зависи от това дали независими изследователи могат да възпроизведат резултатите и дали подходът се прехвърля към по-големи модели и разнообразни цели за укрепване на обучението.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Важните следващи тестове са независима репликация, по-широк модел и покритие на задачи и сравнения, които включват цена на обучение, използване на паметта и време на изпълнение. Източникът не установява дали CompPO работи надеждно извън докладваните Qwen3-4B и Llama-3.1-8B-Instruct оценки или дали неговият сигнал, базиран на внимание, остава полезен при различни архитектури на модела.

Първият приоритет е репликацията отвъд петте семена Qwen3-4B и докладваните замразени оценки. Независими групи трябва да тестват метода върху повече размери на модела, задачи за обучение, структури за възнаграждение и архитектури на езикови модели. Източникът назовава Qwen3-4B и Llama-3.1-8B-Instruct, но не казва дали методът е оценен в по-широк диапазон от модели или дали сигналът за внимание се държи по подобен начин в архитектури с различно маршрутизиране или дизайн на внимание.

Изследователите трябва също да измерват пълния компромис от обучението. Документът казва, че TAC използва повторно скритите състояния на актьорите и информацията за маршрутизиране без втори трансформатор от същия мащаб, но източникът не определя количествено потреблението на памет, времето за обучение на стенен часовник, хардуерните изисквания или общото изчисление. Тези измервания ще определят дали отчетените печалби в точността и стабилността са практични за организации, които вече управляват скъпи тръбопроводи за подсилващо обучение.

По-нататъшната работа трябва да проучи колко здрава е вратата за задържане, привлечена от вниманието. Докладваните контроли за разбъркване и позициониране поддържат специфично за траекторията подравняване в рамките на експериментите, но източникът не показва как портата реагира на дълги контексти, необичайни разсъждаващи следи, оскъдни или шумни награди или промени в подканите и вземането на проби. Също така не е известно дали концентрацията на вниманието е надежден заместител на изчислителната важност или просто полезен сигнал за конкретните тествани модели и задачи.

И накрая, има значение статусът на метода като предпечат. Източникът не съобщава за независима проверка, производствено внедряване, наличност на код или резултати от партньорска проверка. Тези пропуски не обезсилват констатациите, но оставят важни въпроси без отговор относно възпроизводимостта и обобщението. По-сериозният случай би изисквал публикувани подробности за внедряването, съвпадащи базисни стойности, резултати в допълнителни архитектури и доказателства, че подобренията продължават да съществуват извън настройката за оценка на авторите.

Свързани ръководства и викторини

Обяснени модели на AIAI обучениеТрансформърсБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?