뉴스로 돌아가기
혁신AI Understanding 브리핑

아키텍처 인식 학점 할당은 언어 모델에 대한 강화 학습을 향상시킵니다.

arXiv 사전 인쇄에서는 언어 모델의 자체 주의 패턴을 사용하여 토큰 전체에 교육 크레딧을 할당하는 강화 학습 방법인 CompPO를 소개합니다. 저자는 Qwen3-4B 및 Llama-3.1-8B-Instruct에 대한 실험에서 조정된 GRPO보다 더 높은 유지 정확도와 더 큰 안정성을 보고했습니다.

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
기본 소스 문서녹음된 소스
출판사
arxiv.org
소스 링크
arxiv.orghttps://arxiv.org/abs/2608.21501
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

강화 학습
에이전트가 장기적인 수익을 극대화하는 행동을 학습하는 보상 신호를 통한 교육입니다.
대형 언어 모델(LLM)
텍스트를 생성하고 분석하기 위해 대규모 텍스트 말뭉치를 학습한 언어 모델입니다.
메모리(에이전트 메모리)
AI 에이전트는 연속성을 향상하기 위해 여러 단계 또는 세션에서 사용하는 저장된 컨텍스트입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

연구원들은 응답 중에 언어 모델이 수행한 계산에 따라 개별 토큰에 강화 학습 크레딧을 할당하는 방법인 계산 조건 크레딧 전송을 도입했습니다. 구현된 CompPO는 주의 집중을 사용하여 토큰별 보존 게이트를 생성하고 이를 행위자의 숨겨진 상태 및 라우팅 정보를 재사용하는 비평가와 결합합니다.

8월 21일 arXiv에 제출된 사전 인쇄는 대규모 언어 모델에 대한 강화 학습 중에 크레딧을 할당하는 새로운 방법을 제안합니다. 이 백서는 신용 할당을 롤아웃 성공 여부에 대한 증거, 해당 증거를 토큰 수준 이점으로 변환하는 전송 운영자, 이러한 이점을 정책 변경으로 변환하는 업데이트 구조라는 세 부분으로 구분합니다. 저자는 최근 작업이 첫 번째와 세 번째 부분을 개선한 반면 일반적으로 사용되는 전송 규칙은 모델 아키텍처와 크게 독립적이라고 주장합니다.

계산 조건 신용 전송이라고 하는 제안된 프레임워크는 행동 정책의 내부 계산에서 분리된 통계를 사용하여 롤아웃을 통해 다운스트림 가치가 전송되는 방식을 매개변수화합니다. 구체적인 알고리즘인 CompPO는 기본 주의 집중을 각 토큰에 대한 제한된 보존 게이트로 변환합니다. 해당 게이트는 1단계 부트스트래핑과 Comp-GAE라는 경로 종속 일반 이점 추적에 모두 사용됩니다. 저자는 상수 게이트가 방법을 고정 계수 일반화 이점 추정으로 줄여 표준 기준에 대한 링크를 제공한다고 말합니다.

CompPO에는 TAC(Transport-Aligned Critic)도 포함되어 있습니다. 동일한 규모의 두 번째 Transformer를 추가하는 대신 TAC는 행위자의 숨겨진 상태와 라우팅 정보를 재사용합니다. 이 논문에서는 작업 보상과 잘린 PPO 정책 목표가 변경되지 않은 상태로 유지된다고 말합니다. 주장된 변화는 신용이 전달되는 방식과 비평가가 해당 전달에 어떻게 부합하는지입니다. 5개의 Qwen3-4B 시드를 사용한 실험에서 저자는 조정된 GRPO의 경우 53.8%, 52.9% ~ 54.7% 간격으로 60.8% ~ 62.0%의 95% 신뢰 구간으로 61.4%의 최종 유지 정확도를 보고했습니다.

논문의 절제 결과는 구성 요소의 조합에 따른 결과입니다. 표준 비평가와 결합된 Comp-GAE는 55.2%에 도달한 반면, 고정 게이트와 결합된 TAC는 56.4%에 도달했습니다. 둘 다 전체 시스템과 일치하지 않습니다. 저자는 2.4포인트의 상호작용 효과를 보고하며 95% 신뢰구간은 1.9~2.9포인트입니다. 셔플 및 위치 제어는 궤도별 정렬을 지원하는 것으로 보고되었습니다. CompPO는 비교 설정의 12개 중 3개와 비교하여 12개 PPO 그리드 실행 중 10개에서 안정적이었습니다. 고정 평가에서 저자는 Qwen3-4B 및 Llama-3.1-8B-Instruct에서 각각 GRPO 4.3 및 3.9 탐욕스러운 pass@1 매크로 포인트에 대한 개선 사항을 보고합니다.

소스 세부정보: arxiv.org ↗

왜 중요한가요?

결과는 대규모 언어 모델에 대한 강화 학습의 실질적인 병목 현상을 해결합니다. 즉, 긴 응답의 어느 부분이 최종 결과에 대해 공로를 인정받을 자격이 있는지 또는 책임을 져야 하는지 결정하는 것입니다. 저자는 조정된 GRPO에 대한 개선 사항을 보고했지만 증거는 사전 인쇄 및 제한된 실험 세트에서 나온 것이므로 방법의 일반성과 운영 비용은 여전히 ​​불확실합니다.

언어 모델에 대한 강화 학습은 최종 보상을 많은 개별 토큰 및 중간 결정에 연결해야 합니다. 응답에는 유용한 단계와 도움이 되지 않는 단계가 포함될 수 있지만 전체 응답에 걸쳐 동일한 결과 통계를 브로드캐스트하는 방법은 약한 지침을 제공할 수 있습니다. 이 논문의 핵심 주장은 모델 자체 계산이 한 토큰에서 다음 토큰까지 신용이 얼마나 강력하게 유지되어야 하는지 결정하기 위해 보다 구체적인 신호를 제공할 수 있다는 것입니다.

보고된 효과가 더 광범위한 설정에 적용되는 경우 아키텍처 인식 신용 전송은 다른 보상 정의 또는 정책 목표를 요구하지 않고도 강화 학습 업데이트를 더욱 목표화할 수 있습니다. 학점 할당 변경 사항이 잠재적으로 기존 PPO 스타일 교육 파이프라인에 통합될 수 있기 때문에 이는 중요합니다. 보고된 GRPO와의 비교는 제안된 방법을 새로운 모델 계열이나 사용자 대상 제품이 아닌 훈련 신호의 변경으로 구성하기 때문에 현재 LLM 강화 학습 실습과 특히 관련이 있습니다.

보고된 절제는 결과가 주의 유도 게이트나 재사용된 비평가만으로는 설명되지 않는다는 점을 시사하므로 유용합니다. 전체 방법은 제공된 결과에서 두 가지 부분 변형보다 더 나은 성능을 발휘했으며 저자는 셔플 및 위치 제어가 궤적별 정렬이 중요하다는 아이디어를 뒷받침한다고 말합니다. 안정성 비교는 가능한 실질적인 이점도 지적합니다. 소스가 컴퓨팅 또는 비용 측정을 제공하지 않더라도 불안정한 실행이 줄어들면 낭비되는 훈련 시도가 줄어들 수 있습니다.

증거는 여전히 초기 연구 결과로 읽어야합니다. 소스는 동료 검토 간행물이 아닌 arXiv 사전 인쇄이며, 초록은 기본 작업, 데이터 세트 크기, 기본 구현 세부 정보, 교육 예산 또는 보고된 신뢰 구간을 넘어서는 통계 절차를 설명하지 않습니다. 또한 추가 메모리, 대기 시간, 엔지니어링 복잡성 또는 주의 패턴에 대한 민감도가 향상되는지 여부도 확립하지 않습니다. 따라서 이 방법의 대중적 영향은 독립적인 연구자가 결과를 재현할 수 있는지 여부와 접근 방식이 더 큰 모델과 다양한 강화 학습 목표로 전환되는지 여부에 따라 달라집니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

중요한 다음 테스트는 독립적인 복제, 더 넓은 모델 및 작업 적용 범위, 교육 비용, 메모리 사용 및 런타임을 포함하는 비교입니다. 소스는 CompPO가 보고된 Qwen3-4B 및 Llama-3.1-8B-Instruct 평가 이상으로 안정적으로 작동하는지 또는 주의 기반 신호가 다양한 모델 아키텍처에서 여전히 유용한지 여부를 확인하지 않습니다.

첫 번째 우선순위는 5개의 Qwen3-4B 시드를 넘어서는 복제와 보고된 동결 평가입니다. 독립 그룹은 더 많은 모델 크기, 훈련 작업, 보상 구조 및 언어 모델 아키텍처에 대한 방법을 테스트해야 합니다. 소스 이름은 Qwen3-4B 및 Llama-3.1-8B-Instruct이지만 이 방법이 더 넓은 범위의 모델에 걸쳐 평가되었는지 또는 주의 신호가 다른 라우팅 또는 주의 설계를 사용하는 아키텍처에서 유사하게 동작하는지 여부는 밝히지 않습니다.

연구자들은 또한 전체 훈련 트레이드오프를 측정해야 합니다. 이 논문에서는 TAC가 동일한 규모의 두 번째 Transformer 없이 행위자 숨겨진 상태와 라우팅 정보를 재사용하지만 소스는 메모리 소비, 벽시계 훈련 시간, 하드웨어 요구 사항 또는 총 컴퓨팅을 정량화하지 않는다고 말합니다. 이러한 측정을 통해 보고된 정확성과 안정성 향상이 이미 값비싼 강화 학습 파이프라인을 실행하고 있는 조직에 실용적인지 여부가 결정됩니다.

추가 작업에서는 주의 유도 유지 게이트가 얼마나 견고한지 조사해야 합니다. 보고된 셔플 및 위치 컨트롤은 실험 내에서 궤적별 정렬을 지원하지만 소스는 게이트가 긴 컨텍스트, 비정상적인 추론 추적, 희박하거나 시끄러운 보상, 프롬프트 및 샘플링의 변경에 어떻게 반응하는지 보여주지 않습니다. 주의 집중이 계산 중요성에 대한 신뢰할 수 있는 프록시인지 아니면 테스트된 특정 모델 및 작업에 대한 유용한 신호인지도 알 수 없습니다.

마지막으로, 사전 인쇄로서의 방법의 상태가 중요합니다. 소스는 독립적인 검증, 프로덕션 배포, 코드 가용성 또는 동료 검토 결과를 보고하지 않습니다. 이러한 누락으로 인해 결과가 무효화되지는 않지만 재현성과 일반화에 대한 중요한 질문에 답이 없습니다. 더 강력한 사례에는 공개된 구현 세부 사항, 일치 비용 기준, 추가 아키텍처 전반에 걸친 결과, 작성자의 평가 설정 외부에서 개선 사항이 지속된다는 증거가 필요합니다.

관련 가이드 및 퀴즈

AI 모델 설명AI 트레이닝트랜스포머AI의 미래알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?