콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
홈
/
용어집
/
보상 모델
AI 용어집
무엇입니까?
보상 모델
?
정의
RLHF 파이프라인에서 자주 사용되는 선호 신호를 기반으로 출력에 점수를 매기는 모델입니다.
관련 용어
인간 피드백을 통한 강화 학습(RLHF)
인간의 선호 신호를 사용하여 모델 행동을 형성하는 훈련 방법입니다.
강화 학습
에이전트가 장기적인 수익을 극대화하는 행동을 학습하는 보상 신호를 통한 교육입니다.
지상 진실
모델 출력을 학습하거나 평가하는 데 사용되는 신뢰할 수 있는 참조 라벨입니다.
DPO(직접 선호도 최적화)
별도의 보상 모델이 필요 없이 선호 쌍에 대해 직접 모델을 미세 조정하는 학습 방법입니다.
중간 훈련
사전 훈련과 사후 훈련 사이의 중간 훈련 단계로, 역량이나 영역 조정에 자주 사용됩니다.
AI 에이전트
종종 도구와 메모리를 사용하여 목표를 달성하기 위해 관찰하고, 추론하고, 조치를 취할 수 있는 소프트웨어 시스템입니다.
무료 가이드에서 자세히 알아보세요
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
See also
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
전체 AI 용어집 찾아보기
무료 AI 가이드 모두 살펴보기