콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
홈
/
용어집
/
인간 피드백을 통한 강화 학습(RLHF)
AI 용어집
무엇입니까?
인간 피드백을 통한 강화 학습(RLHF)
?
정의
인간의 선호 신호를 사용하여 모델 행동을 형성하는 훈련 방법입니다.
관련 용어
강화 학습
에이전트가 장기적인 수익을 극대화하는 행동을 학습하는 보상 신호를 통한 교육입니다.
보상 모델
RLHF 파이프라인에서 자주 사용되는 선호 신호를 기반으로 출력에 점수를 매기는 모델입니다.
DPO(직접 선호도 최적화)
별도의 보상 모델이 필요 없이 선호 쌍에 대해 직접 모델을 미세 조정하는 학습 방법입니다.
지속적인 학습
모델이 사전 지식을 잊지 않고 새로운 데이터로부터 계속 학습할 수 있도록 하는 훈련 접근 방식입니다.
퓨샷 학습
소수의 사례를 통해 행동을 학습하거나 적용합니다.
모델 드리프트
실제 조건이 훈련 가정과 다르기 때문에 시간이 지남에 따라 성능이 저하됩니다.
무료 가이드에서 자세히 알아보세요
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
전체 AI 용어집 찾아보기
무료 AI 가이드 모두 살펴보기