콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
홈
/
용어집
/
강화 학습
AI 용어집
무엇입니까?
강화 학습
?
정의
에이전트가 장기적인 수익을 극대화하는 행동을 학습하는 보상 신호를 통한 교육입니다.
관련 용어
인간 피드백을 통한 강화 학습(RLHF)
인간의 선호 신호를 사용하여 모델 행동을 형성하는 훈련 방법입니다.
보상 모델
RLHF 파이프라인에서 자주 사용되는 선호 신호를 기반으로 출력에 점수를 매기는 모델입니다.
AI 에이전트
종종 도구와 메모리를 사용하여 목표를 달성하기 위해 관찰하고, 추론하고, 조치를 취할 수 있는 소프트웨어 시스템입니다.
헌법 AI
모델 출력이 고정된 서면 원칙 세트에 따라 안내되는 교육 및 행동 형성 접근 방식입니다.
에이전트 루프
AI 에이전트가 목표를 완료하거나 정지 조건에 도달할 때까지 관찰하고, 계획하고, 행동하고, 반성하는 반복 주기입니다.
DPO(직접 선호도 최적화)
별도의 보상 모델이 필요 없이 선호 쌍에 대해 직접 모델을 미세 조정하는 학습 방법입니다.
무료 가이드에서 자세히 알아보세요
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
전체 AI 용어집 찾아보기
무료 AI 가이드 모두 살펴보기