콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
홈
퀴즈
그레이더 퀴즈를 통한 강화 미세 조정
가이드 연계 퀴즈 · 하드 레벨
그레이더 퀴즈를 통한 강화 미세 조정
채점자가 모델 출력에 점수를 매기는 방법, 강화 미세 조정에 적합한 작업, 보상 해킹 및 약한 훈련 신호가 발생하는 방법을 테스트합니다.
관련 가이드 경로
그레이더를 이용한 강화 미세 조정
8 질문
합격 표시 80%
질문 1 의 8
How does reinforcement fine-tuning differ from supervised fine-tuning?
힌트가 필요하신가요?
A
It trains the model to imitate exact target outputs
B
It rewards sampled outputs a grader scores highly instead of copying examples
C
It needs no training prompts
D
It only changes the system prompt