콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
← 모든 퀴즈로 돌아가기
가이드 연계 퀴즈 • 중간 레벨 • 6 질문
직접 선호도 최적화 퀴즈
Direct Preference Optimization의 작동 방식과 정렬을 단순화하는 이유에 대한 이해를 테스트해 보세요.
관련 가이드 경로
직접 선호도 최적화
질문 1 의 6
기존 RLHF에 비해 DPO는 무엇을 제거합니까?
힌트가 필요하신가요?
A
인간의 선호도 데이터의 필요성
B
별도의 보상 모델 및 강화 학습 루프
C
기본 사전 학습된 언어 모델
D
로그 확률의 사용