콘텐츠로 건너뛰기
학습
뉴스
도구
채용
미션
검색
⌘K
English
기부
메뉴
여기서 시작하세요
학습 시작
학습
이동 학습
행동
가이드
AI 튜터
프롬프트 라이브러리
퀴즈
인증
용어집
뉴스
이동 뉴스
최신 AI 뉴스
주제 추적기
연구 및 데이터 세트
블로그
편집 원칙
정정 안내
도구
이동 도구
도구 디렉토리
최고의 목록
도구 비교
비용 계산기
프롬프트 구체화
AI 도구 제출
채용
이동 채용
AI 채용 검색
채용 공고 게시
후원 AIU
미션
이동 미션
미션
영향 및 통계
저자
도움말 센터
새로운 소식
지원
기부
홈
/
용어집
/
인간평가
AI 용어집
무엇입니까?
인간평가
?
정의
단위 테스트를 통해 코드 생성 정확성을 측정하는 데 사용되는 Python 프로그래밍 문제의 벤치마크입니다.
관련 용어
벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
GSM8K
언어 모델의 단계별 추론을 평가하는 데 사용되는 초등학교 수학 단어 문제의 벤치마크입니다.
평가 세트
학습 후 모델 품질을 측정하는 데 사용되는 홀드아웃 데이터 세트입니다.
테스트 시간 컴퓨팅
품질이나 추론을 개선하기 위해 응답 생성 중에 사용되는 추가 추론 계산입니다.
패스@k
생성된 k개 샘플 중 하나 이상이 테스트를 통과할 가능성을 측정하는 코드 평가 지표입니다.
AI 거버넌스
사회에서 AI가 개발되고 사용되는 방식을 안내하는 정책, 표준 및 감독 메커니즘입니다.
See also
MMLU
Factuality
LLM-as-Judge
Citations
Bi-Encoder
Watermarking
Cross-Encoder
Mid-training
Previous
MMLU
Next
GSM8K
전체 AI 용어집 찾아보기
무료 AI 가이드 모두 살펴보기