개요
가장 잘 알려진 수치는 2023년에 보고된 400개 중 약 298개입니다. 이러한 결과는 모델이 라이센스 테스트의 서면 규칙이 많은 형식을 처리할 수 있음을 보여줍니다. 이는 변호사에게 필요한 완전한 판단이 아니라 특정 채점 및 비교 선택에 따른 시험 성과를 측정합니다.
심층 분석
UBE(Uniform Bar Exam)는 세 부분으로 구성됩니다. MBE(Multistate Bar Examination)에는 200개의 객관식 문제가 있으며 점수는 절반으로 계산됩니다. MEE(Multistate Essay Examination)에는 6개의 에세이가 있습니다. MPT(Multistate Performance Test)에는 수험자가 사실과 법률이 담긴 비공개 파일을 사용하여 메모나 개요를 작성하는 두 가지 작업이 있습니다. 점수는 400점에 달하며 각 관할 구역은 일반적으로 260~270 사이의 자체 합격선을 설정합니다. 2022년 후반에 Michael Bommarito와 Daniel Martin Katz는 MBE 연습 문제에서 GPT-3.5를 테스트했습니다. 절반 정도 정답을 맞췄습니다. 확률보다는 훨씬 높지만 합격보다는 낮습니다. 2023년 3월 Katz, Bommarito, Shang Gao 및 Pablo Arredondo는 GPT-4가 전체 시뮬레이션 UBE에서 약 297점을 얻었다고 보고했습니다. OpenAI의 GPT-4 기술 보고서는 대략 298을 인용했으며 백분위수는 90에 가깝습니다. 백분위수는 가장 날카로운 비판을 받았다. 2024년 인공 지능 및 법 저널에 실린 논문에서 Eric Martínez는 90번째 백분위수 수치가 2월 시험 응시자를 기준으로 한 것임을 보여주었습니다. 2월 그룹에는 시험에 실패한 후 재응시하는 사람들이 비정상적으로 많이 포함되어 있습니다. 7월에 처음 응시한 사람들과 비교했을 때 그의 추정치는 약 60번째 백분위수로 떨어졌고 에세이에서는 더 낮았습니다. 그는 또한 에세이가 훈련된 바 그레이더가 아닌 공개된 샘플 답변을 기준으로 연구원에 의해 채점되어 불확실성을 더한다는 점도 지적했습니다. 오염은 또 다른 우려 사항입니다. 과거 질문이 온라인으로 유포되고 교육 데이터에 있었을 수도 있습니다. 일반적인 오해는 기준을 통과하면 모델이 법률 업무를 수행할 수 있다는 의미입니다. 시험 테스트는 닫힌 사실 집합 내에서 규칙과 구조화된 분석을 회상합니다. 실습에는 사실 조사, 고객 상담, 전략 계획, 위험 판단 및 전문적인 책임 수행도 필요합니다. Mata v. Avianca(2023) 사건에서 변호사들은 ChatGPT가 발명한 인용문이 포함된 요약서를 제출했습니다. 이 사례는 시험 수준의 유창함이 신뢰할 수 있는 법률 연구를 보장하지 않는다는 것을 보여주었습니다.
전략적 영향
속도와 규모
일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.
접근 및 도달
언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.
더 명확한 결정들
자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.
AI가 변호사 시험에서 수행하는 방식의 미래
막대 점수는 벤치마크로서 덜 유용해지고 있습니다. 최고의 모델들은 이미 객관식 법적 질문에서 최고점에 가까운 점수를 얻었으며 오염도 배제하기 어렵습니다. 연구원들은 2023년에 출시된 협업 벤치마크인 LegalBench와 같은 작업 컬렉션으로 이동하여 법적 추론을 더 좁은 작업으로 나누었습니다. 그들은 또한 현직 변호사가 채점하는 연구 메모, 계약 검토 등 실제 업무를 기반으로 한 테스트로 전환했습니다. 2026년 시작 예정인 NCBE의 NextGen 변호사 시험은 연구, 초안 작성 등 통합 기술에 더 많은 비중을 두고 있다. 이는 AI와의 비교를 더 유익하게 만들 수 있습니다. 모델이 테스트를 통과할 수 있는지 여부는 대체로 정해져 있습니다. 공개 질문은 익숙하지 않은 실제 문제에 대해 얼마나 안정적으로 수행하고 어떻게 실패하는지입니다.
실제 구현
OpenAI의 2023년 3월 GPT-4 기술 보고서에는 시뮬레이션된 통일 변호사 시험 점수가 400점 만점에 약 298점이고 백분위수는 90점에 가깝습니다. 이 수치는 당시 헤드라인에서 널리 반복되었습니다.
법학 교수는 챗봇을 통해 MBE 스타일의 객관식 질문을 실행하고 그 답변을 학생들의 답변과 비교합니다. 이 모델은 검은 글자 규칙에 강력하지만 사실이 의도적으로 모호한 경우에는 신뢰성이 떨어집니다.
평가자는 모델의 훈련이 중단되기 전에 연습 문제가 온라인에 게시되었는지 확인합니다. 이미 질문을 본 모델은 답변을 추론하기보다는 답변을 회상할 수 있습니다.
변호사 지원자는 AI 튜터를 사용하여 자신이 놓친 MBE 질문을 설명합니다. 그녀는 교사가 때때로 소수의 규칙을 다수의 규칙으로 제시하기 때문에 상업적인 개요와 비교하여 각 설명을 확인합니다.
위험 및 가드레일
환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.
신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.
액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.
구현 로드맵
출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.
정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.
고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.
실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the How AI Performs on the Bar Exam quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
자주 묻는 질문
AI가 변호사 시험에서 어떤 성과를 거두나요?
GPT-4와 같은 대규모 언어 모델은 통일 변호사 시험의 시뮬레이션 버전에서 일반적인 합격선보다 높은 점수를 받았습니다. 가장 잘 알려진 수치는 2023년에 보고된 400개 중 약 298개입니다. 이러한 결과는 모델이 라이센스 테스트의 서면 규칙이 많은 형식을 처리할 수 있음을 보여줍니다. 이는 변호사에게 필요한 완전한 판단이 아니라 특정 채점 및 비교 선택에 따른 시험 성과를 측정합니다.
200개의 객관식 문제가 있고 총점의 절반을 차지하는 통합 변호사 시험 구성 요소는 무엇입니까?
MBE는 200문항의 객관식 섹션으로 UBE 점수의 50%를 차지합니다. MEE는 6개의 에세이이고 MPT는 2개의 비공개 파일 과제입니다.
OpenAI의 GPT-4 기술 보고서는 2023년에 어떤 모의 유니폼 변호사 시험 점수를 인용했습니까?
OpenAI는 400점 만점에 대략 298점을 보고했습니다. 이는 관할권 전반에 걸쳐 일반적인 260~270점의 합격 범위를 초과하며 90점 근처의 백분위수와 짝을 이루었습니다.
Eric Martínez의 2024년 비평에 따르면 GPT-4의 90번째 백분위수 수치가 오해의 소지가 있는 이유는 무엇입니까?
2월 그룹에는 시험에 불합격한 후 재응시하는 사람들이 많이 포함되어 있습니다. Martínez는 7월에 처음 응시한 참가자와 비교하여 GPT-4가 전체적으로 약 60번째 백분위수로 떨어졌다고 추정했습니다.
가이드에 설명된 비평에 따라 2023년 모의 변호사 시험에서 GPT-4의 에세이 답변을 누가 채점했나요?
에세이는 훈련된 변호사가 아닌 공개된 샘플 답변을 기준으로 연구 작성자가 채점했습니다. Martínez는 이것이 쓰기 섹션 점수에 불확실성을 더한다고 지적했습니다.
Bommarito와 Katz는 2022년 말 MBE 연습 문제에서 GPT-3.5를 테스트하면서 무엇을 발견했습니까?
GPT-3.5는 질문의 절반 정도를 맞췄습니다. 이는 4가지 옵션 문제의 추측에서 예상되는 25%를 훨씬 웃도는 수치이지만 합격 수준에는 미치지 못합니다.
계속 학습하세요
관련 가이드
이 주제에 대해 선택된 추가 가이드