NästaNästa guide
KServe och modellservering på Kubernetes
Tekniskt
Språk AI GUIDE
Stora språkmodeller som GPT-4 har fått poäng över typiska passerande rader på simulerade versioner av Uniform Bar Exam.
Den mest kända siffran är cirka 298 av 400, rapporterade 2023. Dessa resultat visar att modeller kan hantera det skriftliga, regeltunga formatet av ett licenstest. De mäter testprestanda under särskilda betygs- och jämförelseval, inte den fullständiga bedömningen en praktiserande advokat behöver.
Uniform Bar Exam (UBE) har tre delar. Multistate Bar Examination (MBE) har 200 flervalsfrågor och räknas för halva poängen. Multistate Essay Examination (MEE) har sex uppsatser. Multistate Performance Test (MPT) har två uppgifter där examinanden arbetar från en sluten fil med fakta och juridik för att skriva ett PM eller brief. Poängen går till 400, och varje jurisdiktion sätter sin egen passningslinje, vanligtvis mellan 260 och 270. I slutet av 2022 testade Michael Bommarito och Daniel Martin Katz GPT-3.5 på MBE-övningsfrågor. Den svarade ungefär hälften rätt: långt över chansen, men under passningen. I mars 2023 rapporterade Katz, Bommarito, Shang Gao och Pablo Arredondo att GPT-4 fick cirka 297 poäng på en fullständig simulerad UBE. OpenAI:s GPT-4 tekniska rapport citerade ungefär 298 och en percentil nära 90:e. Percentilen fick den skarpaste kritiken. I en artikel från 2024 i tidskriften Artificial Intelligence and Law, visade Eric Martínez att siffran för 90:e percentilen baserades på testtagare i februari. I februarigruppen ingår en ovanligt stor andel personer som gör om provet efter att ha underkänts. Jämfört med förstagångstagare i juli sjönk hans uppskattning till runt 60:e percentilen och lägre på uppsatserna. Han noterade också att uppsatserna poängsattes av forskarna mot publicerade provsvar, inte av utbildade barklassare, vilket ökar osäkerheten. Kontaminering är ett annat problem: tidigare frågor cirkulerar online och kan ha funnits i träningsdatan. En vanlig missuppfattning är att om man klarar ribban betyder det att en modell kan praktisera juridik. Tentamen testar återkallelse av regler och strukturerad analys inom en sluten uppsättning fakta. Praxis kräver också att undersöka fakta, ge klienter rådgivning, planera strategi, bedöma risker och ta professionellt ansvar. I Mata v. Avianca (2023) lämnade advokater in en skrivelse som innehöll citat som ChatGPT hade uppfunnit. Fallet visade att flyt på examensnivå inte garanterar tillförlitlig juridisk forskning.
Språkarbetsflöden kan gå snabbare utan att offra konsekvens.
Det utökar åtkomsten över språk och kommunikationsstilar.
Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.
Barpoäng blir mindre användbara som riktmärke. Toppmodeller har redan fått nära taket i flervalsfrågor, och det är svårt att utesluta kontaminering. Forskare har gått mot uppgiftssamlingar som LegalBench, ett samarbetsriktmärke som släpptes 2023 som bryter upp juridiska resonemang i många smalare uppgifter. De har också gått mot tester som bygger på verkligt arbete, såsom forskningsmemon och kontraktsgranskning, betygsatt av praktiserande advokater. NCBE:s NextGen advokatexamen, som planeras att börja 2026, ger större vikt åt integrerade färdigheter som forskning och utarbetande. Det kan göra jämförelser med AI mer informativa. Huruvida modeller klarar tester är till stor del avgjort. Den öppna frågan är hur tillförlitligt de presterar, och hur de misslyckas, i obekanta verkliga frågor.
OpenAI:s tekniska rapport för GPT-4 från mars 2023 listade ett simulerat Uniform Bar Exam-resultat på cirka 298 av 400 och en percentil nära den 90:e, en siffra som sedan upprepades flitigt i rubrikerna.
En juridikprofessor springer förbi flervalsfrågor i MBE-stil genom en chatbot och jämför svaren med sina elevers. Modellen är stark på svartbokstavsregler men mindre tillförlitlig när fakta är medvetet tvetydiga.
En utvärderare kontrollerar om en övningsfråga lades upp online innan en modells utbildningsgräns. En modell som redan har sett frågan kan komma ihåg ett svar snarare än att resonera till det.
En barsökande använder en AI-handledare för att förklara MBE-frågorna hon missade. Hon kontrollerar varje förklaring mot en kommersiell disposition eftersom handledaren ibland presenterar en minoritetsregel som majoritetsregel.
Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.
Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.
Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.
Definiera utdataformat, ton och kvalitetsstandarder innan lansering.
Marksvar med pålitliga källor närhelst noggrannhet är viktig.
Håll en kontrollpunkt för mänsklig granskning för höga insatser.
Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Stora språkmodeller som GPT-4 har fått poäng över typiska passerande rader på simulerade versioner av Uniform Bar Exam. Den mest kända siffran är cirka 298 av 400, rapporterade 2023. Dessa resultat visar att modeller kan hantera det skriftliga, regeltunga formatet av ett licenstest. De mäter testprestanda under särskilda betygs- och jämförelseval, inte den fullständiga bedömningen en praktiserande advokat behöver.
MBE är flervalssektionen med 200 frågor och utgör 50 procent av UBE-poängen. MEE är sex uppsatser, och MPT är två slutna uppgifter.
OpenAI rapporterade ungefär 298 av 400. Det är över det intervall på 260 till 270 som är vanliga i jurisdiktioner, och det parades ihop med en percentil nära 90:e.
I februarigruppen ingår en stor andel personer som gör om provet efter att ha underkänts. Jämfört med förstagångstagare i juli, uppskattade Martínez att GPT-4 sjönk till runt 60:e percentilen totalt.
Uppsatserna poängsattes av studiens författare mot publicerade provsvar, inte av utbildade barklassare. Martínez noterade att detta lägger till osäkerhet till poängen för de skriftliga avsnitten.
GPT-3.5 fick ungefär hälften av frågorna rätt. Det är långt över de 25 procent som förväntas från att gissa på frågor med fyra alternativ, men under en godkänd nivå.
Fortsätt lära dig
Fler guider har valts för detta ämne
NästaNästa guide
KServe och modellservering på Kubernetes
Tekniskt