GUIDE IA du langage

Comment l’IA se comporte à l’examen du barreau

Les grands modèles de langage tels que GPT-4 ont obtenu des résultats supérieurs aux lignes de réussite habituelles sur les versions simulées de l'examen uniforme du barreau.

  • 4 minutes de lecture
  • Dernière mise à jour
Sur cette page4 minutes de lecture
  1. Aperçu
  2. Plongée profonde
  3. Impact stratégique
  4. L’avenir des performances de l’IA à l’examen du barreau
  5. Mise en œuvre dans le monde réel
  6. Risques et garde-fous
  7. Feuille de route de mise en œuvre
  8. Continuez à explorer
  9. Questions fréquemment posées

Aperçu

Le chiffre le plus connu est d’environ 298 sur 400, rapporté en 2023. Ces résultats montrent que les modèles peuvent gérer le format écrit et riche en règles d’un test de licence. Ils mesurent les performances des tests selon des choix particuliers de notation et de comparaison, et non le jugement complet dont un avocat en exercice a besoin.

Plongée profonde

L'examen uniforme du barreau (UBE) comprend trois parties. Le Multistate Bar Examination (MBE) comporte 200 questions à choix multiples et compte pour la moitié du score. Le Multistate Essay Examination (MEE) comprend six essais. Le test de performance multi-états (MPT) comporte deux tâches dans lesquelles le candidat travaille à partir d'un dossier fermé de faits et de droit pour rédiger une note ou un mémoire. Les scores vont jusqu'à 400 et chaque juridiction fixe sa propre ligne de passage, généralement entre 260 et 270. Fin 2022, Michael Bommarito et Daniel Martin Katz ont testé GPT-3.5 sur des questions pratiques MBE. Il a répondu correctement à moitié : bien au-dessus du hasard, mais en dessous de la réussite. En mars 2023, Katz, Bommarito, Shang Gao et Pablo Arredondo ont rapporté que GPT-4 avait obtenu un score d'environ 297 sur un UBE simulé complet. Le rapport technique GPT-4 de OpenAI citait environ 298 et un centile proche du 90e. Le centile a suscité les critiques les plus vives. Dans un article publié en 2024 dans la revue Artificial Intelligence and Law, Eric Martínez a montré que le chiffre du 90e centile était basé sur les candidats au test de février. Le groupe de février comprend une part inhabituellement importante de personnes repassant l'examen après un échec. Par rapport aux nouveaux candidats de juillet, son estimation est tombée aux alentours du 60e percentile, et plus bas pour les dissertations. Il a également noté que les essais ont été notés par les chercheurs sur la base d'échantillons de réponses publiés, et non par des évaluateurs qualifiés, ce qui ajoute de l'incertitude. La contamination est une autre préoccupation : des questions passées circulent en ligne et pourraient avoir été contenues dans les données de formation. Une idée fausse très répandue est que passer le barreau signifie qu’un modèle peut pratiquer le droit. L'examen teste le rappel des règles et l'analyse structurée au sein d'un ensemble fermé de faits. La pratique nécessite également d'enquêter sur les faits, de conseiller les clients, de planifier une stratégie, de juger des risques et d'assumer la responsabilité professionnelle. Dans Mata c. Avianca (2023), les avocats ont déposé un mémoire contenant des citations inventées par ChatGPT. L’affaire a montré que la maîtrise d’un examen au niveau de l’examen ne garantit pas une recherche juridique fiable.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir des performances de l’IA à l’examen du barreau

Les scores aux barres deviennent de moins en moins utiles comme référence. Les top models obtiennent déjà des scores proches du plafond sur les questions juridiques à choix multiples, et une contamination est difficile à exclure. Les chercheurs se sont tournés vers des collections de tâches telles que LegalBench, une référence collaborative publiée en 2023 qui divise le raisonnement juridique en de nombreuses tâches plus restreintes. Ils ont également évolué vers des tests basés sur des travaux réels, tels que des notes de recherche et des révisions de contrats, notés par des avocats en exercice. L'examen du barreau NextGen du NCBE, qui devrait débuter en 2026, accorde plus de poids aux compétences intégrées telles que la recherche et la rédaction. Cela pourrait rendre les comparaisons avec l’IA plus informatives. La question de savoir si les modèles peuvent réussir les tests est en grande partie réglée. La question ouverte est de savoir dans quelle mesure ils fonctionnent de manière fiable, et comment ils échouent, sur des sujets réels peu familiers.

Mise en œuvre dans le monde réel

Le rapport technique GPT-4 de mars 2023 de OpenAI indiquait un score simulé à l'examen uniforme du barreau d'environ 298 sur 400 et un centile proche du 90e, un chiffre qui a ensuite été largement répété dans les gros titres.

Un professeur de droit passe des questions à choix multiples de type MBE via un chatbot et compare ses réponses avec celles de ses étudiants. Le modèle s’appuie sur des règles écrites en lettres noires, mais il est moins fiable lorsque les faits sont délibérément ambigus.

Un évaluateur vérifie si une question pratique a été publiée en ligne avant la fin de la formation d'un modèle. Un modèle qui a déjà vu la question peut se rappeler une réponse plutôt que de la raisonner.

Une candidate au barreau utilise un tuteur en IA pour expliquer les questions MBE qu'elle a manquées. Elle vérifie chaque explication par rapport à un schéma commercial car le tuteur présente parfois une règle minoritaire comme règle majoritaire.

Risques et garde-fous

  • Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

  • La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

  • Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

  1. Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

  2. Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

  3. Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

  4. Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the How AI Performs on the Bar Exam quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

Quelles sont les performances de l’IA à l’examen du barreau ?

Les grands modèles de langage tels que GPT-4 ont obtenu des résultats supérieurs aux lignes de réussite habituelles sur les versions simulées de l'examen uniforme du barreau. Le chiffre le plus connu est d’environ 298 sur 400, rapporté en 2023. Ces résultats montrent que les modèles peuvent gérer le format écrit et riche en règles d’un test de licence. Ils mesurent les performances des tests selon des choix particuliers de notation et de comparaison, et non le jugement complet dont un avocat en exercice a besoin.

Quel composant de l'examen uniforme du barreau comporte 200 questions à choix multiples et compte pour la moitié de la note totale ?

Le MBE est une section à choix multiples de 200 questions et représente 50 % du score UBE. Le MEE comprend six essais et le MPT comprend deux tâches à dossier fermé.

Quel score simulé à l'examen uniforme du barreau le rapport technique OpenAI de OpenAI a-t-il cité en 2023 ?

OpenAI a signalé environ 298 sur 400. Ce chiffre est supérieur à la plage de réussite de 260 à 270 commune à toutes les juridictions, et il a été associé à un centile proche du 90e.

Selon la critique d'Eric Martínez de 2024, pourquoi le chiffre du 90e centile de GPT-4 était-il trompeur ?

Le groupe de février comprend une part importante de personnes repassant l'examen après un échec. Par rapport aux nouveaux preneurs de juillet, Martínez a estimé que GPT-4 était globalement tombé aux alentours du 60e percentile.

Qui a noté les réponses à la dissertation de GPT-4 lors de l'examen simulé du barreau de 2023, selon la critique décrite dans le guide ?

Les essais ont été notés par les auteurs de l'étude par rapport à des exemples de réponses publiés, et non par des évaluateurs qualifiés. Martínez a noté que cela ajoute de l'incertitude aux scores des sections écrites.

Qu'ont découvert Bommarito et Katz lorsqu'ils ont testé GPT-3.5 sur des questions pratiques MBE fin 2022 ?

GPT-3.5 a répondu correctement à environ la moitié des questions. C'est bien au-dessus des 25 pour cent attendus en répondant à des questions à quatre options, mais en dessous du niveau de passage.