À suivreGuide suivant
KServe et Model Serving sur Kubernetes
Technique
GUIDE IA du langage
Les grands modèles de langage tels que GPT-4 ont obtenu des résultats supérieurs aux lignes de réussite habituelles sur les versions simulées de l'examen uniforme du barreau.
Le chiffre le plus connu est d’environ 298 sur 400, rapporté en 2023. Ces résultats montrent que les modèles peuvent gérer le format écrit et riche en règles d’un test de licence. Ils mesurent les performances des tests selon des choix particuliers de notation et de comparaison, et non le jugement complet dont un avocat en exercice a besoin.
L'examen uniforme du barreau (UBE) comprend trois parties. Le Multistate Bar Examination (MBE) comporte 200 questions à choix multiples et compte pour la moitié du score. Le Multistate Essay Examination (MEE) comprend six essais. Le test de performance multi-états (MPT) comporte deux tâches dans lesquelles le candidat travaille à partir d'un dossier fermé de faits et de droit pour rédiger une note ou un mémoire. Les scores vont jusqu'à 400 et chaque juridiction fixe sa propre ligne de passage, généralement entre 260 et 270. Fin 2022, Michael Bommarito et Daniel Martin Katz ont testé GPT-3.5 sur des questions pratiques MBE. Il a répondu correctement à moitié : bien au-dessus du hasard, mais en dessous de la réussite. En mars 2023, Katz, Bommarito, Shang Gao et Pablo Arredondo ont rapporté que GPT-4 avait obtenu un score d'environ 297 sur un UBE simulé complet. Le rapport technique GPT-4 de OpenAI citait environ 298 et un centile proche du 90e. Le centile a suscité les critiques les plus vives. Dans un article publié en 2024 dans la revue Artificial Intelligence and Law, Eric Martínez a montré que le chiffre du 90e centile était basé sur les candidats au test de février. Le groupe de février comprend une part inhabituellement importante de personnes repassant l'examen après un échec. Par rapport aux nouveaux candidats de juillet, son estimation est tombée aux alentours du 60e percentile, et plus bas pour les dissertations. Il a également noté que les essais ont été notés par les chercheurs sur la base d'échantillons de réponses publiés, et non par des évaluateurs qualifiés, ce qui ajoute de l'incertitude. La contamination est une autre préoccupation : des questions passées circulent en ligne et pourraient avoir été contenues dans les données de formation. Une idée fausse très répandue est que passer le barreau signifie qu’un modèle peut pratiquer le droit. L'examen teste le rappel des règles et l'analyse structurée au sein d'un ensemble fermé de faits. La pratique nécessite également d'enquêter sur les faits, de conseiller les clients, de planifier une stratégie, de juger des risques et d'assumer la responsabilité professionnelle. Dans Mata c. Avianca (2023), les avocats ont déposé un mémoire contenant des citations inventées par ChatGPT. L’affaire a montré que la maîtrise d’un examen au niveau de l’examen ne garantit pas une recherche juridique fiable.
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Il étend l’accès à toutes les langues et styles de communication.
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
Les scores aux barres deviennent de moins en moins utiles comme référence. Les top models obtiennent déjà des scores proches du plafond sur les questions juridiques à choix multiples, et une contamination est difficile à exclure. Les chercheurs se sont tournés vers des collections de tâches telles que LegalBench, une référence collaborative publiée en 2023 qui divise le raisonnement juridique en de nombreuses tâches plus restreintes. Ils ont également évolué vers des tests basés sur des travaux réels, tels que des notes de recherche et des révisions de contrats, notés par des avocats en exercice. L'examen du barreau NextGen du NCBE, qui devrait débuter en 2026, accorde plus de poids aux compétences intégrées telles que la recherche et la rédaction. Cela pourrait rendre les comparaisons avec l’IA plus informatives. La question de savoir si les modèles peuvent réussir les tests est en grande partie réglée. La question ouverte est de savoir dans quelle mesure ils fonctionnent de manière fiable, et comment ils échouent, sur des sujets réels peu familiers.
Le rapport technique GPT-4 de mars 2023 de OpenAI indiquait un score simulé à l'examen uniforme du barreau d'environ 298 sur 400 et un centile proche du 90e, un chiffre qui a ensuite été largement répété dans les gros titres.
Un professeur de droit passe des questions à choix multiples de type MBE via un chatbot et compare ses réponses avec celles de ses étudiants. Le modèle s’appuie sur des règles écrites en lettres noires, mais il est moins fiable lorsque les faits sont délibérément ambigus.
Un évaluateur vérifie si une question pratique a été publiée en ligne avant la fin de la formation d'un modèle. Un modèle qui a déjà vu la question peut se rappeler une réponse plutôt que de la raisonner.
Une candidate au barreau utilise un tuteur en IA pour expliquer les questions MBE qu'elle a manquées. Elle vérifie chaque explication par rapport à un schéma commercial car le tuteur présente parfois une règle minoritaire comme règle majoritaire.
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Les grands modèles de langage tels que GPT-4 ont obtenu des résultats supérieurs aux lignes de réussite habituelles sur les versions simulées de l'examen uniforme du barreau. Le chiffre le plus connu est d’environ 298 sur 400, rapporté en 2023. Ces résultats montrent que les modèles peuvent gérer le format écrit et riche en règles d’un test de licence. Ils mesurent les performances des tests selon des choix particuliers de notation et de comparaison, et non le jugement complet dont un avocat en exercice a besoin.
Le MBE est une section à choix multiples de 200 questions et représente 50 % du score UBE. Le MEE comprend six essais et le MPT comprend deux tâches à dossier fermé.
OpenAI a signalé environ 298 sur 400. Ce chiffre est supérieur à la plage de réussite de 260 à 270 commune à toutes les juridictions, et il a été associé à un centile proche du 90e.
Le groupe de février comprend une part importante de personnes repassant l'examen après un échec. Par rapport aux nouveaux preneurs de juillet, Martínez a estimé que GPT-4 était globalement tombé aux alentours du 60e percentile.
Les essais ont été notés par les auteurs de l'étude par rapport à des exemples de réponses publiés, et non par des évaluateurs qualifiés. Martínez a noté que cela ajoute de l'incertitude aux scores des sections écrites.
GPT-3.5 a répondu correctement à environ la moitié des questions. C'est bien au-dessus des 25 pour cent attendus en répondant à des questions à quatre options, mais en dessous du niveau de passage.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
KServe et Model Serving sur Kubernetes
Technique