À suivreGuide suivant
ChatGPT pour les pharmaciens
Applications
GUIDE DES APPLICATIONS
De grands modèles de langage tels que GPT-4 peuvent produire des listes de diagnostics différentiels plausibles à partir d'une description de cas et, dans les études publiées, ils incluent souvent le diagnostic correct.
Ce ne sont pas des appareils de diagnostic validés. Leur utilisation la plus sûre est celle d'un brainstorming structuré de deuxième opinion qu'un clinicien compare au patient, et les médecins qui comprennent à la fois leurs forces et leurs modes d'échec en tirent le meilleur parti.
Une grande partie des preuves proviennent de vignettes de cas. Dans une lettre de recherche du JAMA de 2023, Kanjee et ses collègues ont testé GPT-4 sur 70 cas difficiles lors des conférences clinicopathologiques du New England Journal of Medicine. Le diagnostic final apparaissait dans le différentiel du modèle dans environ 64 pour cent des cas et constituait le diagnostic principal dans environ 39 pour cent. Un essai randomisé réalisé par Goh et ses collègues, publié dans JAMA Network Open en 2024, a donné à 50 médecins soit GPT-4 plus les ressources habituelles, soit les ressources habituelles seules pour les cas de diagnostic structurés. L'accès à GPT-4 n'a pas amélioré de manière significative les scores de raisonnement diagnostique des médecins. Cependant, GPT-4 travaillant seul a obtenu des résultats nettement supérieurs à ceux des médecins qui utilisaient uniquement les ressources habituelles. Une interprétation est que les médecins ne savaient pas comment bien utiliser l'outil ou ne lui faisaient pas confiance lorsqu'il n'était pas d'accord avec eux. Des systèmes de recherche tels que l'AMIE de Google ont également été testés sur le dialogue diagnostique et la génération différentielle, avec de solides résultats dans des études contrôlées. Ces résultats nécessitent une lecture attentive. Les séries de cas publiées peuvent figurer dans les données d'entraînement d'un modèle. Les vignettes arrivent déjà nettoyées, avec les résultats pertinents choisis et résumés, tandis que les vrais patients apportent des informations incomplètes, contradictoires et non déclarées. La notation « diagnostic correct quelque part dans la liste » récompense les longues listes, ce qui peut entraîner des tests supplémentaires. L’idée fausse la plus répandue est que la précision des références est égale à la précision au chevet du patient. Ce n’est pas le cas. Les modes d'échec connus incluent un raisonnement sûr mais erroné, des références ou des seuils de laboratoire inventés, l'ancrage sur le diagnostic auquel l'utilisateur fait allusion, la surpondération des présentations de manuels courants et l'absence de conditions critiques lorsque la description omet les signes vitaux. La confidentialité est une question distincte. La saisie d'informations identifiables sur un patient dans un chatbot consommateur sans accord de partenariat commercial peut enfreindre la HIPAA, les cliniciens doivent donc utiliser les outils approuvés par leur organisation.
La conception au niveau de l’application détermine si l’IA améliore les résultats réels.
Une bonne intégration des flux de travail crée des gains de productivité sur lesquels les utilisateurs peuvent compter.
Des cas d’utilisation bien ciblés réduisent la lassitude face au changement et les risques de mise en œuvre.
L'IA diagnostique passe des chatbots généraux vers des outils intégrés aux DSE et aux plateformes de preuves, où ils peuvent voir des données structurées et citer des sources. Cela peut réduire certaines erreurs, mais cela ajoute le risque que les cliniciens s'en remettent à une suggestion confiante. L’essai Goh soulève la question ouverte : comment les cliniciens et les modèles devraient travailler ensemble, et pas seulement la précision du modèle seul. Les études prospectives avec de vrais patients et des résultats réels sont encore rares par rapport aux références par vignettes. Jusqu’à ce qu’il y en ait davantage, la position défendable est que ces outils peuvent élargir les différences et inciter à un réexamen. Le clinicien est toujours propriétaire du diagnostic.
Une hospitaliste saisit un résumé anonymisé de fièvre, d'éruption cutanée, d'éosinophilie et d'un nouvel anticonvulsivant dans l'outil d'IA approuvé par son système de santé et demande des diagnostics à ne pas manquer. DRESS apparaît sur la liste et elle examine le calendrier des médicaments.
Un résident demande au modèle quels résultats permettraient le mieux de distinguer ses trois principaux diagnostics de dyspnée aiguë, puis utilise la réponse pour planifier un examen et des tests ciblés, et non pour établir un diagnostic.
Un médecin de premier recours qui soupçonne une maladie virale demande au modèle d'argumenter contre son diagnostic principal et d'énumérer ce qui pourrait lui manquer. Il s'agit d'un contrôle délibéré de l'ancrage.
Un clinicien obtient deux listes classées différentes après avoir posé deux fois la même question avec une formulation légèrement différente, et considère cela comme un signe que l'ordre du modèle n'est pas une estimation de probabilité.
L'automatisation d'un processus interrompu peut amplifier les problèmes existants.
Les équipes peuvent sur-automatiser et supprimer le jugement humain nécessaire.
La qualité peut dériver si les résultats ne sont pas évalués en permanence.
Cartographiez le flux de travail actuel et identifiez l’étape la plus problématique.
Définissez des points de contrôle humains avant une automatisation complète.
Formez les utilisateurs aux invites, aux voies d’escalade et aux normes de qualité.
Suivez les résultats au niveau des tâches pour confirmer la valeur durable.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
De grands modèles de langage tels que GPT-4 peuvent produire des listes de diagnostics différentiels plausibles à partir d'une description de cas et, dans les études publiées, ils incluent souvent le diagnostic correct. Ce ne sont pas des appareils de diagnostic validés. Leur utilisation la plus sûre est celle d'un brainstorming structuré de deuxième opinion qu'un clinicien compare au patient, et les médecins qui comprennent à la fois leurs forces et leurs modes d'échec en tirent le meilleur parti.
Le diagnostic final était différentiel dans environ 64 pour cent des cas et était le diagnostic principal dans environ 39 pour cent.
Les médecins avec GPT-4 n’ont pas surpassé de manière significative les médecins disposant de ressources habituelles, mais le modèle seul a obtenu des résultats plus élevés. Cela montre comment les gens utilisent l’outil.
Les résultats pré-organisés et la contamination possible des données de formation rendent les vignettes plus faciles que les rencontres réelles désordonnées.
Les modèles ont tendance à être d’accord avec le cadre qui leur est donné, donc faire allusion à un diagnostic attire le différentiel vers lui.
Une liste plus longue est plus susceptible de contenir la réponse, mais dans la pratique, de longues différentielles peuvent conduire à des analyses supplémentaires et inutiles.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
ChatGPT pour les pharmaciens
Applications