GUIDE DES APPLICATIONS

Utilisation de ChatGPT pour le diagnostic différentiel

De grands modèles de langage tels que GPT-4 peuvent produire des listes de diagnostics différentiels plausibles à partir d'une description de cas et, dans les études publiées, ils incluent souvent le diagnostic correct.

  • 4 minutes de lecture
  • Dernière mise à jour
Sur cette page4 minutes de lecture
  1. Aperçu
  2. Plongée profonde
  3. Impact stratégique
  4. L'avenir de l'utilisation de ChatGPT pour le diagnostic différentiel
  5. Mise en œuvre dans le monde réel
  6. Risques et garde-fous
  7. Feuille de route de mise en œuvre
  8. Continuez à explorer
  9. Questions fréquemment posées

Aperçu

Ce ne sont pas des appareils de diagnostic validés. Leur utilisation la plus sûre est celle d'un brainstorming structuré de deuxième opinion qu'un clinicien compare au patient, et les médecins qui comprennent à la fois leurs forces et leurs modes d'échec en tirent le meilleur parti.

Plongée profonde

Une grande partie des preuves proviennent de vignettes de cas. Dans une lettre de recherche du JAMA de 2023, Kanjee et ses collègues ont testé GPT-4 sur 70 cas difficiles lors des conférences clinicopathologiques du New England Journal of Medicine. Le diagnostic final apparaissait dans le différentiel du modèle dans environ 64 pour cent des cas et constituait le diagnostic principal dans environ 39 pour cent. Un essai randomisé réalisé par Goh et ses collègues, publié dans JAMA Network Open en 2024, a donné à 50 médecins soit GPT-4 plus les ressources habituelles, soit les ressources habituelles seules pour les cas de diagnostic structurés. L'accès à GPT-4 n'a pas amélioré de manière significative les scores de raisonnement diagnostique des médecins. Cependant, GPT-4 travaillant seul a obtenu des résultats nettement supérieurs à ceux des médecins qui utilisaient uniquement les ressources habituelles. Une interprétation est que les médecins ne savaient pas comment bien utiliser l'outil ou ne lui faisaient pas confiance lorsqu'il n'était pas d'accord avec eux. Des systèmes de recherche tels que l'AMIE de Google ont également été testés sur le dialogue diagnostique et la génération différentielle, avec de solides résultats dans des études contrôlées. Ces résultats nécessitent une lecture attentive. Les séries de cas publiées peuvent figurer dans les données d'entraînement d'un modèle. Les vignettes arrivent déjà nettoyées, avec les résultats pertinents choisis et résumés, tandis que les vrais patients apportent des informations incomplètes, contradictoires et non déclarées. La notation « diagnostic correct quelque part dans la liste » récompense les longues listes, ce qui peut entraîner des tests supplémentaires. L’idée fausse la plus répandue est que la précision des références est égale à la précision au chevet du patient. Ce n’est pas le cas. Les modes d'échec connus incluent un raisonnement sûr mais erroné, des références ou des seuils de laboratoire inventés, l'ancrage sur le diagnostic auquel l'utilisateur fait allusion, la surpondération des présentations de manuels courants et l'absence de conditions critiques lorsque la description omet les signes vitaux. La confidentialité est une question distincte. La saisie d'informations identifiables sur un patient dans un chatbot consommateur sans accord de partenariat commercial peut enfreindre la HIPAA, les cliniciens doivent donc utiliser les outils approuvés par leur organisation.

Impact stratégique

Choix de construction

La conception au niveau de l’application détermine si l’IA améliore les résultats réels.

Équipe et flux de travail

Une bonne intégration des flux de travail crée des gains de productivité sur lesquels les utilisateurs peuvent compter.

Risques et sécurité

Des cas d’utilisation bien ciblés réduisent la lassitude face au changement et les risques de mise en œuvre.

L'avenir de l'utilisation de ChatGPT pour le diagnostic différentiel

L'IA diagnostique passe des chatbots généraux vers des outils intégrés aux DSE et aux plateformes de preuves, où ils peuvent voir des données structurées et citer des sources. Cela peut réduire certaines erreurs, mais cela ajoute le risque que les cliniciens s'en remettent à une suggestion confiante. L’essai Goh soulève la question ouverte : comment les cliniciens et les modèles devraient travailler ensemble, et pas seulement la précision du modèle seul. Les études prospectives avec de vrais patients et des résultats réels sont encore rares par rapport aux références par vignettes. Jusqu’à ce qu’il y en ait davantage, la position défendable est que ces outils peuvent élargir les différences et inciter à un réexamen. Le clinicien est toujours propriétaire du diagnostic.

Mise en œuvre dans le monde réel

Une hospitaliste saisit un résumé anonymisé de fièvre, d'éruption cutanée, d'éosinophilie et d'un nouvel anticonvulsivant dans l'outil d'IA approuvé par son système de santé et demande des diagnostics à ne pas manquer. DRESS apparaît sur la liste et elle examine le calendrier des médicaments.

Un résident demande au modèle quels résultats permettraient le mieux de distinguer ses trois principaux diagnostics de dyspnée aiguë, puis utilise la réponse pour planifier un examen et des tests ciblés, et non pour établir un diagnostic.

Un médecin de premier recours qui soupçonne une maladie virale demande au modèle d'argumenter contre son diagnostic principal et d'énumérer ce qui pourrait lui manquer. Il s'agit d'un contrôle délibéré de l'ancrage.

Un clinicien obtient deux listes classées différentes après avoir posé deux fois la même question avec une formulation légèrement différente, et considère cela comme un signe que l'ordre du modèle n'est pas une estimation de probabilité.

Risques et garde-fous

  • L'automatisation d'un processus interrompu peut amplifier les problèmes existants.

  • Les équipes peuvent sur-automatiser et supprimer le jugement humain nécessaire.

  • La qualité peut dériver si les résultats ne sont pas évalués en permanence.

Feuille de route de mise en œuvre

  1. Cartographiez le flux de travail actuel et identifiez l’étape la plus problématique.

  2. Définissez des points de contrôle humains avant une automatisation complète.

  3. Formez les utilisateurs aux invites, aux voies d’escalade et aux normes de qualité.

  4. Suivez les résultats au niveau des tâches pour confirmer la valeur durable.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Using ChatGPT for Differential Diagnosis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

À quoi sert ChatGPT pour le diagnostic différentiel ?

De grands modèles de langage tels que GPT-4 peuvent produire des listes de diagnostics différentiels plausibles à partir d'une description de cas et, dans les études publiées, ils incluent souvent le diagnostic correct. Ce ne sont pas des appareils de diagnostic validés. Leur utilisation la plus sûre est celle d'un brainstorming structuré de deuxième opinion qu'un clinicien compare au patient, et les médecins qui comprennent à la fois leurs forces et leurs modes d'échec en tirent le meilleur parti.

Dans le test 2023 de Kanjee et collègues de GPT-4 sur des cas clinicopathologiques NEJM, à quelle fréquence le diagnostic final était-il situé quelque part dans le différentiel du modèle ?

Le diagnostic final était différentiel dans environ 64 pour cent des cas et était le diagnostic principal dans environ 39 pour cent.

Quel a été le principal résultat de l’étude de Goh et al. essai randomisé ?

Les médecins avec GPT-4 n’ont pas surpassé de manière significative les médecins disposant de ressources habituelles, mais le modèle seul a obtenu des résultats plus élevés. Cela montre comment les gens utilisent l’outil.

Pourquoi les références de vignettes peuvent-elles surestimer l’efficacité d’un modèle avec de vrais patients ?

Les résultats pré-organisés et la contamination possible des données de formation rendent les vignettes plus faciles que les rencontres réelles désordonnées.

Un clinicien demande : « Est-ce que cela pourrait être un lupus ? » au début de son invite. Quel mode de défaillance cela invite-t-il ?

Les modèles ont tendance à être d’accord avec le cadre qui leur est donné, donc faire allusion à un diagnostic attire le différentiel vers lui.

Pourquoi la notation du « diagnostic correct n’importe où dans la liste » est-elle une mesure erronée ?

Une liste plus longue est plus susceptible de contenir la réponse, mais dans la pratique, de longues différentielles peuvent conduire à des analyses supplémentaires et inutiles.