ПОСІБНИК із застосування

Використання ChatGPT для диференціальної діагностики

Великі мовні моделі, такі як GPT-4, можуть створити вірогідні списки диференціальної діагностики з опису випадку, і в опублікованих дослідженнях вони часто включають правильний діагноз.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє використання ChatGPT для диференціальної діагностики
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Вони не є перевіреними діагностичними пристроями. Найбезпечніше їх використання – це структурований мозковий штурм, який клініцист перевіряє на пацієнта, і лікарі, які розуміють як їхні сильні сторони, так і їхні невдачі, отримують від них максимальну користь.

Глибоке занурення

Значна частина доказів походить із віньєток справ. У дослідницькому листі JAMA за 2023 рік Канджі та його колеги перевірили GPT-4 на 70 складних випадках з клініко-патологічних конференцій журналу New England Journal of Medicine. Остаточний діагноз з’являвся в диференціалі моделі приблизно в 64 відсотках випадків і був основним діагнозом приблизно в 39 відсотках. Рандомізоване дослідження Го та його колег, опубліковане в JAMA Network Open у 2024 році, дало 50 лікарям або GPT-4 плюс звичайні ресурси, або лише звичайні ресурси для структурованих діагностичних випадків. Доступ до GPT-4 суттєво не покращив результати діагностичних міркувань лікарів. Однак GPT-4, який працював сам, отримав значно вищі бали, ніж лікарі, які використовували лише звичайні ресурси. Одне з тлумачень полягає в тому, що лікарі не знали, як добре використовувати інструмент, або не довіряли йому, коли він їм не підходив. Дослідницькі системи, такі як AMIE Google, також були протестовані на діагностичний діалог і диференціальну генерацію, з значними результатами в контрольованих дослідженнях. Ці результати потребують уважного читання. Опубліковані серії випадків можуть бути в навчальних даних моделі. Віньєтки надходять уже очищеними, з вибраними та узагальненими відповідними висновками, тоді як реальні пацієнти приносять неповну, суперечливу та невикладену інформацію. Оцінка «правильний діагноз десь у списку» винагороджує довгі списки, що може спонукати до додаткового тестування. Поширена помилкова думка полягає в тому, що точність еталонного тесту дорівнює точності біля ліжка. Це не так. Відомі режими помилок включають впевнене, але неправильне міркування, вигадані посилання або лабораторні пороги, прив’язку до будь-якого діагнозу, на який натякає користувач, надмірне зважування звичайних презентацій підручників і відсутність критичних умов, коли опис не містить життєво важливих ознак. Конфіденційність – окрема тема. Введення ідентифікаційної інформації пацієнта в споживчий чат-бот без угоди про ділове партнерство може порушити HIPAA, тому лікарі повинні використовувати інструменти, схвалені їх організацією.

Стратегічний вплив

Створіть вибір

Розробка на рівні програми визначає, чи покращує ШІ реальні результати.

Команда та робочий процес

Хороша інтеграція робочого процесу підвищує продуктивність, якій користувачі довіряють.

Ризики та безпека

Добре розроблені варіанти використання зменшують втому від змін і ризик впровадження.

Майбутнє використання ChatGPT для диференціальної діагностики

Діагностичний штучний інтелект переходить від звичайних чат-ботів до інструментів, вбудованих у EHR та платформ доказів, де вони можуть переглядати структуровані дані та посилатися на джерела. Це може зменшити кількість помилок, але додає ризик того, що клініцисти відмовляться від впевненої пропозиції. Дослідження Гоха вказує на відкрите питання: як клініцисти та моделі повинні працювати разом, а не лише те, наскільки точна модель сама по собі. Проспективних досліджень із реальними пацієнтами та реальними результатами все ще мало порівняно з контрольними показниками. Поки не існує більше, обґрунтована позиція полягає в тому, що ці інструменти можуть розширити диференціал і спонукати до перегляду. Клініцист все ще володіє діагнозом.

Реалізація в реальному світі

Лікар вводить деідентифіковане резюме про лихоманку, висип, еозинофілію та новий протисудомний препарат у затверджений системою охорони здоров’я інструмент ШІ та запитує діагнози, які неможливо пропустити. DRESS з’являється в списку, і вона переглядає графік прийому ліків.

Мешканець запитує модель, які знахідки найкраще розрізняють його три найпопулярніші діагнози гострої задишки, а потім використовує відповідь, щоб спланувати цілеспрямований огляд і тести, а не зупинятися на діагнозі.

Лікар первинної медичної допомоги, який підозрює вірусне захворювання, просить модель заперечити свій головний діагноз і перерахувати, чого вона може пропустити. Це навмисна перевірка кріплення.

Клініцист отримує два різні ранжовані списки після того, як двічі задає те саме запитання з дещо різними формулюваннями, і сприймає це як ознаку того, що порядок моделі не є оцінкою ймовірності.

Ризики та огорожі

  • Автоматизація несправного процесу може посилити існуючі проблеми.

  • Команди можуть надмірно автоматизувати роботу й усунути необхідне людське судження.

  • Якість може погіршуватися, якщо результати не оцінюються постійно.

Дорожня карта впровадження

  1. Намалюйте поточний робочий процес і визначте крок із найбільшим тертям.

  2. Визначте контрольні точки людини перед повною автоматизацією.

  3. Навчіть користувачів підказкам, шляхам ескалації та стандартам якості.

  4. Відстежуйте результати на рівні завдання, щоб підтвердити постійну цінність.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Using ChatGPT for Differential Diagnosis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Що таке використання ChatGPT для диференціальної діагностики?

Великі мовні моделі, такі як GPT-4, можуть створити вірогідні списки диференціальної діагностики з опису випадку, і в опублікованих дослідженнях вони часто включають правильний діагноз. Вони не є перевіреними діагностичними пристроями. Найбезпечніше їх використання – це структурований мозковий штурм, який клініцист перевіряє на пацієнта, і лікарі, які розуміють як їхні сильні сторони, так і їхні невдачі, отримують від них максимальну користь.

У тесті Канджі та його колег 2023 року GPT-4 на клініко-патологічних випадках NEJM, як часто остаточний діагноз був десь у диференціалі моделі?

Остаточний діагноз був у диференціалі приблизно в 64 відсотках випадків і був головним діагнозом приблизно в 39 відсотках.

Який був головний результат 2024 року Goh et al. рандомізоване дослідження?

Лікарі з GPT-4 суттєво не перевершили лікарів зі звичайними ресурсами, але сама модель отримала вищі бали. Це вказує на те, як люди використовують інструмент.

Чому віньєтні контрольні показники можуть перебільшувати, наскільки добре модель буде працювати з реальними пацієнтами?

Попередньо організовані висновки та можливе забруднення даних навчання роблять віньєтки легшими, ніж безладні реальні зіткнення.

Клініцист запитує: "Чи може це бути вовчак?" на початку її підказки. Який режим відмови це запрошує?

Моделі, як правило, погоджуються з наданим їм обрамленням, тому натяк на діагноз тягне диференціал до нього.

Чому оцінка «правильного діагнозу будь-де в списку» є помилковим показником?

Довший список, швидше за все, міститиме відповідь, але довгі відмінності на практиці можуть призвести до додаткових і непотрібних обробок.