РУКОВОДСТВО ПО ПРИМЕНЕНИЮ

Использование ChatGPT для дифференциальной диагностики

Большие языковые модели, такие как GPT-4, могут создавать правдоподобные списки дифференциальных диагнозов на основе описания случая, а в опубликованных исследованиях они часто включают правильный диагноз.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее использования ChatGPT для дифференциальной диагностики
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Они не являются проверенными диагностическими устройствами. Их самое безопасное использование — это структурированный мозговой штурм второго мнения, который врач сверяет с пациентом, а врачи, которые понимают как их сильные стороны, так и их недостатки, получают от них максимальную пользу.

Глубокое погружение

Большая часть доказательств получена из эпизодов дел. В исследовательском письме JAMA 2023 года Канджи и его коллеги протестировали GPT-4 на 70 сложных случаях на клинико-патологических конференциях New England Journal of Medicine. Окончательный диагноз появлялся в дифференциале модели примерно в 64 процентах случаев и был ее верхним диагнозом примерно в 39 процентах. В рандомизированном исследовании Го и его коллег, опубликованном в журнале JAMA Network Open в 2024 году, 50 врачам были предоставлены либо GPT-4 плюс обычные ресурсы, либо только обычные ресурсы для структурированных диагностических случаев. Доступ к GPT-4 существенно не улучшил показатели диагностического мышления врачей. Однако GPT-4, работавшие в одиночку, набрали значительно больше баллов, чем врачи, которые использовали только обычные ресурсы. Одна из интерпретаций заключается в том, что врачи не знали, как правильно использовать этот инструмент, или не доверяли ему, когда он с ними не соглашался. Исследовательские системы, такие как AMIE Google, также были протестированы на предмет диагностического диалога и дифференциальной генерации, что дало хорошие результаты в контролируемых исследованиях. Эти результаты требуют внимательного прочтения. Опубликованные серии случаев могут находиться в обучающих данных модели. Виньетки поступают уже очищенными, с выбранными и обобщенными соответствующими выводами, тогда как реальные пациенты приносят неполную, противоречивую и неуказанную информацию. Оценка «правильный диагноз где-то в списке» вознаграждает длинные списки, которые могут побудить к дополнительному тестированию. Распространенное заблуждение состоит в том, что эталонная точность равна точности результатов у постели больного. Это не так. Известные способы отказа включают уверенные, но неправильные рассуждения, вымышленные ссылки или лабораторные пороговые значения, привязку к любому диагнозу, на который намекает пользователь, переоценку обычных презентаций учебников и пропуск критических по времени условий, когда в описании не учитываются жизненно важные признаки. Конфиденциальность — это отдельная тема. Ввод идентифицируемой информации о пациенте в потребительский чат-бот без соглашения о деловом партнерстве может привести к нарушению HIPAA, поэтому врачи должны использовать инструменты, одобренные их организацией.

Стратегическое воздействие

Выбор сборки

Проектирование на уровне приложения определяет, улучшит ли ИИ реальные результаты.

Команда и рабочий процесс

Хорошая интеграция рабочих процессов обеспечивает повышение производительности, которому пользователи могут доверять.

Риски и безопасность

Хорошо продуманные варианты использования снижают усталость от изменений и риск внедрения.

Будущее использования ChatGPT для дифференциальной диагностики

Диагностический ИИ переходит от обычных чат-ботов к инструментам, встроенным в электронные медицинские записи и платформы доказательств, где они могут видеть структурированные данные и цитировать источники. Это может уменьшить количество ошибок, но увеличивает риск того, что врачи будут полагаться на уверенные предположения. Исследование Го указывает на открытый вопрос: как врачи и модели должны работать вместе, а не только насколько точна модель в отдельности. Проспективных исследований с реальными пациентами и реальными результатами по-прежнему мало по сравнению с контрольными показателями. До тех пор, пока не появится больше, оправданной является позиция, согласно которой эти инструменты могут расширить различия и побудить к пересмотру взглядов. Диагноз по-прежнему принадлежит клиницисту.

Реальная реализация

Госпиталист вводит обезличенную информацию о лихорадке, сыпи, эозинофилии и новом противосудорожном препарате в одобренный ее системой здравоохранения инструмент искусственного интеллекта и запрашивает диагнозы, которые нельзя пропустить. В списке появляется DRESS, и она просматривает график приема лекарств.

Житель спрашивает модель, какие данные лучше всего помогут отличить три основных диагноза острой одышки, а затем использует ответ для планирования целевого обследования и анализов, а не для установления диагноза.

Врач первичной медико-санитарной помощи, подозревающий вирусное заболевание, просит модель опровергнуть ее основной диагноз и перечислить то, что она может упустить. Это целенаправленная проверка привязки.

Врач получает два разных ранжированных списка после того, как дважды задает один и тот же вопрос с несколько разной формулировкой, и воспринимает это как знак того, что порядок модели не является оценкой вероятности.

Риски и ограничения

  • Автоматизация сломанного процесса может усугубить существующие проблемы.

  • Команды могут чрезмерно автоматизировать и исключить необходимое человеческое суждение.

  • Качество может ухудшиться, если результаты не будут оцениваться постоянно.

Дорожная карта реализации

  1. Составьте карту текущего рабочего процесса и определите этап, вызывающий наибольшие затруднения.

  2. Определите человеческие контрольно-пропускные пункты перед полной автоматизацией.

  3. Обучайте пользователей подсказкам, путям эскалации и стандартам качества.

  4. Отслеживайте результаты на уровне задач, чтобы подтвердить устойчивую ценность.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Using ChatGPT for Differential Diagnosis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое использование ChatGPT для дифференциальной диагностики?

Большие языковые модели, такие как GPT-4, могут создавать правдоподобные списки дифференциальных диагнозов на основе описания случая, а в опубликованных исследованиях они часто включают правильный диагноз. Они не являются проверенными диагностическими устройствами. Их самое безопасное использование — это структурированный мозговой штурм второго мнения, который врач сверяет с пациентом, а врачи, которые понимают как их сильные стороны, так и их недостатки, получают от них максимальную пользу.

В тесте GPT-4 на клинико-патологических случаях NEJM, проведенном Канджи и его коллегами в 2023 году, насколько часто окончательный диагноз появлялся где-либо в дифференциальной модели?

Окончательный диагноз стоял в дифференциальном диагнозе примерно в 64 процентах случаев и был высшим диагнозом примерно в 39 процентах.

Каков был основной результат исследования Goh et al. 2024 г.? рандомизированное исследование?

Врачи с GPT-4 незначительно превзошли врачей с обычными ресурсами, однако одна только модель набрала более высокие баллы. Это указывает на то, как люди используют этот инструмент.

Почему тестовые тесты могут завышать, насколько хорошо модель будет работать с реальными пациентами?

Предварительно организованные выводы и возможное загрязнение обучающих данных делают виньетки проще, чем беспорядочные реальные встречи.

Врач спрашивает: «Может ли это быть волчанка?» в начале ее подсказки. Какой режим отказа это предполагает?

Модели склонны соглашаться с предложенными им рамками, поэтому намек на диагноз подталкивает к нему дифференциал.

Почему оценка «правильный диагноз в любом месте списка» является ошибочным показателем?

Более длинный список с большей вероятностью будет содержать ответ, но на практике длинные различия могут привести к дополнительным и ненужным исследованиям.