ДалееСледующее руководство
ChatGPT для фармацевтов
Приложения
РУКОВОДСТВО ПО ПРИМЕНЕНИЮ
Большие языковые модели, такие как GPT-4, могут создавать правдоподобные списки дифференциальных диагнозов на основе описания случая, а в опубликованных исследованиях они часто включают правильный диагноз.
Они не являются проверенными диагностическими устройствами. Их самое безопасное использование — это структурированный мозговой штурм второго мнения, который врач сверяет с пациентом, а врачи, которые понимают как их сильные стороны, так и их недостатки, получают от них максимальную пользу.
Большая часть доказательств получена из эпизодов дел. В исследовательском письме JAMA 2023 года Канджи и его коллеги протестировали GPT-4 на 70 сложных случаях на клинико-патологических конференциях New England Journal of Medicine. Окончательный диагноз появлялся в дифференциале модели примерно в 64 процентах случаев и был ее верхним диагнозом примерно в 39 процентах. В рандомизированном исследовании Го и его коллег, опубликованном в журнале JAMA Network Open в 2024 году, 50 врачам были предоставлены либо GPT-4 плюс обычные ресурсы, либо только обычные ресурсы для структурированных диагностических случаев. Доступ к GPT-4 существенно не улучшил показатели диагностического мышления врачей. Однако GPT-4, работавшие в одиночку, набрали значительно больше баллов, чем врачи, которые использовали только обычные ресурсы. Одна из интерпретаций заключается в том, что врачи не знали, как правильно использовать этот инструмент, или не доверяли ему, когда он с ними не соглашался. Исследовательские системы, такие как AMIE Google, также были протестированы на предмет диагностического диалога и дифференциальной генерации, что дало хорошие результаты в контролируемых исследованиях. Эти результаты требуют внимательного прочтения. Опубликованные серии случаев могут находиться в обучающих данных модели. Виньетки поступают уже очищенными, с выбранными и обобщенными соответствующими выводами, тогда как реальные пациенты приносят неполную, противоречивую и неуказанную информацию. Оценка «правильный диагноз где-то в списке» вознаграждает длинные списки, которые могут побудить к дополнительному тестированию. Распространенное заблуждение состоит в том, что эталонная точность равна точности результатов у постели больного. Это не так. Известные способы отказа включают уверенные, но неправильные рассуждения, вымышленные ссылки или лабораторные пороговые значения, привязку к любому диагнозу, на который намекает пользователь, переоценку обычных презентаций учебников и пропуск критических по времени условий, когда в описании не учитываются жизненно важные признаки. Конфиденциальность — это отдельная тема. Ввод идентифицируемой информации о пациенте в потребительский чат-бот без соглашения о деловом партнерстве может привести к нарушению HIPAA, поэтому врачи должны использовать инструменты, одобренные их организацией.
Проектирование на уровне приложения определяет, улучшит ли ИИ реальные результаты.
Хорошая интеграция рабочих процессов обеспечивает повышение производительности, которому пользователи могут доверять.
Хорошо продуманные варианты использования снижают усталость от изменений и риск внедрения.
Диагностический ИИ переходит от обычных чат-ботов к инструментам, встроенным в электронные медицинские записи и платформы доказательств, где они могут видеть структурированные данные и цитировать источники. Это может уменьшить количество ошибок, но увеличивает риск того, что врачи будут полагаться на уверенные предположения. Исследование Го указывает на открытый вопрос: как врачи и модели должны работать вместе, а не только насколько точна модель в отдельности. Проспективных исследований с реальными пациентами и реальными результатами по-прежнему мало по сравнению с контрольными показателями. До тех пор, пока не появится больше, оправданной является позиция, согласно которой эти инструменты могут расширить различия и побудить к пересмотру взглядов. Диагноз по-прежнему принадлежит клиницисту.
Госпиталист вводит обезличенную информацию о лихорадке, сыпи, эозинофилии и новом противосудорожном препарате в одобренный ее системой здравоохранения инструмент искусственного интеллекта и запрашивает диагнозы, которые нельзя пропустить. В списке появляется DRESS, и она просматривает график приема лекарств.
Житель спрашивает модель, какие данные лучше всего помогут отличить три основных диагноза острой одышки, а затем использует ответ для планирования целевого обследования и анализов, а не для установления диагноза.
Врач первичной медико-санитарной помощи, подозревающий вирусное заболевание, просит модель опровергнуть ее основной диагноз и перечислить то, что она может упустить. Это целенаправленная проверка привязки.
Врач получает два разных ранжированных списка после того, как дважды задает один и тот же вопрос с несколько разной формулировкой, и воспринимает это как знак того, что порядок модели не является оценкой вероятности.
Автоматизация сломанного процесса может усугубить существующие проблемы.
Команды могут чрезмерно автоматизировать и исключить необходимое человеческое суждение.
Качество может ухудшиться, если результаты не будут оцениваться постоянно.
Составьте карту текущего рабочего процесса и определите этап, вызывающий наибольшие затруднения.
Определите человеческие контрольно-пропускные пункты перед полной автоматизацией.
Обучайте пользователей подсказкам, путям эскалации и стандартам качества.
Отслеживайте результаты на уровне задач, чтобы подтвердить устойчивую ценность.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Большие языковые модели, такие как GPT-4, могут создавать правдоподобные списки дифференциальных диагнозов на основе описания случая, а в опубликованных исследованиях они часто включают правильный диагноз. Они не являются проверенными диагностическими устройствами. Их самое безопасное использование — это структурированный мозговой штурм второго мнения, который врач сверяет с пациентом, а врачи, которые понимают как их сильные стороны, так и их недостатки, получают от них максимальную пользу.
Окончательный диагноз стоял в дифференциальном диагнозе примерно в 64 процентах случаев и был высшим диагнозом примерно в 39 процентах.
Врачи с GPT-4 незначительно превзошли врачей с обычными ресурсами, однако одна только модель набрала более высокие баллы. Это указывает на то, как люди используют этот инструмент.
Предварительно организованные выводы и возможное загрязнение обучающих данных делают виньетки проще, чем беспорядочные реальные встречи.
Модели склонны соглашаться с предложенными им рамками, поэтому намек на диагноз подталкивает к нему дифференциал.
Более длинный список с большей вероятностью будет содержать ответ, но на практике длинные различия могут привести к дополнительным и ненужным исследованиям.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
ChatGPT для фармацевтов
Приложения