ДаліНаступний посібник
ChatGPT для фармацевтів
Додатки
ПОСІБНИК із застосування
Великі мовні моделі, такі як GPT-4, можуть створити вірогідні списки диференціальної діагностики з опису випадку, і в опублікованих дослідженнях вони часто включають правильний діагноз.
Вони не є перевіреними діагностичними пристроями. Найбезпечніше їх використання – це структурований мозковий штурм, який клініцист перевіряє на пацієнта, і лікарі, які розуміють як їхні сильні сторони, так і їхні невдачі, отримують від них максимальну користь.
Значна частина доказів походить із віньєток справ. У дослідницькому листі JAMA за 2023 рік Канджі та його колеги перевірили GPT-4 на 70 складних випадках з клініко-патологічних конференцій журналу New England Journal of Medicine. Остаточний діагноз з’являвся в диференціалі моделі приблизно в 64 відсотках випадків і був основним діагнозом приблизно в 39 відсотках. Рандомізоване дослідження Го та його колег, опубліковане в JAMA Network Open у 2024 році, дало 50 лікарям або GPT-4 плюс звичайні ресурси, або лише звичайні ресурси для структурованих діагностичних випадків. Доступ до GPT-4 суттєво не покращив результати діагностичних міркувань лікарів. Однак GPT-4, який працював сам, отримав значно вищі бали, ніж лікарі, які використовували лише звичайні ресурси. Одне з тлумачень полягає в тому, що лікарі не знали, як добре використовувати інструмент, або не довіряли йому, коли він їм не підходив. Дослідницькі системи, такі як AMIE Google, також були протестовані на діагностичний діалог і диференціальну генерацію, з значними результатами в контрольованих дослідженнях. Ці результати потребують уважного читання. Опубліковані серії випадків можуть бути в навчальних даних моделі. Віньєтки надходять уже очищеними, з вибраними та узагальненими відповідними висновками, тоді як реальні пацієнти приносять неповну, суперечливу та невикладену інформацію. Оцінка «правильний діагноз десь у списку» винагороджує довгі списки, що може спонукати до додаткового тестування. Поширена помилкова думка полягає в тому, що точність еталонного тесту дорівнює точності біля ліжка. Це не так. Відомі режими помилок включають впевнене, але неправильне міркування, вигадані посилання або лабораторні пороги, прив’язку до будь-якого діагнозу, на який натякає користувач, надмірне зважування звичайних презентацій підручників і відсутність критичних умов, коли опис не містить життєво важливих ознак. Конфіденційність – окрема тема. Введення ідентифікаційної інформації пацієнта в споживчий чат-бот без угоди про ділове партнерство може порушити HIPAA, тому лікарі повинні використовувати інструменти, схвалені їх організацією.
Розробка на рівні програми визначає, чи покращує ШІ реальні результати.
Хороша інтеграція робочого процесу підвищує продуктивність, якій користувачі довіряють.
Добре розроблені варіанти використання зменшують втому від змін і ризик впровадження.
Діагностичний штучний інтелект переходить від звичайних чат-ботів до інструментів, вбудованих у EHR та платформ доказів, де вони можуть переглядати структуровані дані та посилатися на джерела. Це може зменшити кількість помилок, але додає ризик того, що клініцисти відмовляться від впевненої пропозиції. Дослідження Гоха вказує на відкрите питання: як клініцисти та моделі повинні працювати разом, а не лише те, наскільки точна модель сама по собі. Проспективних досліджень із реальними пацієнтами та реальними результатами все ще мало порівняно з контрольними показниками. Поки не існує більше, обґрунтована позиція полягає в тому, що ці інструменти можуть розширити диференціал і спонукати до перегляду. Клініцист все ще володіє діагнозом.
Лікар вводить деідентифіковане резюме про лихоманку, висип, еозинофілію та новий протисудомний препарат у затверджений системою охорони здоров’я інструмент ШІ та запитує діагнози, які неможливо пропустити. DRESS з’являється в списку, і вона переглядає графік прийому ліків.
Мешканець запитує модель, які знахідки найкраще розрізняють його три найпопулярніші діагнози гострої задишки, а потім використовує відповідь, щоб спланувати цілеспрямований огляд і тести, а не зупинятися на діагнозі.
Лікар первинної медичної допомоги, який підозрює вірусне захворювання, просить модель заперечити свій головний діагноз і перерахувати, чого вона може пропустити. Це навмисна перевірка кріплення.
Клініцист отримує два різні ранжовані списки після того, як двічі задає те саме запитання з дещо різними формулюваннями, і сприймає це як ознаку того, що порядок моделі не є оцінкою ймовірності.
Автоматизація несправного процесу може посилити існуючі проблеми.
Команди можуть надмірно автоматизувати роботу й усунути необхідне людське судження.
Якість може погіршуватися, якщо результати не оцінюються постійно.
Намалюйте поточний робочий процес і визначте крок із найбільшим тертям.
Визначте контрольні точки людини перед повною автоматизацією.
Навчіть користувачів підказкам, шляхам ескалації та стандартам якості.
Відстежуйте результати на рівні завдання, щоб підтвердити постійну цінність.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Великі мовні моделі, такі як GPT-4, можуть створити вірогідні списки диференціальної діагностики з опису випадку, і в опублікованих дослідженнях вони часто включають правильний діагноз. Вони не є перевіреними діагностичними пристроями. Найбезпечніше їх використання – це структурований мозковий штурм, який клініцист перевіряє на пацієнта, і лікарі, які розуміють як їхні сильні сторони, так і їхні невдачі, отримують від них максимальну користь.
Остаточний діагноз був у диференціалі приблизно в 64 відсотках випадків і був головним діагнозом приблизно в 39 відсотках.
Лікарі з GPT-4 суттєво не перевершили лікарів зі звичайними ресурсами, але сама модель отримала вищі бали. Це вказує на те, як люди використовують інструмент.
Попередньо організовані висновки та можливе забруднення даних навчання роблять віньєтки легшими, ніж безладні реальні зіткнення.
Моделі, як правило, погоджуються з наданим їм обрамленням, тому натяк на діагноз тягне диференціал до нього.
Довший список, швидше за все, міститиме відповідь, але довгі відмінності на практиці можуть призвести до додаткових і непотрібних обробок.
Продовжуйте вчитися
Інші посібники, вибрані для цієї теми
ДаліНаступний посібник
ChatGPT для фармацевтів
Додатки