Що сталося
Нове дослідження arXiv оцінює, чи можуть великі мовні моделі надійно ідентифікувати прямі причинно-наслідкові зв’язки та передавати відкалібровану впевненість. На шести еталонних причинно-наслідкових графіках, п’яти стратегіях підказок і чотирьох методах достовірності дослідники виявили, що моделі, як правило, створюють надто щільні графіки з великою кількістю хибнопозитивних країв.
Стаття оцінює 12 налаштованих інструкцій відкритих мовних моделей за парним протоколом лише для мови. Моделі перевіряли на шести еталонних причинно-наслідкових графіках із п’ятьма стратегіями підказок і чотирма джерелами впевненості: впевненість, викладена у відповіді, впевненість, отримана з логічних даних моделі, згода між підказками та згода між моделями. Мета полягала не просто в тому, щоб виміряти, чи визнає модель пов’язаність двох змінних, а й у тому, чи правильно вона оцінила, що одна змінна є прямою причиною іншої, і визначила напрямок цього краю.
Оцінка виявила, що моделі сильно запам’ятовуються. Вони виявили багато взаємозв’язків-кандидатів, але їхні прогнозовані графіки були надто щільними та включали значну кількість хибнопозитивних країв. Зміна підказки головним чином змінила баланс між точністю та відкликанням; це не вирішило ширшої тенденції передбачити причинно-наслідкові зв’язки. Згідно з документом, збільшення масштабу моделі допомогло менше на найбільших графіках і не усунуло неправильне калібрування.
Різниця між спорідненістю та прямим причинно-наслідковим зв’язком була центральною точкою невдачі. Порівняно з опублікованими еталонними графіками, моделі неправильно класифікували 40,0% непрямих зв’язків і 36,0% зворотних неребер як прямі, порівняно з 28,2% інших неребер. Серед цих хибних спрацьовувань 80,8% непрямих випадків і 84,6% зворотних неграничних випадків отримали словесну впевненість принаймні 80%. Автори також повідомляють, що достовірність на основі логітів часто групується біля 1,0 незалежно від того, чи був прогноз правильним. Еталонний аудит знайомства виявив можливе знайомство в п’яти парах модель-набір даних, усі з яких включають набір даних AsiaM.
Чому це важливо
Мовні моделі все частіше використовуються для забезпечення причинно-наслідкових припущень для систем, які виявляють причинні структури. Дослідження припускає, що їхні результати можуть бути корисними як тимчасові гіпотези, перевірені зовні, але їх не слід розглядати як прямі докази причинно-наслідкової структури чи довіряти їм лише тому, що модель звучить впевнено.
Системи причинного виявлення використовують припущення про те, які змінні можуть безпосередньо впливати на інші. Якщо мовна модель забезпечує межу, яка відображає лише широку асоціацію, непрямий шлях або неправильний напрямок, таке припущення може спотворити подальший аналіз. Таким чином, дослідження стосується практичного питання надійності для розробників і дослідників, які хочуть використовувати LLM як джерела попередніх причинно-наслідкових знань.
Отримані дані також показують, чому вільні пояснення чи чисельну впевненість не можна помилково сприймати як надійні причинно-наслідкові міркування. Модель може розпізнати, що дві концепції пов’язані, але не в змозі визначити, чи є зв’язок прямим або яким шляхом протікає причинно-наслідковий зв’язок. Висока вербалізована впевненість у структурно неправильних передбаченнях робить цю відмінність особливо важливою в робочих процесах, де люди можуть використовувати показники довіри, щоб визначити пріоритетність перегляду.
Документ не показує, що LLM марні для причинної роботи. Його висновок є вужчим і дієвішим: моделі можуть бути корисними для генерування м’яких причинно-наслідкових попередніх за умови, що ці попередні перевіряються за зовнішніми доказами. Це обрамлення зберігає роль мовних моделей у висуненні гіпотез, водночас зберігаючи причинну перевірку для методів і даних, призначених для встановлення структури. Це також свідчить про те, що масштаб моделі сам по собі не є достатньою гарантією проти такого класу помилок. Громадсько-практичний вплив переважно методологічний. Дослідники, які розробляють інструменти виявлення причинно-наслідкових зв’язків, системи підтримки прийняття рішень або оцінки, можуть використовувати результати як попередження, щоб відокремити причинно-наслідковий зв’язок від прямої ідентифікації та явно перевірити калібрування. Джерело не встановлює продуктивність у будь-якому конкретному медичному, економічному, політичному чи оперативному розгортанні, тому результати не слід узагальнювати для цих умов без додаткових доказів.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Which component of an AI application is the machine-learning model itself?
Що дивитися далі
У документі вказується на згоду підказок або моделей як на потенційно кращий сигнал впевненості, ніж вербалізована або заснована на логіті впевненість, хоча зареєстровані переваги не були статистично значущими після виправлення. Буде потрібно подальше тестування для більшої кількості наборів даних, моделей і причинно-наслідкових проблем реального світу.
Найбільш багатообіцяючим сигналом, розглянутим у дослідженні, була згода: чи кілька підказок, наданих одній моделі, чи кілька моделей, які отримали порівняльні завдання, дали однакове судження. У документі повідомляється про краще калібрування середнього значення та дискримінацію для перехресної підказки та перехресної моделі, ніж для звичайних оцінок впевненості. Однак ці переваги не були статистично значущими після корекції Холма, тому згоду слід розглядати як напрямок дослідження, а не перевірене рішення.
Майбутні оцінки мають перевірити, чи зберігається шаблон із закритими та відкритими моделями за межами 12 досліджуваних систем, з додатковими графовими структурами та причинно-наслідковими питаннями, заснованими на реальних даних спостережень або експериментів. Поточні результати отримано з шести еталонних причинних графіків і протоколу попарності лише для мови. Джерело не повідомляє, що метод був випробуваний у реальному робочому процесі прийняття рішень.
Ще одна проблема, яку слід контролювати, — знайомство з тестами. Аудит виявив потенційне знайомство в п’яти парах модель-набір даних, усі з яких стосуються AsiaM. Цей результат може вказувати на те, що деяка очевидна продуктивність відображає контакт з еталонним матеріалом, але в статті це представлено як потенційне знайомство, а не доказ того, що моделі запам’ятали відповіді. Оцінювачі повинні будуть вивчити забруднення та знайомство під час порівняння моделей щодо причинно-наслідкових завдань.
Дослідження також залишає значні невідомі. Це не встановлює, чи зовнішній пошук, інструменти, демонстрації або доступ до експертів у галузі суттєво покращать прямоту та орієнтацію. Він не показує, як працюють моделі, якщо їх надати експериментальним доказам, а також не визначає кількісну вартість перевірки людиною, необхідної для виправлення помилкових спрацьовувань. Нарешті, оскільки стаття є нещодавно поданим препринтом, її висновки не були підтверджені експертною оцінкою в наданому джерелі.