Назад до новин
ІнноваціяAI Understanding брифінг

Дослідження виявило, що магістратури часто надто самовпевнені, коли визначають прямі причинно-наслідкові зв’язки

Оцінка 12 відкритих мовних моделей виявила, що вони часто помилково приймають непрямі чи зворотні зв’язки за прямі причинно-наслідкові зв’язки, водночас висловлюючи високу впевненість у багатьох неправильних судженнях.

5 min readRead the primary source
Primary-source image accompanying Study finds LLMs often overconfident when identifying direct causal links
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.23660
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Калібрування
Наскільки показники надійності моделі відповідають фактичним імовірностям правильності.
Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Точність
Частка прогнозованих позитивних результатів, які насправді є правильними.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Нове дослідження arXiv оцінює, чи можуть великі мовні моделі надійно ідентифікувати прямі причинно-наслідкові зв’язки та передавати відкалібровану впевненість. На шести еталонних причинно-наслідкових графіках, п’яти стратегіях підказок і чотирьох методах достовірності дослідники виявили, що моделі, як правило, створюють надто щільні графіки з великою кількістю хибнопозитивних країв.

Стаття оцінює 12 налаштованих інструкцій відкритих мовних моделей за парним протоколом лише для мови. Моделі перевіряли на шести еталонних причинно-наслідкових графіках із п’ятьма стратегіями підказок і чотирма джерелами впевненості: впевненість, викладена у відповіді, впевненість, отримана з логічних даних моделі, згода між підказками та згода між моделями. Мета полягала не просто в тому, щоб виміряти, чи визнає модель пов’язаність двох змінних, а й у тому, чи правильно вона оцінила, що одна змінна є прямою причиною іншої, і визначила напрямок цього краю.

Оцінка виявила, що моделі сильно запам’ятовуються. Вони виявили багато взаємозв’язків-кандидатів, але їхні прогнозовані графіки були надто щільними та включали значну кількість хибнопозитивних країв. Зміна підказки головним чином змінила баланс між точністю та відкликанням; це не вирішило ширшої тенденції передбачити причинно-наслідкові зв’язки. Згідно з документом, збільшення масштабу моделі допомогло менше на найбільших графіках і не усунуло неправильне калібрування.

Різниця між спорідненістю та прямим причинно-наслідковим зв’язком була центральною точкою невдачі. Порівняно з опублікованими еталонними графіками, моделі неправильно класифікували 40,0% непрямих зв’язків і 36,0% зворотних неребер як прямі, порівняно з 28,2% інших неребер. Серед цих хибних спрацьовувань 80,8% непрямих випадків і 84,6% зворотних неграничних випадків отримали словесну впевненість принаймні 80%. Автори також повідомляють, що достовірність на основі логітів часто групується біля 1,0 незалежно від того, чи був прогноз правильним. Еталонний аудит знайомства виявив можливе знайомство в п’яти парах модель-набір даних, усі з яких включають набір даних AsiaM.

Деталі джерела: arxiv.org ↗

Чому це важливо

Мовні моделі все частіше використовуються для забезпечення причинно-наслідкових припущень для систем, які виявляють причинні структури. Дослідження припускає, що їхні результати можуть бути корисними як тимчасові гіпотези, перевірені зовні, але їх не слід розглядати як прямі докази причинно-наслідкової структури чи довіряти їм лише тому, що модель звучить впевнено.

Системи причинного виявлення використовують припущення про те, які змінні можуть безпосередньо впливати на інші. Якщо мовна модель забезпечує межу, яка відображає лише широку асоціацію, непрямий шлях або неправильний напрямок, таке припущення може спотворити подальший аналіз. Таким чином, дослідження стосується практичного питання надійності для розробників і дослідників, які хочуть використовувати LLM як джерела попередніх причинно-наслідкових знань.

Отримані дані також показують, чому вільні пояснення чи чисельну впевненість не можна помилково сприймати як надійні причинно-наслідкові міркування. Модель може розпізнати, що дві концепції пов’язані, але не в змозі визначити, чи є зв’язок прямим або яким шляхом протікає причинно-наслідковий зв’язок. Висока вербалізована впевненість у структурно неправильних передбаченнях робить цю відмінність особливо важливою в робочих процесах, де люди можуть використовувати показники довіри, щоб визначити пріоритетність перегляду.

Документ не показує, що LLM марні для причинної роботи. Його висновок є вужчим і дієвішим: моделі можуть бути корисними для генерування м’яких причинно-наслідкових попередніх за умови, що ці попередні перевіряються за зовнішніми доказами. Це обрамлення зберігає роль мовних моделей у висуненні гіпотез, водночас зберігаючи причинну перевірку для методів і даних, призначених для встановлення структури. Це також свідчить про те, що масштаб моделі сам по собі не є достатньою гарантією проти такого класу помилок. Громадсько-практичний вплив переважно методологічний. Дослідники, які розробляють інструменти виявлення причинно-наслідкових зв’язків, системи підтримки прийняття рішень або оцінки, можуть використовувати результати як попередження, щоб відокремити причинно-наслідковий зв’язок від прямої ідентифікації та явно перевірити калібрування. Джерело не встановлює продуктивність у будь-якому конкретному медичному, економічному, політичному чи оперативному розгортанні, тому результати не слід узагальнювати для цих умов без додаткових доказів.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Що дивитися далі

У документі вказується на згоду підказок або моделей як на потенційно кращий сигнал впевненості, ніж вербалізована або заснована на логіті впевненість, хоча зареєстровані переваги не були статистично значущими після виправлення. Буде потрібно подальше тестування для більшої кількості наборів даних, моделей і причинно-наслідкових проблем реального світу.

Найбільш багатообіцяючим сигналом, розглянутим у дослідженні, була згода: чи кілька підказок, наданих одній моделі, чи кілька моделей, які отримали порівняльні завдання, дали однакове судження. У документі повідомляється про краще калібрування середнього значення та дискримінацію для перехресної підказки та перехресної моделі, ніж для звичайних оцінок впевненості. Однак ці переваги не були статистично значущими після корекції Холма, тому згоду слід розглядати як напрямок дослідження, а не перевірене рішення.

Майбутні оцінки мають перевірити, чи зберігається шаблон із закритими та відкритими моделями за межами 12 досліджуваних систем, з додатковими графовими структурами та причинно-наслідковими питаннями, заснованими на реальних даних спостережень або експериментів. Поточні результати отримано з шести еталонних причинних графіків і протоколу попарності лише для мови. Джерело не повідомляє, що метод був випробуваний у реальному робочому процесі прийняття рішень.

Ще одна проблема, яку слід контролювати, — знайомство з тестами. Аудит виявив потенційне знайомство в п’яти парах модель-набір даних, усі з яких стосуються AsiaM. Цей результат може вказувати на те, що деяка очевидна продуктивність відображає контакт з еталонним матеріалом, але в статті це представлено як потенційне знайомство, а не доказ того, що моделі запам’ятали відповіді. Оцінювачі повинні будуть вивчити забруднення та знайомство під час порівняння моделей щодо причинно-наслідкових завдань.

Дослідження також залишає значні невідомі. Це не встановлює, чи зовнішній пошук, інструменти, демонстрації або доступ до експертів у галузі суттєво покращать прямоту та орієнтацію. Він не показує, як працюють моделі, якщо їх надати експериментальним доказам, а також не визначає кількісну вартість перевірки людиною, необхідної для виправлення помилкових спрацьовувань. Нарешті, оскільки стаття є нещодавно поданим препринтом, її висновки не були підтверджені експертною оцінкою в наданому джерелі.

Пов’язані посібники та вікторини

Пояснення моделей AIНавчання ШІЕтика ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?