Powrót do Wiadomości
InnowacjaAI Understanding odprawa

Badanie wykazało, że osoby z wykształceniem wyższym często wykazują zbytnią pewność siebie przy identyfikowaniu bezpośrednich powiązań przyczynowych

Ocena 12 modeli języka o wadze otwartej wykazała, że często mylą one relacje pośrednie lub odwrotne z bezpośrednimi związkami przyczynowymi, jednocześnie wyrażając dużą pewność co do wielu błędnych ocen.

5 min readRead the primary source
Primary-source image accompanying Study finds LLMs often overconfident when identifying direct causal links
Dokument źródłowyŹródło zapisane
Wydawca
arxiv.org
Link źródłowy
arxiv.orghttps://arxiv.org/abs/2608.23660
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Kalibracja
Jak dobrze wyniki pewności modelu odpowiadają rzeczywistym prawdopodobieństwom poprawności.
Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Precyzja
Odsetek przewidywanych pozytywów, które są faktycznie prawidłowe.
Sprawdź sięQuiz objaśniający modele AI

Co się stało

W nowym badaniu arXiv ocenia się, czy duże modele językowe mogą wiarygodnie identyfikować bezpośrednie relacje przyczynowe i przekazywać skalibrowaną pewność. W oparciu o sześć wzorcowych wykresów przyczynowych, pięć strategii podpowiedzi i cztery metody pewności badacze odkryli, że modele miały tendencję do tworzenia zbyt gęstych wykresów z wieloma fałszywie dodatnimi krawędziami.

W artykule dokonano oceny 12 modeli języka o otwartej wadze dostosowanych do instrukcji w ramach protokołu parowania obejmującego wyłącznie język. Modele testowano na sześciu wzorcowych wykresach przyczynowych, z pięcioma strategiami podpowiedzi i czterema źródłami pewności: pewność podana w odpowiedzi, pewność wyprowadzona z logitów modelu, zgodność między podpowiedziami i zgodność między modelami. Celem nie było po prostu zmierzenie, czy model rozpoznał powiązanie dwóch zmiennych, ale także to, czy prawidłowo ocenił, że jedna zmienna jest bezpośrednią przyczyną drugiej i określił kierunek tej krawędzi.

Ocena wykazała, że ​​modele w dużym stopniu dominowały w zakresie przypominania. Zidentyfikowali wiele potencjalnych relacji, ale przewidywane przez nich wykresy były zbyt gęste i zawierały znaczną liczbę fałszywie dodatnich krawędzi. Zmiana podpowiedzi głównie przesunęła równowagę między precyzją a przypominaniem; nie rozwiązało to szerszej tendencji do przeceniania związków przyczynowych. Według artykułu zwiększenie skali modelu pomogło w mniejszym stopniu na największych wykresach i nie wyeliminowało błędnej kalibracji.

Głównym punktem niepowodzenia było rozróżnienie między pokrewieństwem a bezpośrednią przyczyną. W porównaniu z opublikowanymi wykresami referencyjnymi modele błędnie sklasyfikowały 40,0% relacji pośrednich i 36,0% odwróconych nie-krawędzi jako krawędzie bezpośrednie w porównaniu z 28,2% innych nie-krawędzi. Spośród tych wyników fałszywie pozytywnych 80,8% przypadków pośrednich i 84,6% przypadków odwróconych, innych niż brzegowe, uzyskało zwerbalizowaną pewność co najmniej 80%. Autorzy podają również, że pewność oparta na logitach często oscylowała wokół 1,0, niezależnie od tego, czy przewidywania były prawidłowe. Audyt znajomości ów wykazał możliwą znajomość pięciu par model-zestaw danych, z których wszystkie dotyczyły zbioru danych AsiaM.

Szczegóły źródła: arxiv.org ↗

Dlaczego to ma znaczenie

Modele językowe są coraz częściej wykorzystywane do dostarczania założeń przyczynowych dla systemów odkrywających struktury przyczynowe. Badanie sugeruje, że ich wyniki mogą być przydatne jako tymczasowe, sprawdzone zewnętrznie hipotezy, ale nie należy ich traktować jako bezpośredniego dowodu struktury przyczynowej ani ufać wyłącznie dlatego, że model brzmi wiarygodnie.

Systemy odkrywania przyczynowego wykorzystują założenia dotyczące tego, które zmienne mogą bezpośrednio wpływać na inne. Jeśli model językowy zapewnia przewagę odzwierciedlającą jedynie szerokie skojarzenia, pośrednią ścieżkę lub zły kierunek, założenie to może zniekształcić późniejszą analizę. Badanie dotyczy zatem praktycznej kwestii niezawodności dla programistów i badaczy, którzy chcą wykorzystać LLM jako źródła wcześniejszej wiedzy przyczynowej.

Wyniki pokazują również, dlaczego płynnych wyjaśnień lub pewności liczbowej nie należy mylić z wiarygodnym rozumowaniem przyczynowym. Model może rozpoznać, że dwie koncepcje są ze sobą powiązane, nie określając, czy połączenie jest bezpośrednie ani w jaki sposób przebiega związek przyczynowy. Wysokie zwerbalizowane zaufanie do strukturalnie niepoprawnych przewidywań sprawia, że ​​to rozróżnienie jest szczególnie ważne w przepływach pracy, w których ludzie mogą wykorzystywać wyniki zaufania do ustalania priorytetów przeglądu.

W artykule nie wykazano, że LLM są bezużyteczne w pracy przyczynowej. Jego wniosek jest węższy i bardziej praktyczny: modele mogą być przydatne do generowania miękkich priorytetów przyczynowych, pod warunkiem, że te priorytety zostaną sprawdzone z dowodami zewnętrznymi. Takie sformułowanie zachowuje rolę modeli językowych w proponowaniu hipotez, zastrzegając jednocześnie walidację przyczynową dla metod i danych zaprojektowanych w celu ustalenia struktury. It also suggests that a model’s scale alone is not a sufficient safeguard against this class of error. Wpływ publiczny i praktyczny ma głównie charakter metodologiczny. Badacze tworzący narzędzia do wykrywania przyczyn, systemy wspomagania decyzji lub ewaluacje mogą wykorzystać wyniki jako ostrzeżenie, aby oddzielić powiązania przyczynowe od identyfikacji bezpośredniej i wyraźnie przetestować kalibrację. Źródło nie określa wyników w żadnym konkretnym zastosowaniu medycznym, ekonomicznym, politycznym lub operacyjnym, dlatego też ustaleń nie należy uogólniać na te warunki bez dodatkowych dowodów.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktywna kontrola koncepcji+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Co obejrzeć dalej

Artykuł wskazuje na zgodność między podpowiedziami lub modelami jako potencjalnie lepszy sygnał pewności niż pewność zwerbalizowana lub oparta na logitach, chociaż zgłoszone korzyści nie były statystycznie istotne po korekcie. Konieczne będą dalsze testy obejmujące większą liczbę zbiorów danych, modeli i rzeczywistych problemów przyczynowych.

Najbardziej obiecującym sygnałem zbadanym w badaniu była zgodność: czy kilka podpowiedzi dotyczących tego samego modelu lub kilka modeli, którym podano porównywalne zadania, dało tę samą ocenę. W artykule podano lepszą kalibrację średnich i dyskryminację w przypadku zgodności między pytaniami i modelami niż w przypadku konwencjonalnych szacunków ufności. Jednak po korekcie Holma korzyści te nie były istotne statystycznie, dlatego zgodność należy traktować raczej jako kierunek badań niż sprawdzone rozwiązanie.

Przyszłe oceny powinny sprawdzić, czy wzór utrzymuje się w przypadku zamkniętych i otwartych modeli wykraczających poza 12 badanych systemów, z dodatkowymi strukturami wykresów i pytaniami przyczynowymi opartymi na rzeczywistych danych obserwacyjnych lub eksperymentalnych. Obecne wyniki pochodzą z sześciu wzorcowych wykresów przyczynowych i protokołu parowania obejmującego wyłącznie język. Źródło nie podaje, że metoda została przetestowana w procesie podejmowania decyzji na żywo.

Znajomość ów to kolejna kwestia, którą należy monitorować. Kontrola wykazała potencjalną znajomość pięciu par model-zestaw danych, z których wszystkie dotyczyły AsiaM. Wynik ten może wskazywać, że pewne pozorne wyniki odzwierciedlają kontakt z materiałem wzorcowym, ale w artykule przedstawiono to jako potencjalną znajomość, a nie dowód, że modele zapamiętały odpowiedzi. Oceniający będą musieli sprawdzić zanieczyszczenie i znajomość podczas porównywania modeli zadań przyczynowych.

Badanie pozostawia również istotne niewiadome. Nie ustala, czy zewnętrzne wyszukiwanie, narzędzia, demonstracje lub dostęp do ekspertów dziedzinowych znacząco poprawiłyby ocenę bezpośredniości i orientacji. Nie pokazuje, jak modele radzą sobie z dowodami eksperymentalnymi, ani nie określa ilościowo kosztów przeglądu ręcznego potrzebnego do skorygowania wyników fałszywie dodatnich. Wreszcie, ponieważ artykuł jest nowo złożonym przeddrukiem, jego ustalenia nie zostały potwierdzone w drodze wzajemnej recenzji w podanym źródle.

Powiązane przewodniki i quizy

Wyjaśnienie modeli AISzkolenie AIEtyka AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?