Co się stało
W nowym badaniu arXiv ocenia się, czy duże modele językowe mogą wiarygodnie identyfikować bezpośrednie relacje przyczynowe i przekazywać skalibrowaną pewność. W oparciu o sześć wzorcowych wykresów przyczynowych, pięć strategii podpowiedzi i cztery metody pewności badacze odkryli, że modele miały tendencję do tworzenia zbyt gęstych wykresów z wieloma fałszywie dodatnimi krawędziami.
W artykule dokonano oceny 12 modeli języka o otwartej wadze dostosowanych do instrukcji w ramach protokołu parowania obejmującego wyłącznie język. Modele testowano na sześciu wzorcowych wykresach przyczynowych, z pięcioma strategiami podpowiedzi i czterema źródłami pewności: pewność podana w odpowiedzi, pewność wyprowadzona z logitów modelu, zgodność między podpowiedziami i zgodność między modelami. Celem nie było po prostu zmierzenie, czy model rozpoznał powiązanie dwóch zmiennych, ale także to, czy prawidłowo ocenił, że jedna zmienna jest bezpośrednią przyczyną drugiej i określił kierunek tej krawędzi.
Ocena wykazała, że modele w dużym stopniu dominowały w zakresie przypominania. Zidentyfikowali wiele potencjalnych relacji, ale przewidywane przez nich wykresy były zbyt gęste i zawierały znaczną liczbę fałszywie dodatnich krawędzi. Zmiana podpowiedzi głównie przesunęła równowagę między precyzją a przypominaniem; nie rozwiązało to szerszej tendencji do przeceniania związków przyczynowych. Według artykułu zwiększenie skali modelu pomogło w mniejszym stopniu na największych wykresach i nie wyeliminowało błędnej kalibracji.
Głównym punktem niepowodzenia było rozróżnienie między pokrewieństwem a bezpośrednią przyczyną. W porównaniu z opublikowanymi wykresami referencyjnymi modele błędnie sklasyfikowały 40,0% relacji pośrednich i 36,0% odwróconych nie-krawędzi jako krawędzie bezpośrednie w porównaniu z 28,2% innych nie-krawędzi. Spośród tych wyników fałszywie pozytywnych 80,8% przypadków pośrednich i 84,6% przypadków odwróconych, innych niż brzegowe, uzyskało zwerbalizowaną pewność co najmniej 80%. Autorzy podają również, że pewność oparta na logitach często oscylowała wokół 1,0, niezależnie od tego, czy przewidywania były prawidłowe. Audyt znajomości ów wykazał możliwą znajomość pięciu par model-zestaw danych, z których wszystkie dotyczyły zbioru danych AsiaM.
Dlaczego to ma znaczenie
Modele językowe są coraz częściej wykorzystywane do dostarczania założeń przyczynowych dla systemów odkrywających struktury przyczynowe. Badanie sugeruje, że ich wyniki mogą być przydatne jako tymczasowe, sprawdzone zewnętrznie hipotezy, ale nie należy ich traktować jako bezpośredniego dowodu struktury przyczynowej ani ufać wyłącznie dlatego, że model brzmi wiarygodnie.
Systemy odkrywania przyczynowego wykorzystują założenia dotyczące tego, które zmienne mogą bezpośrednio wpływać na inne. Jeśli model językowy zapewnia przewagę odzwierciedlającą jedynie szerokie skojarzenia, pośrednią ścieżkę lub zły kierunek, założenie to może zniekształcić późniejszą analizę. Badanie dotyczy zatem praktycznej kwestii niezawodności dla programistów i badaczy, którzy chcą wykorzystać LLM jako źródła wcześniejszej wiedzy przyczynowej.
Wyniki pokazują również, dlaczego płynnych wyjaśnień lub pewności liczbowej nie należy mylić z wiarygodnym rozumowaniem przyczynowym. Model może rozpoznać, że dwie koncepcje są ze sobą powiązane, nie określając, czy połączenie jest bezpośrednie ani w jaki sposób przebiega związek przyczynowy. Wysokie zwerbalizowane zaufanie do strukturalnie niepoprawnych przewidywań sprawia, że to rozróżnienie jest szczególnie ważne w przepływach pracy, w których ludzie mogą wykorzystywać wyniki zaufania do ustalania priorytetów przeglądu.
W artykule nie wykazano, że LLM są bezużyteczne w pracy przyczynowej. Jego wniosek jest węższy i bardziej praktyczny: modele mogą być przydatne do generowania miękkich priorytetów przyczynowych, pod warunkiem, że te priorytety zostaną sprawdzone z dowodami zewnętrznymi. Takie sformułowanie zachowuje rolę modeli językowych w proponowaniu hipotez, zastrzegając jednocześnie walidację przyczynową dla metod i danych zaprojektowanych w celu ustalenia struktury. It also suggests that a model’s scale alone is not a sufficient safeguard against this class of error. Wpływ publiczny i praktyczny ma głównie charakter metodologiczny. Badacze tworzący narzędzia do wykrywania przyczyn, systemy wspomagania decyzji lub ewaluacje mogą wykorzystać wyniki jako ostrzeżenie, aby oddzielić powiązania przyczynowe od identyfikacji bezpośredniej i wyraźnie przetestować kalibrację. Źródło nie określa wyników w żadnym konkretnym zastosowaniu medycznym, ekonomicznym, politycznym lub operacyjnym, dlatego też ustaleń nie należy uogólniać na te warunki bez dodatkowych dowodów.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
Which component of an AI application is the machine-learning model itself?
Co obejrzeć dalej
Artykuł wskazuje na zgodność między podpowiedziami lub modelami jako potencjalnie lepszy sygnał pewności niż pewność zwerbalizowana lub oparta na logitach, chociaż zgłoszone korzyści nie były statystycznie istotne po korekcie. Konieczne będą dalsze testy obejmujące większą liczbę zbiorów danych, modeli i rzeczywistych problemów przyczynowych.
Najbardziej obiecującym sygnałem zbadanym w badaniu była zgodność: czy kilka podpowiedzi dotyczących tego samego modelu lub kilka modeli, którym podano porównywalne zadania, dało tę samą ocenę. W artykule podano lepszą kalibrację średnich i dyskryminację w przypadku zgodności między pytaniami i modelami niż w przypadku konwencjonalnych szacunków ufności. Jednak po korekcie Holma korzyści te nie były istotne statystycznie, dlatego zgodność należy traktować raczej jako kierunek badań niż sprawdzone rozwiązanie.
Przyszłe oceny powinny sprawdzić, czy wzór utrzymuje się w przypadku zamkniętych i otwartych modeli wykraczających poza 12 badanych systemów, z dodatkowymi strukturami wykresów i pytaniami przyczynowymi opartymi na rzeczywistych danych obserwacyjnych lub eksperymentalnych. Obecne wyniki pochodzą z sześciu wzorcowych wykresów przyczynowych i protokołu parowania obejmującego wyłącznie język. Źródło nie podaje, że metoda została przetestowana w procesie podejmowania decyzji na żywo.
Znajomość ów to kolejna kwestia, którą należy monitorować. Kontrola wykazała potencjalną znajomość pięciu par model-zestaw danych, z których wszystkie dotyczyły AsiaM. Wynik ten może wskazywać, że pewne pozorne wyniki odzwierciedlają kontakt z materiałem wzorcowym, ale w artykule przedstawiono to jako potencjalną znajomość, a nie dowód, że modele zapamiętały odpowiedzi. Oceniający będą musieli sprawdzić zanieczyszczenie i znajomość podczas porównywania modeli zadań przyczynowych.
Badanie pozostawia również istotne niewiadome. Nie ustala, czy zewnętrzne wyszukiwanie, narzędzia, demonstracje lub dostęp do ekspertów dziedzinowych znacząco poprawiłyby ocenę bezpośredniości i orientacji. Nie pokazuje, jak modele radzą sobie z dowodami eksperymentalnymi, ani nie określa ilościowo kosztów przeglądu ręcznego potrzebnego do skorygowania wyników fałszywie dodatnich. Wreszcie, ponieważ artykuł jest nowo złożonym przeddrukiem, jego ustalenia nie zostały potwierdzone w drodze wzajemnej recenzji w podanym źródle.