PRZEWODNIK Językowy AI

Klątwa odwrócenia w LLM

Klątwa odwrócenia to zaskakujący tryb niepowodzenia, w którym model językowy, który uczy się, że „A to B”, nie może wiarygodnie odpowiedzieć „B to A”. Pokazuje, że LLM przechowują fakty jako jednokierunkowe skojarzenia, a nie wiedzę symetryczną.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

Udokumentowana w artykule Berglunda i współpracowników z 2023 r. klątwa odwrócenia pokazuje, że jeśli model jest szkolony na temat „matką Toma Cruise'a jest Mary Lee Pfeiffer”, często zawodzi, gdy zostaje zapytany „Kim jest syn Mary Lee Pfeiffer?”. mimo że odpowiedź jest logicznie identyczna. Efekt utrzymuje się niezależnie od wielkości modelu, a nawet po dostrojeniu setek takich faktów. Nie jest to luka w pamięci: model widział informacje, ale tylko w jednej kolejności. Ponieważ szkolenie optymalizuje przewidywanie następnego tokenu na podstawie dokładnej kolejności słów w danych, powiązanie statystyczne od A do B nie tworzy automatycznie połączenia od B z powrotem do A. Odkrycie to podważyło założenia, że ​​sama skala pozwala na elastyczne, ludzkie rozumowanie na temat faktów.

Wgląd techniczny

Transformatory uczą się, przewidując następny token, biorąc pod uwagę wcześniejszy kontekst, więc aktualizacje gradientu wzmacniają mapowanie kierunkowe „A, potem B”, ale pozostawiają „B, potem A” nietknięte, chyba że ta kolejność pojawi się również podczas szkolenia. Obydwa kierunki żyją na oddzielnych ścieżkach wagi. Naukowcy potwierdzili to, mierząc logarytmiczne prawdopodobieństwa: po poznaniu faktu, że prawdopodobieństwo odwrotnego stwierdzenia pozostawało bliskie wartości wyjściowej, nie wykazując, że podczas szkolenia wystąpiła żadna ukryta inwersja logiczna.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość klątwy odwracającej w LLM

Badane rozwiązania łagodzące obejmują dwukierunkowe powiększanie danych (dodawanie odwróconych fraz), cele szkoleniowe, które przewidują tokeny w obu kierunkach, oraz systemy wyszukiwania, które wyszukują fakty symetrycznie, a nie polegają na zapamiętanych wagach. Niektóre nowsze architektury i eksperymenty z odwrotnym uczeniem wstępnym zmniejszają tę lukę. Spodziewaj się, że klątwa skurczy się, ale nie zniknie, ponieważ obnaża głęboką rozbieżność między uczeniem się na podstawie następnego tokenu a symetryczną strukturą relacji w świecie rzeczywistym.

Implementacja w świecie rzeczywistym

Chatbot poprawnie podaje rodzica celebryty, ale nie udaje mu się to, gdy zostaje poproszony o podanie imienia słynnego dziecka tego rodzica.

Modelka recytuje „dziewiątym prezydentem był William Henry Harrison”, ale natrafia na „którym prezydentem był William Henry Harrison”.

Asystent kodowania, który nauczył się mapowania funkcji na opis, nie może odzyskać nazwy funkcji na podstawie samego opisu.

Medyczny system kontroli jakości przeszkolony w zakresie „Lek X leczy stan Y” nie wymienia leku X na pytanie, co leczy stan Y.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Reversal Curse in LLMs?

Klątwa odwrócenia to zaskakujący tryb niepowodzenia, w którym model językowy, który uczy się, że „A to B”, nie może wiarygodnie odpowiedzieć „B to A”. Pokazuje, że LLM przechowują fakty jako jednokierunkowe skojarzenia, a nie wiedzę symetryczną.

Co opisuje klątwa odwrócenia?

Klątwą odwrotną jest niemożność wywnioskowania, że ​​„B to A” na podstawie treningu opartego na „A to B”, mimo że oba są logicznie równoważne.

Dlaczego klątwa odwrócenia pojawia się mechanicznie?

Ponieważ szkolenie optymalizuje przewidywanie następnego tokenu w dokładnie obserwowanej kolejności, odwrotne mapowanie nigdy nie jest wzmacniane, chyba że pojawi się również podczas szkolenia.

Czy zwiększenie rozmiaru modelu skutecznie usuwa klątwę odwrócenia?

Oryginalne badanie wykazało, że klątwa ciąży na modelach o różnych rozmiarach, co wskazuje, że sama skala jej nie rozwiąże.

Które łagodzenie jest bezpośrednio ukierunkowane na klątwę odwrócenia?

Dwukierunkowe powiększanie danych eksponuje model zarówno na „A to B”, jak i „B to A”, tworząc brakujące odwrotne skojarzenie.

W jaki sposób badacze potwierdzili, że model nie nauczył się w sposób dorozumiany odwrotnego faktu?

Prawdopodobieństwo odwróconego stwierdzenia pozostało w pobliżu wartości wyjściowej po treningu do przodu, co wskazuje, że nie miała miejsca żadna logiczna inwersja.