PRZEWODNIK Językowy AI

Modelowanie permutacji XLNet

XLNet łączy dwukierunkowy kontekst BERT z autoregresyjną predykcją GPT poprzez uczenie losowej kolejności słów.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

This permutation trick lets it learn from all positions without ever masking tokens.

Głębokie nurkowanie

XLNet, wprowadzony w 2019 roku przez Carnegie Mellon i Google Brain, został zaprojektowany, aby naprawić błąd w treningu wstępnym w stylu BERT. BERT maskuje tokeny i przewiduje je, ale sztuczny symbol [MASK] nigdy nie pojawia się w momencie dostrajania, powodując niedopasowanie pociągu/testu, a BERT zakłada, że ​​zamaskowane tokeny są niezależne. Zamiast tego XLNet wykorzystuje „modelowanie języka permutacyjnego”: maksymalizuje oczekiwaną logarytm wiarygodności we wszystkich możliwych kolejnościach słów w sekwencji. Przewidując każdy token biorąc pod uwagę losowy podzbiór pozostałych, model skutecznie widzi kontekst dwukierunkowy, pozostając jednocześnie właściwym modelem autoregresyjnym bez maskowania. Zbudowany na szkielecie Transformer-XL dla pamięci dalekiego zasięgu, XLNet osiągnął lepsze wyniki niż BERT w około 20 zadaniach, w tym w odpowiadaniu na pytania, analizie nastrojów i rankingu dokumentów.

Wgląd techniczny

XLNet nie tasuje fizycznie słów; permutuje kolejność faktoryzacji za pomocą masek uwagi, dzięki czemu informacje o pozycji zostają zachowane. Aby to zadziałało, wykorzystuje „dwustrumieniową samouważność”: strumień treści, który koduje zarówno token, jak i jego kontekst, oraz strumień zapytań, który zna pozycję celu, ale nie zna jego zawartości, umożliwiając przewidywanie bez wyciekania odpowiedzi. Kodowanie rekurencyjne i względne kodowanie pozycyjne Transformer-XL zapewnia pamięć w długich segmentach, usprawniając obsługę długich dokumentów.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość modelowania permutacji XLNet

XLNet był wpływowym dowodem na to, że cele autoregresyjne mogą uchwycić kontekst dwukierunkowy, zacierając podział BERT i GPT. Chociaż dziedzina ta w dużej mierze skonsolidowała się wokół koderów maskowanych lub dużych dekoderów autoregresyjnych, pomysł permutacji XLNet i powtarzalność Transformera-XL wpłynęły na późniejsze prace nad modelowaniem długokontekstowym i ujednoliconymi celami szkolenia wstępnego. Jego spostrzeżenia pozostają istotne, ponieważ badacze poszukują architektur łączących silne modelowanie kontekstowe z wydajnym generowaniem bez masek.

Implementacja w świecie rzeczywistym

Osiąganie najlepszych wyników w testach opartych na odpowiedziach na pytania, takich jak SQuAD

Obsługa zadań obejmujących długie dokumenty, takich jak test czytania ze zrozumieniem RACE, za pośrednictwem pamięci Transformer-XL

Zasilanie systemów rankingu dokumentów i wyszukiwania informacji

Ulepszenie klasyfikacji nastrojów i kategoryzacji tekstu w porównaniu z wartościami bazowymi BERT

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the XLNet Permutation Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Modelowanie tematyczne

Często zadawane pytania

What is XLNet Permutation Modeling?

XLNet łączy dwukierunkowy kontekst BERT z autoregresyjną predykcją GPT poprzez uczenie losowej kolejności słów. Ta sztuczka z permutacją pozwala mu uczyć się ze wszystkich pozycji bez maskowania żetonów.

Jaki cel przedtreningowy wykorzystuje XLNet?

XLNet maksymalizuje oczekiwaną logarytm wiarygodności dla wszystkich permutacji kolejności faktoryzacji tokenów, co nazywa się modelowaniem języka permutacji.

Do której słabości BERT zaprojektowano specjalnie XLNet?

Sztuczny symbol BERT [MASKA] nigdy nie pojawia się podczas dostrajania i traktuje zamaskowane przewidywania jako niezależne; XLNet pozwala uniknąć obu problemów.

Co oddziela dwustrumieniowa samouwaga XLNet?

Strumień treści koduje token i kontekst, podczas gdy strumień zapytań zna pozycję celu, ale nie jego treść, umożliwiając przewidywanie bez wycieków.

Czy XLNet fizycznie miesza słowa w zdaniu?

XLNet permutuje porządek predykcji (faktoryzacji) za pomocą masek uwagi; oryginalne pozycje tokenów są zachowywane poprzez kodowanie pozycyjne.

Która architektura stanowi szkielet XLNet w kontekście dalekiego zasięgu?

XLNet opiera się na Transformerze-XL, który dodaje powtarzalność segmentów i względne kodowanie pozycyjne do obsługi długich sekwencji.