PRZEWODNIK Językowy AI

Odchylenie pozycji ALiBi

ALiBi (Attention with Linear Biases) to sprytny sposób na zapewnienie transformatorom poczucia porządku słów bez tradycyjnego osadzania pozycji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It lets a model trained on short text handle much longer inputs at inference time.

Głębokie nurkowanie

Transformatory nie mają wbudowanego pojęcia kolejności słów, więc potrzebują sposobu na zakodowanie pozycji. Klasyczne podejście dodaje osadzania pozycyjne do wektorów tokenów. ALiBi, wprowadzone przez Press, Smith i Lewis w 2021 r., całkowicie je odrzuca. Zamiast tego bezpośrednio zmienia wyniki uwagi: gdy token zapytania sprawdza token klucza, ALiBi odejmuje karę proporcjonalną do odległości między nimi. Żetony, które są daleko od siebie, otrzymują większą karę, więc model naturalnie preferuje pobliski kontekst. Każda głowa uwagi ma własne, stałe nachylenie kary, więc niektóre głowy patrzą lokalnie, a inne patrzą dalej. Ponieważ odchylenie jest tylko funkcją odległości, ALiBi z wdziękiem ekstrapoluje na sekwencje znacznie dłuższe niż te obserwowane podczas treningu.

Wgląd techniczny

W przypadku zapytania w pozycji i i klucza w pozycji j, ALiBi dodaje m * (j - i) do surowego wyniku uwagi przed softmax, gdzie m jest stałą specyficzną dla głowy (nachylenia tworzą sekwencję geometryczną, np. 1/2, 1/4, 1/8). Ponieważ j jest mniejsze lub równe i w uwadze przyczynowej, człon ten ma wartość zerową lub ujemną, karząc odległe tokeny. Nie są dodawane żadne wyuczone parametry ani osadzania, więc jedynym obciążeniem jest wstępnie obliczona macierz odchylenia.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość stronniczości pozycji ALiBi

Projekt ALiBi udowodnił, że względne odchylenia oparte na odległości są lepsze od osadzania pozycji bezwzględnych w celu uogólnienia długości, a koncepcja ta przenika obecnie nowoczesne projekty długokontekstowe. Niektóre najnowsze modele preferują zamiast tego osadzanie obrotowe (RoPE), ale ALiBi pozostaje popularne tam, gdzie liczy się ekstremalna ekstrapolacja i było stosowane w modelach takich jak BLOOM i MPT. Spodziewaj się ciągłych eksperymentów hybrydowych, łączących błąd odległości ze skalowaniem RoPE, podczas gdy laboratoria przesuwają okna kontekstowe w kierunku milionów tokenów bez konieczności ponownego szkolenia od zera.

Implementacja w świecie rzeczywistym

Szkolenie chatbota na przykładach zawierających 1024 tokeny, ale wdrażanie go na dokumentach zawierających 4096 tokenów bez ponownego szkolenia, w oparciu o ekstrapolację ALiBi.

Wielojęzyczny model BLOOM 176B, w którym zastosowano ALiBi do obsługi pozycji.

Modele MPT MosaicML, które wykorzystywały ALiBi do skutecznego reklamowania nieograniczonej długości kontekstu przy wnioskowaniu.

Podsumowanie długich umów prawnych, które przekraczają pierwotną długość szkolenia modelu, gdzie stronniczość bliskiego kontekstu zapewnia spójność uwagi.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Interpolacja pozycji w celu rozszerzenia kontekstu

Często zadawane pytania

What is ALiBi Position Bias?

ALiBi (Attention with Linear Biases) to sprytny sposób na zapewnienie transformatorom poczucia porządku słów bez tradycyjnego osadzania pozycji. Pozwala modelowi wyszkolonemu na krótkim tekście obsługiwać znacznie dłuższe dane wejściowe w czasie wnioskowania.

Co oznacza ALiBi?

ALiBi to skrót od Attention with Linear Biases, którego nazwa pochodzi od liniowej kary, jaką dodaje do wyników uwagi.

W jaki sposób ALiBi karze odległe tokeny?

ALiBi odejmuje wartość proporcjonalną do odległości klucza zapytania od wyniku uwagi, więc dalsze tokeny mają mniejszą wagę.

Jaka jest najbardziej znana praktyczna zaleta ALiBi?

Ponieważ odchylenie zależy tylko od odległości, modele wytrenowane na krótkich sekwencjach radzą sobie w czasie wnioskowania ze znacznie dłuższymi sekwencjami.

Czym różni się liniowe odchylenie w głowach uwagi?

ALiBi przypisuje każdej głowicy odrębne, stałe nachylenie (np. 1/2, 1/4, 1/8), więc różne głowice występują w różnych zakresach.

W porównaniu do tradycyjnego osadzania pozycyjnego, ALiBi dodaje ile wyuczonych parametrów?

ALiBi nie wprowadza żadnych nowych, poznanych parametrów; nachylenia na głowę są z góry określonymi stałymi.