Odchylenie pozycji ALiBi
ALiBi (Attention with Linear Biases) to sprytny sposób na zapewnienie transformatorom poczucia porządku słów bez tradycyjnego osadzania pozycji.
Przegląd
It lets a model trained on short text handle much longer inputs at inference time.
Głębokie nurkowanie
Transformatory nie mają wbudowanego pojęcia kolejności słów, więc potrzebują sposobu na zakodowanie pozycji. Klasyczne podejście dodaje osadzania pozycyjne do wektorów tokenów. ALiBi, wprowadzone przez Press, Smith i Lewis w 2021 r., całkowicie je odrzuca. Zamiast tego bezpośrednio zmienia wyniki uwagi: gdy token zapytania sprawdza token klucza, ALiBi odejmuje karę proporcjonalną do odległości między nimi. Żetony, które są daleko od siebie, otrzymują większą karę, więc model naturalnie preferuje pobliski kontekst. Każda głowa uwagi ma własne, stałe nachylenie kary, więc niektóre głowy patrzą lokalnie, a inne patrzą dalej. Ponieważ odchylenie jest tylko funkcją odległości, ALiBi z wdziękiem ekstrapoluje na sekwencje znacznie dłuższe niż te obserwowane podczas treningu.
Wgląd techniczny
W przypadku zapytania w pozycji i i klucza w pozycji j, ALiBi dodaje m * (j - i) do surowego wyniku uwagi przed softmax, gdzie m jest stałą specyficzną dla głowy (nachylenia tworzą sekwencję geometryczną, np. 1/2, 1/4, 1/8). Ponieważ j jest mniejsze lub równe i w uwadze przyczynowej, człon ten ma wartość zerową lub ujemną, karząc odległe tokeny. Nie są dodawane żadne wyuczone parametry ani osadzania, więc jedynym obciążeniem jest wstępnie obliczona macierz odchylenia.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość stronniczości pozycji ALiBi
Projekt ALiBi udowodnił, że względne odchylenia oparte na odległości są lepsze od osadzania pozycji bezwzględnych w celu uogólnienia długości, a koncepcja ta przenika obecnie nowoczesne projekty długokontekstowe. Niektóre najnowsze modele preferują zamiast tego osadzanie obrotowe (RoPE), ale ALiBi pozostaje popularne tam, gdzie liczy się ekstremalna ekstrapolacja i było stosowane w modelach takich jak BLOOM i MPT. Spodziewaj się ciągłych eksperymentów hybrydowych, łączących błąd odległości ze skalowaniem RoPE, podczas gdy laboratoria przesuwają okna kontekstowe w kierunku milionów tokenów bez konieczności ponownego szkolenia od zera.
Implementacja w świecie rzeczywistym
Szkolenie chatbota na przykładach zawierających 1024 tokeny, ale wdrażanie go na dokumentach zawierających 4096 tokenów bez ponownego szkolenia, w oparciu o ekstrapolację ALiBi.
Wielojęzyczny model BLOOM 176B, w którym zastosowano ALiBi do obsługi pozycji.
Modele MPT MosaicML, które wykorzystywały ALiBi do skutecznego reklamowania nieograniczonej długości kontekstu przy wnioskowaniu.
Podsumowanie długich umów prawnych, które przekraczają pierwotną długość szkolenia modelu, gdzie stronniczość bliskiego kontekstu zapewnia spójność uwagi.
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ALiBi Position Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Interpolacja pozycji w celu rozszerzenia kontekstu
Często zadawane pytania
What is ALiBi Position Bias?
ALiBi (Attention with Linear Biases) to sprytny sposób na zapewnienie transformatorom poczucia porządku słów bez tradycyjnego osadzania pozycji. Pozwala modelowi wyszkolonemu na krótkim tekście obsługiwać znacznie dłuższe dane wejściowe w czasie wnioskowania.
Co oznacza ALiBi?
ALiBi to skrót od Attention with Linear Biases, którego nazwa pochodzi od liniowej kary, jaką dodaje do wyników uwagi.
W jaki sposób ALiBi karze odległe tokeny?
ALiBi odejmuje wartość proporcjonalną do odległości klucza zapytania od wyniku uwagi, więc dalsze tokeny mają mniejszą wagę.
Jaka jest najbardziej znana praktyczna zaleta ALiBi?
Ponieważ odchylenie zależy tylko od odległości, modele wytrenowane na krótkich sekwencjach radzą sobie w czasie wnioskowania ze znacznie dłuższymi sekwencjami.
Czym różni się liniowe odchylenie w głowach uwagi?
ALiBi przypisuje każdej głowicy odrębne, stałe nachylenie (np. 1/2, 1/4, 1/8), więc różne głowice występują w różnych zakresach.
W porównaniu do tradycyjnego osadzania pozycyjnego, ALiBi dodaje ile wyuczonych parametrów?
ALiBi nie wprowadza żadnych nowych, poznanych parametrów; nachylenia na głowę są z góry określonymi stałymi.