Jazyk AI GUIDE

Zkreslení pozice ALiBi

ALiBi (Attention with Linear Biases) je chytrý způsob, jak dát transformátorům smysl pro slovosled bez tradičního vkládání pozic.

2 minuty čteníNaposledy aktualizováno

Přehled

It lets a model trained on short text handle much longer inputs at inference time.

Hluboký ponor

Transformátory nemají vestavěný pojem slovosledu, takže potřebují způsob, jak zakódovat pozici. Klasický přístup přidává do vektorů tokenů poziční vložení. ALiBi, který představili Press, Smith a Lewis v roce 2021, je úplně vyhazuje. Místo toho přímo tlačí skóre pozornosti: když se token dotazu podívá na klíčový token, ALiBi odečte penalizaci úměrnou vzdálenosti mezi nimi. Žetony, které jsou daleko od sebe, dostanou větší postih, takže model přirozeně preferuje blízký kontext. Každá hlava pozornosti má svůj vlastní pevný sklon, takže některé hlavy se dívají lokálně, zatímco jiné vidí dále. Vzhledem k tomu, že zkreslení je pouze funkcí vzdálenosti, ALiBi elegantně extrapoluje na sekvence mnohem delší než ty, které lze vidět při tréninku.

Technický přehled

Pro dotaz na pozici i a klíč na pozici j ALiBi přidá m * (j - i) k hrubému skóre pozornosti před softmax, kde m je konstanta specifická pro hlavu (sklony tvoří geometrickou sekvenci jako 1/2, 1/4, 1/8). Protože j je v kauzální pozornosti menší nebo rovno i, je tento člen nulový nebo záporný, což penalizuje vzdálené tokeny. Nejsou přidány žádné naučené parametry a žádná vložení, takže jedinou režií je předem vypočítaná matice zkreslení.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost ALiBi Position Bias

ALiBi prokázal, že relativní odchylky založené na vzdálenosti porážejí vložení absolutní polohy pro zobecnění délky, a tato myšlenka nyní proniká do moderního designu s dlouhým kontextem. Některé nedávné modely místo toho upřednostňují rotační zabudování (RoPE), ale ALiBi zůstává populární tam, kde záleží na extrémní extrapolaci, a byl použit v modelech jako BLOOM a MPT. Očekávejte pokračující hybridní experimentování, kombinující zkreslení vzdálenosti se škálováním RoPE, protože laboratoře posouvají kontextová okna směrem k milionům tokenů bez přeškolování od nuly.

Real-World Implementace

Školení chatbota na příkladech 1 024 tokenů, ale jeho nasazení na dokumenty s 4 096 tokeny bez přeškolování, spoléhání se na extrapolaci ALiBi.

Vícejazyčný model BLOOM 176B, který přijal ALiBi pro ovládání polohy.

Modely MPT od MosaicML, které používaly ALiBi k efektivní inzerci neomezené délky kontextu při odvození.

Shrnutí dlouhých právních smluv, které přesahují původní délku školení modelu, kde zkreslení blízkého kontextu udržuje pozornost koherentní.

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Interpolace pozice pro kontextové rozšíření

Často kladené otázky

What is ALiBi Position Bias?

ALiBi (Attention with Linear Biases) je chytrý způsob, jak dát transformátorům smysl pro slovosled bez tradičního vkládání pozic. Umožňuje modelu trénovanému na krátkém textu zvládnout mnohem delší vstupy v době odvození.

Co znamená ALiBi?

ALiBi je zkratka pro Attention with Linear Biases, pojmenovaný pro lineární penalizaci, kterou přidává ke skóre pozornosti.

Jak ALiBi penalizuje vzdálené tokeny?

ALiBi odečítá od skóre pozornosti hodnotu úměrnou vzdálenosti klíče dotazu, takže vzdálenější tokeny mají menší váhu.

Jaká je nejslavnější praktická výhoda ALiBi?

Vzhledem k tomu, že zkreslení závisí pouze na vzdálenosti, modely trénované na krátkých sekvencích zvládnou mnohem delší sekvence v čase odvození.

V čem se liší lineární zkreslení napříč hlavami pozornosti?

ALiBi přiřazuje každé hlavě odlišný, pevný sklon (např. 1/2, 1/4, 1/8), takže různé hlavy působí v různých rozsazích.

V porovnání s tradičními pozičními vnořeními přidává ALiBi kolik naučených parametrů?

ALiBi nezavádí žádné nové naučené parametry; sklony na hlavu jsou předem určené konstanty.