Nyelvi AI ÚTMUTATÓ

Jamba hibrid transzformátor-mamba modellek

A Jamba az AI21 Labs egy nagy nyelvi modellje, amely a Transformer figyelemrétegeit Mamba állapottér rétegekkel (plusz szakértők keverékével) átlapolja, hogy hosszú kontextusú hatékonyságot érjen el anélkül, hogy feladná a Transformer minőségét.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it shows hybrid architectures can beat pure Transformers on memory and throughput at long sequence lengths.

Mély merülés

A Pure Transformers négyzetes költséget fizet a figyelemért, ahogy a kontextus növekszik, és kulcsérték-gyorsítótár-buborékaik sorozathosszúak. A tiszta állapottér-modellek, mint például a Mamba, lineárisan skáláznak, és fix méretű visszatérő állapotot tartanak fenn, de történelmileg késleltetik a figyelmet bizonyos feladatoknál. A Jamba mindkettőt ötvözi: olyan blokkokat halmoz fel, ahol a legtöbb réteg Mamba (olcsó, lineáris, kiváló hosszú sorozatokhoz), és kisebb számban standard figyelem (erős a precíz felidézéssel és a kontextuson belüli érveléssel). Szakértői keverék (MoE) rétegeket is hozzáad a kapacitás növeléséhez, miközben az aktív paramétereket szerényen tartja. Az első Jamba 256 000 token kontextusablakkal jelent meg, és sokkal több kontextust tudott elhelyezni egyetlen GPU-n, mint a hasonló Transformers, köszönhetően drámaian kisebb KV gyorsítótárának.

Technikai betekintés

A Mamba egy szelektív állapottér modell: ahelyett, hogy minden múltbeli tokenre figyelne, egy tömörített ismétlődő állapotot tart fenn, lineárisan frissítve a sorozaton keresztül, bemenettől függő kapuzással, amely eldönti, hogy mit tartson meg vagy felejtsen el. A Jamba néhány teljes figyelemre kiterjedő réteget beszúr a sok Mamba réteg közé, így a modell megtartja a figyelem pontos, hosszú távú keresését, miközben a számítási és memória nagy része lineáris marad, és a MoE-útválasztás tokenenként csak a szakértők egy részét aktiválja.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A Jamba hibrid transzformátor-mamba modellek jövője

A hibrid figyelem és állapottér kialakítása a hatékony, hosszú kontextusú modellek vezető receptjeként jelenik meg, és a Jamba segített a minta népszerűsítésében. Várható, hogy a nyitottabb és határosabb modellek vegyes veremeket alkalmazzanak, finomítsák a figyelem/SSM arányt, és kombinálják őket MoE és KV-cache trükkökkel. Ahogy a kontextusigények több millió tokenek felé nőnek, az állapottér rétegek lineáris memória előnye különösen vonzóvá teszi a hibrideket az eszközön és a költségérzékeny telepítésekhez.

Valós megvalósítás

256 000 token bemenetek feldolgozása, például hosszú jogi bejelentések vagy nagy kódtárak egyetlen GPU-n, amelyek nem fértek el egy hasonló Transformer KV gyorsítótárához

Nagy áteresztőképességű, hosszú kontextusú csevegés, ahol a Mamba rögzített állapota egyenletesen tartja a memóriát a beszélgetések növekedésével

Dokumentumelemzés és visszakereséssel bővített generálás nagyon nagy tudásbázisokon keresztül, közvetlenül a kontextusba tömve

Nyílt súlyú, hosszú kontextusú LLM futtatása (a Jamba nyílt súllyal jelent meg) a hibrid architektúrák kutatására

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jamba Hybrid Transformer-Mamba Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Állami űrmodellek és Mamba

Gyakran ismételt kérdések

What is Jamba Hybrid Transformer-Mamba Models?

A Jamba az AI21 Labs egy nagy nyelvi modellje, amely a Transformer figyelemrétegeit Mamba állapottér rétegekkel (plusz szakértők keverékével) átlapolja, hogy hosszú kontextusú hatékonyságot érjen el anélkül, hogy feladná a Transformer minőségét. Ez azért fontos, mert megmutatja, hogy a hibrid architektúrák képesek legyőzni a tiszta transzformátorokat a memóriában és az átviteli sebességben hosszú sorozathosszúság mellett.

Melyik két alapvető rétegtípust illeszti be a Jamba?

A Jamba meghatározó jellemzője, hogy a Mamba állapottér rétegeit kisebb számú Transformer figyelemréteggel halmozza össze.

Milyen további technikát használ a Jamba a kapacitás növelésére, miközben alacsonyan tartja az aktív paramétereket?

A Jamba MoE-rétegeket ad hozzá, így csak a szakértők egy része aktív tokenenként, és a teljes kapacitást növeli anélkül, hogy arányosan növekedne a számítás.

Miért skálázódik jobban a Mamba, mint a figyelem a hosszú sorozatoknál?

A Mamba a tömörített, rögzített méretű állapotot lineárisan frissíti, elkerülve a négyzetes figyelemköltséget és az egyre növekvő kulcsérték-gyorsítótárat.

Milyen kontextusablakot támogatott az első Jamba-modell?

A Jamba egy 256 000 token kontextusablakkal indult, amelyet nagyrészt a kis KV-gyorsítótár helye tesz lehetővé.

Miért tart fenn bizonyos rétegeket a Jamba ahelyett, hogy tiszta Mambává válna?

Néhány teljes figyelmet igénylő réteg megtartja a pontos keresési és kontextusbeli képességeket, ahol a tiszta állapottér-modellek lemaradhatnak.