Nyelvi AI ÚTMUTATÓ

Mélységek keveréke

A Mélységkeverék (MoD) lehetővé teszi, hogy a transzformátor különböző mennyiségű számítást költsen különböző tokenekre, és csak a „fontos” tokeneket irányítja át az egyes rétegek nehéz számításai során.

2 perc olvasásUtoljára frissítve

Áttekintés

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

Mély merülés

A szabványos transzformátorok minden réteget minden tokenre alkalmaznak, még az olyan triviálisakat is, mint az írásjelek. A Google DeepMind által 2024-ben bevezetett Mixture of Depths minden blokkhoz egy kis útválasztót ad, amely kiválasztja a tokenek fix felső k töredékét, hogy átessen a teljes önfigyelem és MLP számításon; a többi maradék csatlakozáson keresztül kihagyja a blokkot. Mivel rétegenként csak k tokent dolgoznak fel, a teljes számítás (FLOP) korlátozott és előre ismert, ellentétben a korábbi dinamikus mélységű módszerekkel, amelyek kiszámíthatatlanul változtak. Ez hatékonysá teszi a kötegelést és a hardverhasználatot. A MoD által kiképzett modellek megfelelhetnek az alaptranszformátorok minőségének, ha kevesebb FLOP-t használnak előremenő lépésenként, vagy magasabb minőséget érhetnek el ugyanazon a számításon, és az ötlet természetesen a Mixture of-Experts segítségével épül fel, hogy a „MoDE” modelleket a mélységben és a szélességben egyaránt megfelelő legyen.

Technikai betekintés

Minden MoD blokknál egy tanult lineáris útválasztó minden tokent pontoz, és pontszámonként megtartja a top-k-t; a kiválasztott tokenek áthaladnak a figyelmen és az MLP-n, míg a ki nem választott tokenek változatlan formában kerülnek tovább a maradék útvonalon. Rögzített top-k használata (a tokenenkénti küszöb helyett) statikussá teszi a számítási gráfot, a tenzor alakzatokat pedig állandóvá teszi, ami hardverbarát. Az útválasztót a hálózat többi részével képezték ki, és az ok-okozati összefüggések generálása kiegészítő előrejelzőket használ, így az útválasztási döntések nem a jövőbeli tokenekre néznek.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A mélységek keverékének jövője

A feltételes számítás a hatékonyság fő hajtóereje a modellek méretezésében, a MoD pedig egy korai, tiszta példa. Mélyebb integrációra számíthat a Mixture of-Experts (mind a mélységben, mind a szakértők útválasztásában), az adaptív költségvetésekkel, amelyek csökkennek az egyszerű bevitel érdekében, és a tanult útválasztókkal, amelyek jobban azonosítják, mely tokeneknek van szükségük mélyreható feldolgozásra. Mivel a kikövetkeztetési költségek dominálnak a telepítési gazdaságosságban, a nagyméretű architektúrákban valószínűleg szabványossá válnak azok a technikák, amelyek lehetővé teszik a modellek számára, hogy csak ott gondolkodjanak jobban, ahol szükséges, miközben megtartják a kiszámítható késleltetést.

Valós megvalósítás

A hosszú dokumentumok feldolgozásához szükséges FLOP-ok csökkentése a kitöltő tokenek mélyreható számításának kihagyásával

Olyan modell betanítása, amely megfelel az alapminőségnek alacsonyabb számítási mód mellett, csökkentve a kiszolgálási költségeket

A Mixture-of-Experts-szel (MoDE) kombinálva a rétegmélység és a szakértői választás alapján egyaránt bevezethető

A tokenenkénti kiszámítható, rögzített késleltetés megtartása, mivel a rétegenkénti számítási költségvetés előre rögzített

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Mixture of Depths?

A Mélységkeverék (MoD) lehetővé teszi, hogy a transzformátor különböző mennyiségű számítást költsen különböző tokenekre, és csak a „fontos” tokeneket irányítja át az egyes rétegek nehéz számításai során. Csökkenti az egyszerű tokenek feldolgozásának költségeit, miközben megtartja a rögzített, kiszámítható számítási költségvetést.

Miben változik a mélységek keveréke a tokenek között?

A MoD csak néhány jelzőt irányít át az egyes rétegek nehéz számításain, így a különböző tokenek ténylegesen eltérő mélységet kapnak.

Hogyan tartja a Minisztérium kiszámítható költségvetését?

A blokkonkénti fix top k tokenek kiválasztása korlátozza a FLOP-okat, és állandóan tartja a tenzor alakzatokat, ami hardverbarát.

Mi történik azokkal a tokenekkel, amelyeket a router NEM választ ki egy adott blokkon?

A ki nem választott tokenek megkerülik a blokk számítását, és változatlan formában továbbítják őket a maradék útvonalon.

Ki vezette be a Mélységek keverékét?

A Mélységek keverékét a Google DeepMind vezette be a dinamikus transzformátorszámításról szóló 2024-es tanulmányában.

Mit eredményez a MoD és a Mixture of-Expert kombinálása?

A mélységi útválasztás és a szakértői útválasztás kombinálása olyan „MODE” modelleket eredményez, amelyek mind a rétegek, mind a szakértők számítási feltételeit meghatározzák.