Mélységek keveréke
A Mélységkeverék (MoD) lehetővé teszi, hogy a transzformátor különböző mennyiségű számítást költsen különböző tokenekre, és csak a „fontos” tokeneket irányítja át az egyes rétegek nehéz számításai során.
Áttekintés
It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.
Mély merülés
A szabványos transzformátorok minden réteget minden tokenre alkalmaznak, még az olyan triviálisakat is, mint az írásjelek. A Google DeepMind által 2024-ben bevezetett Mixture of Depths minden blokkhoz egy kis útválasztót ad, amely kiválasztja a tokenek fix felső k töredékét, hogy átessen a teljes önfigyelem és MLP számításon; a többi maradék csatlakozáson keresztül kihagyja a blokkot. Mivel rétegenként csak k tokent dolgoznak fel, a teljes számítás (FLOP) korlátozott és előre ismert, ellentétben a korábbi dinamikus mélységű módszerekkel, amelyek kiszámíthatatlanul változtak. Ez hatékonysá teszi a kötegelést és a hardverhasználatot. A MoD által kiképzett modellek megfelelhetnek az alaptranszformátorok minőségének, ha kevesebb FLOP-t használnak előremenő lépésenként, vagy magasabb minőséget érhetnek el ugyanazon a számításon, és az ötlet természetesen a Mixture of-Experts segítségével épül fel, hogy a „MoDE” modelleket a mélységben és a szélességben egyaránt megfelelő legyen.
Technikai betekintés
Minden MoD blokknál egy tanult lineáris útválasztó minden tokent pontoz, és pontszámonként megtartja a top-k-t; a kiválasztott tokenek áthaladnak a figyelmen és az MLP-n, míg a ki nem választott tokenek változatlan formában kerülnek tovább a maradék útvonalon. Rögzített top-k használata (a tokenenkénti küszöb helyett) statikussá teszi a számítási gráfot, a tenzor alakzatokat pedig állandóvá teszi, ami hardverbarát. Az útválasztót a hálózat többi részével képezték ki, és az ok-okozati összefüggések generálása kiegészítő előrejelzőket használ, így az útválasztási döntések nem a jövőbeli tokenekre néznek.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A mélységek keverékének jövője
A feltételes számítás a hatékonyság fő hajtóereje a modellek méretezésében, a MoD pedig egy korai, tiszta példa. Mélyebb integrációra számíthat a Mixture of-Experts (mind a mélységben, mind a szakértők útválasztásában), az adaptív költségvetésekkel, amelyek csökkennek az egyszerű bevitel érdekében, és a tanult útválasztókkal, amelyek jobban azonosítják, mely tokeneknek van szükségük mélyreható feldolgozásra. Mivel a kikövetkeztetési költségek dominálnak a telepítési gazdaságosságban, a nagyméretű architektúrákban valószínűleg szabványossá válnak azok a technikák, amelyek lehetővé teszik a modellek számára, hogy csak ott gondolkodjanak jobban, ahol szükséges, miközben megtartják a kiszámítható késleltetést.
Valós megvalósítás
A hosszú dokumentumok feldolgozásához szükséges FLOP-ok csökkentése a kitöltő tokenek mélyreható számításának kihagyásával
Olyan modell betanítása, amely megfelel az alapminőségnek alacsonyabb számítási mód mellett, csökkentve a kiszolgálási költségeket
A Mixture-of-Experts-szel (MoDE) kombinálva a rétegmélység és a szakértői választás alapján egyaránt bevezethető
A tokenenkénti kiszámítható, rögzített késleltetés megtartása, mivel a rétegenkénti számítási költségvetés előre rögzített
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Depths quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Szerkeverék aggregáció
Gyakran ismételt kérdések
What is Mixture of Depths?
A Mélységkeverék (MoD) lehetővé teszi, hogy a transzformátor különböző mennyiségű számítást költsen különböző tokenekre, és csak a „fontos” tokeneket irányítja át az egyes rétegek nehéz számításai során. Csökkenti az egyszerű tokenek feldolgozásának költségeit, miközben megtartja a rögzített, kiszámítható számítási költségvetést.
Miben változik a mélységek keveréke a tokenek között?
A MoD csak néhány jelzőt irányít át az egyes rétegek nehéz számításain, így a különböző tokenek ténylegesen eltérő mélységet kapnak.
Hogyan tartja a Minisztérium kiszámítható költségvetését?
A blokkonkénti fix top k tokenek kiválasztása korlátozza a FLOP-okat, és állandóan tartja a tenzor alakzatokat, ami hardverbarát.
Mi történik azokkal a tokenekkel, amelyeket a router NEM választ ki egy adott blokkon?
A ki nem választott tokenek megkerülik a blokk számítását, és változatlan formában továbbítják őket a maradék útvonalon.
Ki vezette be a Mélységek keverékét?
A Mélységek keverékét a Google DeepMind vezette be a dinamikus transzformátorszámításról szóló 2024-es tanulmányában.
Mit eredményez a MoD és a Mixture of-Expert kombinálása?
A mélységi útválasztás és a szakértői útválasztás kombinálása olyan „MODE” modelleket eredményez, amelyek mind a rétegek, mind a szakértők számítási feltételeit meghatározzák.