Multi-Token előrejelzési tréning
Ahelyett, hogy csak a következő tokent jósolná meg, a modellt arra tanítják, hogy egyszerre több jövőbeli tokent is megjósolja.
Áttekintés
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Mély merülés
A szabványos nyelvi modelleket a következő jogkivonat előrejelzésével tanítják: adott kontextus alapján előrejelzi az egyetlen következő tokent. A 2024-es Meta papír által népszerűsített és a DeepSeek-V3-ban elfogadott Multi-token előrejelzés (MTP) extra könnyű kimeneti fejeket ad hozzá, így a modell egyszerre előrejelzi a következő tokent, valamint a 2., 3. és 4. tokent ugyanabból a rejtett állapotból. Ez arra kényszeríti a hálózatot, hogy tovább tervezzen a jövőre, és sűrűsödik a képzési jel – most minden pozíció több veszteséggel jár. Meta különösen nagy előnyökről számolt be a kódolás és a generatív érvelés terén, a nagyobb modellek pedig többet profitáltak. Lényeges, hogy az extra fejeket kiképzés után el lehet dobni, így a modell méretének a telepítéskor nem kell növekednie.
Technikai betekintés
Az MTP n független előrejelző fejet rögzít a megosztott transzformátor törzs tetejére; a k fej előrejelzi a t+k pozícióban lévő tokent a t pozícióban lévő reprezentációból. A veszteségeket az edzés során összegzik. Következtetésképpen a segédfejek lehetővé teszik az önspekulatív dekódolást: a modell egy menetben több tokent javasol, majd ezeket ellenőrzi, így nagyjából 3x gyorsabb generálást ér el a kimeneti eloszlás megváltoztatása nélkül.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A Multi-Token Prediction Training jövője
Az MTP a határmenti edzésreceptek alapértelmezett összetevőjévé válik, mivel alacsony költséggel javítja a minőséget és a következtetési sebességet. Szorosabb integrációra számíthat a spekulatív dekódolással, mélyebb előrejelzési horizontokkal, és kiegészítő célként történő felhasználással, amely javítja a hosszú távú tervezést. Az érvelési modellekkel kombinálva a több lépés előrejelzése segíthet a modelleknek belsőleg szimulálni a következményeket, mielőtt elköteleznék magukat a válasz mellett.
Valós megvalósítás
A DeepSeek-V3 MTP-objektívet használ az előképzés során, hogy növelje az adathatékonyságot és lehetővé tegye a spekulatív dekódolást
Meta kódgeneráló modelljei, amelyek a HumanEval és az MBPP pontosságnövekedését mutatják több token előrejelzéséből
Önspekulatív dekódolás: 3-4 token rajzolása előremenetenként, majd ellenőrzés a gyorsabb, elosztást megőrző kimenet érdekében
Gyorsabb automatikus kiegészítés a kódolási asszisztensekben, ahol egy lépésben több elfogadható tokent javasolnak és ellenőriznek
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Spekulatív adatfolyam és több token előrejelzés
Gyakran ismételt kérdések
What is Multi-Token Prediction Training?
Ahelyett, hogy csak a következő tokent jósolná meg, a modellt arra tanítják, hogy egyszerre több jövőbeli tokent is megjósolja. Ez élesíti a tanulási jeleket, és gyorsabb következtetéseket tesz lehetővé az önspekulatív dekódolás révén.
Mit ad hozzá a több token előrejelzés a szokásos next token képzéshez képest?
Az MTP további kimeneti fejeket ad hozzá, így a modell egy rejtett állapotból előrejelzi a következő tokent és még több tokent.
Melyik modell használt különösen több token előrejelzési célt az előképzésben?
A DeepSeek-V3 egy MTP képzési célt fogadott el, hogy javítsa az adathatékonyságot és lehetővé tegye a spekulatív dekódolást.
Miért sűrűsíti az MTP az edzésjelet?
Több jövőbeli token előrejelzése azt jelenti, hogy minden token pozíció több előrejelzési veszteséget okoz, így tokenenként több tanulási jelet ad.
Milyen következtetési előnyöket tesznek lehetővé az extra előrejelző fejek?
A segédfejek menetenként több tokent rajzolhatnak, amelyeket ezután ellenőriznek, felgyorsítva a generálást a kimeneti eloszlás megváltoztatása nélkül.
Mi történik a segédfejekkel edzés után, ha nincs szükséged gyorsításokra?
Az extra fejek telepítéskor opcionálisak; elvetésükkel a modell ugyanolyan méretű marad, mint egy szabványos next-token modellé.