Spekulatív dekódolási vázlatmodellek
A spekulatív dekódolás egy kicsi, gyors „vázlat” modellt használ, hogy kitaláljon több közelgő tokent, amelyeket egy nagy modell egy menetben ellenőriz.
Áttekintés
It speeds up text generation 2-3x with no change to the output.
Mély merülés
A nagy nyelvi modellek egyszerre egy-egy tokent generálnak szöveget, és minden lépéshez több milliárd paraméter teljes előrehaladása szükséges – lassú és memóriakötött. A spekulatív dekódolás ezt támadja azzal, hogy a nagy „cél” modellt egy olcsó „vázlat” modellel párosítja. A vázlatmodell gyorsan egy 4-8 jelölt tokenből álló darabot javasol. A nagy modell ezután mindegyiket egyetlen párhuzamos előremenetben dolgozza fel, és mindegyiket ellenőrzi. Elfogadják azokat a tokeneket, amelyek megfelelnek annak, amit a nagy modell gyártott volna; az első eltérést kijavítják, a többit eldobják. Mivel több token egyidejű ellenőrzése nagyjából ugyanannyiba kerül, mint egy generálása, az elfogadott futtatások szinte ingyenesek. Lényeges, hogy egy elutasító mintavételi lépés garantálja, hogy a végső eloszlás megegyezik a nagy modell egyedüli futtatásával – sebesség minőségromlás nélkül.
Technikai betekintés
A legfontosabb trükk egy módosított elutasítási mintavételi teszt. Minden egyes vázlatolt token esetében a célmodell valószínűsége összehasonlításra kerül a vázlatmodellével. Ha a cél egyenlő vagy nagyobb valószínűséget rendel, a token elfogadásra kerül; ellenkező esetben az aránynak megfelelő valószínűséggel fogadjuk el, és elutasításkor egy korrigált tokent veszünk minta egy korrigált maradékeloszlásból. Ez a matematika a kimenetet bizonyíthatóan egyenértékűvé teszi a közvetlenül a nagy modellből történő mintavétellel.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A spekulatív dekódolási vázlatmodellek jövője
Várhatóan a vázlatmodellek szabványos infrastruktúrává válnak az olyan következtetési szerverekben, mint a vLLM és a TensorRT-LLM. Az önspekulációs változatok (Medusa, EAGLE) teljesen eldobják a különálló vázlatmodellt könnyű előrejelző fejek hozzáadásával, és a fa alapú rajzolás egyszerre sok jelölt folytatást igazol. Ahogy a kontextusablakok növekszenek és a kiszolgálási költségek dominálnak, az intelligensebb, modellhez illő rajzolók és a hardvertudatos ellenőrzés növeli az elfogadási arányt és az átviteli sebességet.
Valós megvalósítás
A Anthropic, OpenAI és Google spekulatív dekódolást használ a várakozási idő és a több millió felhasználót kiszolgáló csevegősegéd kiszolgálási költségeinek csökkentése érdekében.
A vLLM és az NVIDIA TensorRT-LLM beépített spekulatív dekódolást szállít, így az önkiszolgálók felgyorsíthatják a Llama vagy Mistral telepítését.
7B vázlatmodell párosítása 70B céllal (pl. Llama-3 család), hogy egyetlen GPU-n nagyjából megduplázza a tokenek számát másodpercenként.
A kódkiegészítő eszközök egy apró vázlatos modellt használnak, hogy javaslatot tegyenek a nagyobb modell által ellenőrzött vázlatra, miközben a javaslatokat a szerkesztőben gördülékenyen tartják.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Spekulatív szerkesztések kódmodellekhez
Gyakran ismételt kérdések
What is Speculative Decoding Draft Models?
A spekulatív dekódolás egy kicsi, gyors „vázlat” modellt használ, hogy kitaláljon több közelgő tokent, amelyeket egy nagy modell egy menetben ellenőriz. 2-3x felgyorsítja a szöveggenerálást anélkül, hogy a kimeneten megváltozna.
Mi a „vázlat” modell elsődleges szerepe a spekulatív dekódolásban?
A kis piszkozatú modell olcsón kitalálja a közelgő tokeneket, amelyeket aztán a nagy célmodell egyetlen párhuzamos menetben ellenőriz.
Miért takarít meg időt több vázlatolt token egyidejű ellenőrzése?
A generáció emlékezethez kötött; több token ellenőrzése egy kötegelt bérletben majdnem olyan olcsó, mint egy lépés, így az elfogadott futtatások szinte ingyenesek.
Mi történik a draftolt tokenekkel, miután az első token a célmodell elutasítja?
Az elfogadás az első nézeteltérésig tart; ezt a tokent kijavítják, és az összes későbbi draftolt tokent eldobják.
Hogyan biztosítja a spekulatív dekódolás a kimeneti minőség romlását?
Egy módosított elutasítási mintavételi teszt garantálja, hogy a végső jogkivonat-eloszlás megfelel a mintavételezésnek közvetlenül a célmodellből.
Ezek közül melyik „önspekulációs” megközelítés, amely elkerüli a külön vázlatos modellt?
A Medusa és az EAGLE könnyű, extra előrejelző fejeket ad a fő modellhez, így az saját jövőbeli tokeneket készíthet.