Спекулативно декодиране на чернови модели
Спекулативното декодиране използва малък, бърз модел „чернова“, за да отгатне няколко предстоящи токена, които големият модел след това проверява с едно преминаване.
Преглед
It speeds up text generation 2-3x with no change to the output.
Дълбоко гмуркане
Големите езикови модели генерират текст един токен наведнъж и всяка стъпка изисква пълно преминаване през милиарди параметри — бавно и обвързано с паметта. Спекулативното декодиране атакува това чрез сдвояване на големия „целеви“ модел с евтин „чернов“ модел. Черновата на модела бързо предлага част от, да речем, 4-8 кандидат токена. След това големият модел ги обработва всички в едно успоредно преминаване напред и проверява всеки един. Приемат се жетони, които съответстват на това, което големият модел би произвел; първото несъответствие се коригира, а останалите се изхвърлят. Тъй като проверката на няколко токена наведнъж струва приблизително същата като генерирането на един, приетите изпълнения са почти безплатни. Най-важното е, че стъпката на вземане на проби за отхвърляне гарантира, че крайното разпределение е идентично с работата на големия модел самостоятелно — скорост без загуба на качество.
Техническа информация
Ключовият трик е модифициран тест за вземане на проби за отхвърляне. За всеки съставен токен вероятността на целевия модел се сравнява с черновата на модела. Ако целта присвои равна или по-висока вероятност, токенът се приема; в противен случай се приема с вероятност, равна на съотношението, и при отхвърляне се взема извадка от коригирано остатъчно разпределение. Тази математика прави резултата доказуемо еквивалентен на вземане на проби директно от големия модел.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на чернови модели за спекулативно декодиране
Очаквайте чернови модели да станат стандартна инфраструктура в сървъри за изводи като vLLM и TensorRT-LLM. Вариантите за самоспекулация (Medusa, EAGLE) премахват изцяло отделния чернови модел чрез добавяне на олекотени предсказващи глави, а дървовидното изготвяне проверява много продължения на кандидати наведнъж. Тъй като контекстните прозорци растат и разходите за обслужване доминират, по-интелигентните, съвпадащи с модела чертожници и проверката, съобразена с хардуера, ще повишат нивата на приемане и пропускателната способност.
Внедряване в реалния свят
Anthropic, OpenAI и Google използват спекулативно декодиране, за да намалят забавянето и разходите за обслужване на асистенти за чат, обслужващи милиони потребители.
vLLM и NVIDIA TensorRT-LLM доставят вградено спекулативно декодиране, така че самостоятелните домакини могат да ускорят внедряването на Llama или Mistral.
Сдвояване на чернова на модел 7B с цел 70B (напр. фамилия Llama-3) за приблизително удвояване на токени за секунда на един GPU.
Инструментите за допълване на код използват малък чернови модел, за да предложат шаблон, който по-големият модел проверява, поддържайки предложенията бързи в редактора.
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Спекулативни редакции за кодови модели
Frequently asked questions
What is Speculative Decoding Draft Models?
Спекулативното декодиране използва малък, бърз модел „чернова“, за да отгатне няколко предстоящи токена, които големият модел след това проверява с едно преминаване. Ускорява генерирането на текст 2-3 пъти без промяна в изхода.
Каква е основната роля на „черновия“ модел в спекулативното декодиране?
Малкият чернови модел евтино отгатва предстоящите токени, които големият целеви модел след това проверява с едно паралелно преминаване.
Защо проверката на няколко изготвени токена наведнъж спестява време?
Генерирането е свързано с паметта; проверката на няколко токена в едно пакетно преминаване е почти толкова евтино, колкото една стъпка, така че приетите изпълнения са почти безплатни.
Какво се случва с изготвените токени след първия токен, който целевият модел отхвърли?
Приемането продължава до първото несъгласие; този токен се коригира и всички последващи съставени токени се изхвърлят.
Как спекулативното декодиране гарантира, че качеството на изхода не е влошено?
Модифицираният тест за вземане на проби за отхвърляне гарантира, че окончателното разпределение на токени съответства на вземането на проби директно от целевия модел.
Кой от тях е подход на „самоспекулация“, който избягва отделен проект на модел?
Medusa и EAGLE добавят леки допълнителни глави за прогнозиране към основния модел, така че да може да чертае свои собствени бъдещи жетони.