Modelos de rascunho de decodificação especulativa
A decodificação especulativa usa um modelo de 'rascunho' pequeno e rápido para adivinhar vários tokens futuros que um modelo grande verifica em uma única passagem.
Visão geral
It speeds up text generation 2-3x with no change to the output.
Mergulho profundo
Grandes modelos de linguagem geram texto, um token por vez, e cada etapa requer uma passagem completa por bilhões de parâmetros – lenta e limitada pela memória. A decodificação especulativa ataca isso combinando o grande modelo “alvo” com um modelo “rascunho” barato. O modelo preliminar propõe rapidamente um pedaço de, digamos, 4 a 8 tokens candidatos. O grande modelo então processa todos eles em uma única passagem paralela e verifica cada um deles. São aceitos tokens que correspondam ao que o grande modelo teria produzido; a primeira incompatibilidade é corrigida e o restante descartado. Como verificar vários tokens de uma vez custa aproximadamente o mesmo que gerar um, as execuções aceitas são quase gratuitas. Crucialmente, uma etapa de amostragem de rejeição garante que a distribuição final seja idêntica à execução do grande modelo sozinho – velocidade sem perda de qualidade.
Visão Técnica
O truque principal é um teste de amostragem de rejeição modificado. Para cada token elaborado, a probabilidade do modelo alvo é comparada com a do modelo preliminar. Se o alvo atribuir probabilidade igual ou superior, o token é aceito; caso contrário, é aceito com probabilidade igual à razão e, na rejeição, um token corrigido é amostrado a partir de uma distribuição residual ajustada. Essa matemática torna o resultado provavelmente equivalente à amostragem direta do modelo grande.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro dos modelos preliminares de decodificação especulativa
Espere que os modelos preliminares se tornem infraestrutura padrão em servidores de inferência como vLLM e TensorRT-LLM. Variantes de autoespeculação (Medusa, EAGLE) eliminam totalmente o modelo de rascunho separado, adicionando cabeças de previsão leves, e o rascunho baseado em árvore verifica muitas continuações candidatas de uma só vez. À medida que as janelas de contexto crescem e os custos de serviço dominam, os redatores mais inteligentes e compatíveis com o modelo e a verificação consciente do hardware aumentarão as taxas de aceitação e o rendimento.
Implementação no mundo real
Anthropic, OpenAI e Google usam decodificação especulativa para reduzir a latência e o custo de veiculação em assistentes de bate-papo que atendem milhões de usuários.
O vLLM e o NVIDIA TensorRT-LLM fornecem decodificação especulativa integrada para que os auto-hosters possam acelerar as implantações do Llama ou Mistral.
Emparelhar um modelo de rascunho de 7B com um alvo de 70B (por exemplo, família Llama-3) para aproximadamente dobrar os tokens por segundo em uma única GPU.
As ferramentas de conclusão de código usam um pequeno modelo de rascunho para propor padrões que o modelo maior verifica, mantendo as sugestões rápidas no editor.
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Edições especulativas para modelos de código
Perguntas frequentes
What is Speculative Decoding Draft Models?
A decodificação especulativa usa um modelo de 'rascunho' pequeno e rápido para adivinhar vários tokens futuros que um modelo grande verifica em uma única passagem. Ele acelera a geração de texto 2 a 3x sem alterar a saída.
Qual é o papel principal do modelo “rascunho” na decodificação especulativa?
O modelo de rascunho pequeno adivinha de forma barata os próximos tokens, que o modelo de destino grande verifica em uma única passagem paralela.
Por que a verificação de vários tokens elaborados de uma só vez economiza tempo?
A geração está ligada à memória; verificar vários tokens em uma passagem em lote é quase tão barato quanto uma etapa, portanto, as execuções aceitas são quase gratuitas.
O que acontece com os tokens elaborados após o primeiro token rejeitado pelo modelo de destino?
A aceitação prossegue até a primeira discordância; esse token é corrigido e todos os tokens elaborados subsequentemente são jogados fora.
Como a decodificação especulativa garante que a qualidade da saída não seja degradada?
Um teste de amostragem de rejeição modificado garante que a distribuição final do token corresponda à amostragem diretamente do modelo de destino.
Qual destas é uma abordagem de “autoespeculação” que evita um rascunho de modelo separado?
Medusa e EAGLE adicionam cabeças de previsão extras leves ao modelo principal para que ele possa elaborar seus próprios tokens futuros.