GUIA de IA de linguagem

Modelos de rascunho de decodificação especulativa

A decodificação especulativa usa um modelo de 'rascunho' pequeno e rápido para adivinhar vários tokens futuros que um modelo grande verifica em uma única passagem.

2 minutos de leituraÚltima atualização

Visão geral

It speeds up text generation 2-3x with no change to the output.

Mergulho profundo

Grandes modelos de linguagem geram texto, um token por vez, e cada etapa requer uma passagem completa por bilhões de parâmetros – lenta e limitada pela memória. A decodificação especulativa ataca isso combinando o grande modelo “alvo” com um modelo “rascunho” barato. O modelo preliminar propõe rapidamente um pedaço de, digamos, 4 a 8 tokens candidatos. O grande modelo então processa todos eles em uma única passagem paralela e verifica cada um deles. São aceitos tokens que correspondam ao que o grande modelo teria produzido; a primeira incompatibilidade é corrigida e o restante descartado. Como verificar vários tokens de uma vez custa aproximadamente o mesmo que gerar um, as execuções aceitas são quase gratuitas. Crucialmente, uma etapa de amostragem de rejeição garante que a distribuição final seja idêntica à execução do grande modelo sozinho – velocidade sem perda de qualidade.

Visão Técnica

O truque principal é um teste de amostragem de rejeição modificado. Para cada token elaborado, a probabilidade do modelo alvo é comparada com a do modelo preliminar. Se o alvo atribuir probabilidade igual ou superior, o token é aceito; caso contrário, é aceito com probabilidade igual à razão e, na rejeição, um token corrigido é amostrado a partir de uma distribuição residual ajustada. Essa matemática torna o resultado provavelmente equivalente à amostragem direta do modelo grande.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro dos modelos preliminares de decodificação especulativa

Espere que os modelos preliminares se tornem infraestrutura padrão em servidores de inferência como vLLM e TensorRT-LLM. Variantes de autoespeculação (Medusa, EAGLE) eliminam totalmente o modelo de rascunho separado, adicionando cabeças de previsão leves, e o rascunho baseado em árvore verifica muitas continuações candidatas de uma só vez. À medida que as janelas de contexto crescem e os custos de serviço dominam, os redatores mais inteligentes e compatíveis com o modelo e a verificação consciente do hardware aumentarão as taxas de aceitação e o rendimento.

Implementação no mundo real

Anthropic, OpenAI e Google usam decodificação especulativa para reduzir a latência e o custo de veiculação em assistentes de bate-papo que atendem milhões de usuários.

O vLLM e o NVIDIA TensorRT-LLM fornecem decodificação especulativa integrada para que os auto-hosters possam acelerar as implantações do Llama ou Mistral.

Emparelhar um modelo de rascunho de 7B com um alvo de 70B (por exemplo, família Llama-3) para aproximadamente dobrar os tokens por segundo em uma única GPU.

As ferramentas de conclusão de código usam um pequeno modelo de rascunho para propor padrões que o modelo maior verifica, mantendo as sugestões rápidas no editor.

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Edições especulativas para modelos de código

Perguntas frequentes

What is Speculative Decoding Draft Models?

A decodificação especulativa usa um modelo de 'rascunho' pequeno e rápido para adivinhar vários tokens futuros que um modelo grande verifica em uma única passagem. Ele acelera a geração de texto 2 a 3x sem alterar a saída.

Qual é o papel principal do modelo “rascunho” na decodificação especulativa?

O modelo de rascunho pequeno adivinha de forma barata os próximos tokens, que o modelo de destino grande verifica em uma única passagem paralela.

Por que a verificação de vários tokens elaborados de uma só vez economiza tempo?

A geração está ligada à memória; verificar vários tokens em uma passagem em lote é quase tão barato quanto uma etapa, portanto, as execuções aceitas são quase gratuitas.

O que acontece com os tokens elaborados após o primeiro token rejeitado pelo modelo de destino?

A aceitação prossegue até a primeira discordância; esse token é corrigido e todos os tokens elaborados subsequentemente são jogados fora.

Como a decodificação especulativa garante que a qualidade da saída não seja degradada?

Um teste de amostragem de rejeição modificado garante que a distribuição final do token corresponda à amostragem diretamente do modelo de destino.

Qual destas é uma abordagem de “autoespeculação” que evita um rascunho de modelo separado?

Medusa e EAGLE adicionam cabeças de previsão extras leves ao modelo principal para que ele possa elaborar seus próprios tokens futuros.