GUIA Técnico

Lote Contínuo

O lote contínuo é uma técnica de atendimento que adiciona e remove solicitações de um lote em execução, token por token, em vez de aguardar a conclusão de um lote fixo inteiro.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro do lote contínuo
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.

Mergulho profundo

As GPUs são mais rápidas quando processam muitas solicitações juntas em lote. A abordagem ingênua, lote estático, agrupa um conjunto fixo de solicitações, executa todas elas até a conclusão e, em seguida, inicia o próximo lote. O problema: as saídas do modelo de linguagem variam muito em comprimento, então solicitações curtas terminam mais cedo e seus slots ficam ociosos enquanto o lote espera pelo mais longo, desperdiçando ciclos de GPU e atrasando novas chegadas. O lote contínuo (também chamado de lote em andamento ou em nível de iteração, popularizado pelo artigo Orca e usado em vLLM, TensorRT-LLM e TGI) opera na granularidade de uma única etapa de decodificação. Depois que cada token é gerado, as sequências concluídas saem do lote e as solicitações recém-chegadas são inseridas imediatamente. Isso mantém o lote cheio e a GPU saturada, muitas vezes aumentando o rendimento várias vezes com menor latência para usuários em espera.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro do lote contínuo

O lote contínuo agora é padrão na produção LLM. Trabalhos futuros refinam o agendador: separando a fase de pré-preenchimento de computação pesada da fase de decodificação mais leve (desagregação), pré-preenchimento fragmentado para evitar paralisação na decodificação, políticas de prioridade e justiça para cargas de trabalho mistas e acoplamento mais rígido com decodificação especulativa para que vários tokens de rascunho sejam validados por etapa. O objetivo é reduzir o máximo de tokens por segundo por GPU e, ao mesmo tempo, manter a latência de resposta individual baixa e previsível.

Implementação no mundo real

Uma API de bate-papo que admite mensagens de usuários recém-chegadas no lote em execução imediatamente, em vez de colocá-las na fila para o próximo lote

Retirar uma resposta curta concluída no meio do lote e preencher seu slot para que a GPU nunca fique ociosa esperando por uma geração longa

Combinando lote contínuo com PagedAttention do vLLM para inserir e remover sequências de maneira barata em cada etapa de decodificação

Um serviço de conclusão de código que sustenta altos tokens por segundo em tráfego intermitente e de comprimento variável, mantendo o lote cheio

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continuous Batching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Continuous Batching?

O lote contínuo é uma técnica de atendimento que adiciona e remove solicitações de um lote em execução, token por token, em vez de aguardar a conclusão de um lote fixo inteiro. Ele mantém a GPU constantemente ocupada e aumenta drasticamente o número de usuários que um modelo de IA pode atender ao mesmo tempo.

Qual é o principal ponto fraco do lote estático (fixo) para veiculação LLM?

Como os comprimentos de saída variam, as sequências finalizadas ficam ociosas até que a mais lenta seja concluída, desperdiçando ciclos de GPU e atrasando novas solicitações.

Com que granularidade o lote contínuo adiciona e remove solicitações?

O lote contínuo (nível de iteração) atualiza o conjunto ativo após cada etapa de decodificação, de modo que ele opera token por token, em vez de por solicitação inteira.

Quando uma sequência termina no meio do lote em lote contínuo, o que acontece com seu slot?

As sequências finalizadas são removidas e as solicitações em espera são inseridas imediatamente, mantendo o lote cheio e a GPU ocupada.

Qual técnica combina naturalmente com lotes contínuos para tornar barata a inserção/remoção de sequências?

PagedAttention armazena o cache KV de cada sequência em blocos independentes, portanto, adicionar ou remover uma sequência no meio do voo não perturba a memória de outras pessoas.

Qual artigo de pesquisa é comumente creditado por popularizar o lote em nível de iteração (contínuo)?

O artigo da Orca introduziu o agendamento em nível de iteração, e a ideia foi adotada por sistemas de atendimento como vLLM, TGI e TensorRT-LLM.