A seguirPróximo guia
Continuous Training and Automated Retraining
Técnico
GUIA Técnico
O lote contínuo é uma técnica de atendimento que adiciona e remove solicitações de um lote em execução, token por token, em vez de aguardar a conclusão de um lote fixo inteiro.
It keeps the GPU constantly busy and sharply increases how many users an AI model can serve at once.
As GPUs são mais rápidas quando processam muitas solicitações juntas em lote. A abordagem ingênua, lote estático, agrupa um conjunto fixo de solicitações, executa todas elas até a conclusão e, em seguida, inicia o próximo lote. O problema: as saídas do modelo de linguagem variam muito em comprimento, então solicitações curtas terminam mais cedo e seus slots ficam ociosos enquanto o lote espera pelo mais longo, desperdiçando ciclos de GPU e atrasando novas chegadas. O lote contínuo (também chamado de lote em andamento ou em nível de iteração, popularizado pelo artigo Orca e usado em vLLM, TensorRT-LLM e TGI) opera na granularidade de uma única etapa de decodificação. Depois que cada token é gerado, as sequências concluídas saem do lote e as solicitações recém-chegadas são inseridas imediatamente. Isso mantém o lote cheio e a GPU saturada, muitas vezes aumentando o rendimento várias vezes com menor latência para usuários em espera.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
O lote contínuo agora é padrão na produção LLM. Trabalhos futuros refinam o agendador: separando a fase de pré-preenchimento de computação pesada da fase de decodificação mais leve (desagregação), pré-preenchimento fragmentado para evitar paralisação na decodificação, políticas de prioridade e justiça para cargas de trabalho mistas e acoplamento mais rígido com decodificação especulativa para que vários tokens de rascunho sejam validados por etapa. O objetivo é reduzir o máximo de tokens por segundo por GPU e, ao mesmo tempo, manter a latência de resposta individual baixa e previsível.
Uma API de bate-papo que admite mensagens de usuários recém-chegadas no lote em execução imediatamente, em vez de colocá-las na fila para o próximo lote
Retirar uma resposta curta concluída no meio do lote e preencher seu slot para que a GPU nunca fique ociosa esperando por uma geração longa
Combinando lote contínuo com PagedAttention do vLLM para inserir e remover sequências de maneira barata em cada etapa de decodificação
Um serviço de conclusão de código que sustenta altos tokens por segundo em tráfego intermitente e de comprimento variável, mantendo o lote cheio
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
O lote contínuo é uma técnica de atendimento que adiciona e remove solicitações de um lote em execução, token por token, em vez de aguardar a conclusão de um lote fixo inteiro. Ele mantém a GPU constantemente ocupada e aumenta drasticamente o número de usuários que um modelo de IA pode atender ao mesmo tempo.
Como os comprimentos de saída variam, as sequências finalizadas ficam ociosas até que a mais lenta seja concluída, desperdiçando ciclos de GPU e atrasando novas solicitações.
O lote contínuo (nível de iteração) atualiza o conjunto ativo após cada etapa de decodificação, de modo que ele opera token por token, em vez de por solicitação inteira.
As sequências finalizadas são removidas e as solicitações em espera são inseridas imediatamente, mantendo o lote cheio e a GPU ocupada.
PagedAttention armazena o cache KV de cada sequência em blocos independentes, portanto, adicionar ou remover uma sequência no meio do voo não perturba a memória de outras pessoas.
O artigo da Orca introduziu o agendamento em nível de iteração, e a ideia foi adotada por sistemas de atendimento como vLLM, TGI e TensorRT-LLM.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Continuous Training and Automated Retraining
Técnico