GUÍA Técnica

Lotes continuos

El procesamiento por lotes continuo es una técnica de entrega que agrega y elimina solicitudes de un lote en ejecución, token por token, en lugar de esperar a que finalice un lote fijo completo.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro del procesamiento por lotes continuo
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

Mantiene la GPU constantemente ocupada y aumenta drásticamente la cantidad de usuarios que un modelo de IA puede atender a la vez.

Buceo profundo

Las GPU son más rápidas cuando procesan muchas solicitudes juntas en un lote. El enfoque ingenuo, el procesamiento por lotes estático, agrupa un conjunto fijo de solicitudes, las ejecuta todas hasta su finalización y luego inicia el siguiente lote. El problema: las salidas del modelo de lenguaje varían enormemente en longitud, por lo que las solicitudes cortas finalizan antes y sus ranuras permanecen inactivas mientras el lote espera la más larga, desperdiciando ciclos de GPU y retrasando las nuevas llegadas. El procesamiento por lotes continuo (también llamado procesamiento por lotes en vuelo o a nivel de iteración, popularizado por el artículo Orca y utilizado en vLLM, TensorRT-LLM y TGI) opera con la granularidad de un solo paso de decodificación. Después de generar cada token, las secuencias terminadas salen del lote y las solicitudes recién llegadas se ingresan inmediatamente. Esto mantiene el lote lleno y la GPU saturada, lo que a menudo aumenta varias veces el rendimiento con una menor latencia para los usuarios en espera.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro del procesamiento por lotes continuo

El procesamiento por lotes continuo ahora es estándar en el servicio LLM de producción. El trabajo futuro perfecciona el programador: separar la fase de precarga de computación pesada de la fase de decodificación más ligera (desagregación), precarga fragmentada para evitar detener la decodificación, políticas de prioridad y equidad para cargas de trabajo mixtas y un acoplamiento más estrecho con la decodificación especulativa para que se validen múltiples borradores de tokens por paso. El objetivo es exprimir el máximo de tokens por segundo por GPU y al mismo tiempo mantener la latencia de respuesta individual baja y predecible.

Implementación en el mundo real

Una API de chat que admite mensajes de usuarios recién llegados en el lote en ejecución inmediatamente en lugar de ponerlos en cola para el siguiente lote.

Expulsar una respuesta corta completa a mitad del lote y rellenar su ranura para que la GPU nunca se quede inactiva esperando una generación larga

Combinando procesamiento por lotes continuo con PagedAttention de vLLM para insertar y eliminar secuencias de forma económica en cada paso de decodificación

Un servicio de finalización de código que mantiene un alto número de tokens por segundo bajo un tráfico de longitud variable y en ráfagas manteniendo el lote lleno

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Continuous Batching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

¿Qué es el procesamiento por lotes continuos?

El procesamiento por lotes continuo es una técnica de entrega que agrega y elimina solicitudes de un lote en ejecución, token por token, en lugar de esperar a que finalice un lote fijo completo. Mantiene la GPU constantemente ocupada y aumenta drásticamente la cantidad de usuarios que un modelo de IA puede atender a la vez.

¿Cuál es la principal debilidad del procesamiento por lotes estático (fijo) para la prestación de LLM?

Debido a que las longitudes de salida varían, las secuencias terminadas permanecen inactivas hasta que se completa la más lenta, desperdiciando ciclos de GPU y retrasando nuevas solicitudes.

¿Con qué granularidad el procesamiento por lotes continuo agrega y elimina solicitudes?

El procesamiento por lotes continuo (a nivel de iteración) actualiza el conjunto activo después de cada paso de decodificación, por lo que funciona token por token en lugar de hacerlo por solicitud completa.

Cuando una secuencia termina a mitad de lote en un lote continuo, ¿qué sucede con su ranura?

Las secuencias terminadas se desalojan y las solicitudes en espera se insertan inmediatamente, manteniendo el lote lleno y la GPU ocupada.

¿Qué técnica se combina naturalmente con el procesamiento por lotes continuo para abaratar la inserción/eliminación de secuencias?

PagedAttention almacena el caché KV de cada secuencia en bloques independientes, por lo que agregar o eliminar una secuencia en pleno proceso no perturba la memoria de los demás.

¿A qué trabajo de investigación se le atribuye comúnmente la popularización del procesamiento por lotes a nivel de iteración (continuo)?

El artículo de Orca introdujo la programación a nivel de iteración y la idea fue adoptada por sistemas de servicio como vLLM, TGI y TensorRT-LLM.