A continuaciónSiguiente guía
Continuous Training and Automated Retraining
Técnico
GUÍA Técnica
El procesamiento por lotes continuo es una técnica de entrega que agrega y elimina solicitudes de un lote en ejecución, token por token, en lugar de esperar a que finalice un lote fijo completo.
Mantiene la GPU constantemente ocupada y aumenta drásticamente la cantidad de usuarios que un modelo de IA puede atender a la vez.
Las GPU son más rápidas cuando procesan muchas solicitudes juntas en un lote. El enfoque ingenuo, el procesamiento por lotes estático, agrupa un conjunto fijo de solicitudes, las ejecuta todas hasta su finalización y luego inicia el siguiente lote. El problema: las salidas del modelo de lenguaje varían enormemente en longitud, por lo que las solicitudes cortas finalizan antes y sus ranuras permanecen inactivas mientras el lote espera la más larga, desperdiciando ciclos de GPU y retrasando las nuevas llegadas. El procesamiento por lotes continuo (también llamado procesamiento por lotes en vuelo o a nivel de iteración, popularizado por el artículo Orca y utilizado en vLLM, TensorRT-LLM y TGI) opera con la granularidad de un solo paso de decodificación. Después de generar cada token, las secuencias terminadas salen del lote y las solicitudes recién llegadas se ingresan inmediatamente. Esto mantiene el lote lleno y la GPU saturada, lo que a menudo aumenta varias veces el rendimiento con una menor latencia para los usuarios en espera.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
El procesamiento por lotes continuo ahora es estándar en el servicio LLM de producción. El trabajo futuro perfecciona el programador: separar la fase de precarga de computación pesada de la fase de decodificación más ligera (desagregación), precarga fragmentada para evitar detener la decodificación, políticas de prioridad y equidad para cargas de trabajo mixtas y un acoplamiento más estrecho con la decodificación especulativa para que se validen múltiples borradores de tokens por paso. El objetivo es exprimir el máximo de tokens por segundo por GPU y al mismo tiempo mantener la latencia de respuesta individual baja y predecible.
Una API de chat que admite mensajes de usuarios recién llegados en el lote en ejecución inmediatamente en lugar de ponerlos en cola para el siguiente lote.
Expulsar una respuesta corta completa a mitad del lote y rellenar su ranura para que la GPU nunca se quede inactiva esperando una generación larga
Combinando procesamiento por lotes continuo con PagedAttention de vLLM para insertar y eliminar secuencias de forma económica en cada paso de decodificación
Un servicio de finalización de código que mantiene un alto número de tokens por segundo bajo un tráfico de longitud variable y en ráfagas manteniendo el lote lleno
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
El procesamiento por lotes continuo es una técnica de entrega que agrega y elimina solicitudes de un lote en ejecución, token por token, en lugar de esperar a que finalice un lote fijo completo. Mantiene la GPU constantemente ocupada y aumenta drásticamente la cantidad de usuarios que un modelo de IA puede atender a la vez.
Debido a que las longitudes de salida varían, las secuencias terminadas permanecen inactivas hasta que se completa la más lenta, desperdiciando ciclos de GPU y retrasando nuevas solicitudes.
El procesamiento por lotes continuo (a nivel de iteración) actualiza el conjunto activo después de cada paso de decodificación, por lo que funciona token por token en lugar de hacerlo por solicitud completa.
Las secuencias terminadas se desalojan y las solicitudes en espera se insertan inmediatamente, manteniendo el lote lleno y la GPU ocupada.
PagedAttention almacena el caché KV de cada secuencia en bloques independientes, por lo que agregar o eliminar una secuencia en pleno proceso no perturba la memoria de los demás.
El artículo de Orca introdujo la programación a nivel de iteración y la idea fue adoptada por sistemas de servicio como vLLM, TGI y TensorRT-LLM.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Continuous Training and Automated Retraining
Técnico