GUÍA Técnica

Atención paginada y vLLM

PagedAttention es una técnica de gestión de memoria que almacena la memoria caché de atención de un modelo de lenguaje en pequeños bloques reutilizables en lugar de en un gran fragmento contiguo.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de PagedAttention y vLLM
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

Buceo profundo

Cuando un modelo de lenguaje genera texto, mantiene una 'caché KV' (vectores de clave y valor) para cada token que ha visto, de modo que el siguiente token pueda atender al contexto completo. Tradicionalmente, cada solicitud reservaba una gran porción contigua de memoria GPU dimensionada para su longitud máxima posible, desperdiciando grandes cantidades cuando las secuencias eran más cortas o variaban en longitud. PagedAttention, presentado en el artículo vLLM de 2023 de UC Berkeley, toma prestada la idea de paginación de memoria virtual de los sistemas operativos: divide la caché KV en bloques de tamaño fijo que pueden vivir en cualquier lugar de la memoria y asignarse según demanda. Una tabla de búsqueda asigna posiciones de tokens lógicos a bloques físicos. Esto casi elimina la fragmentación de la memoria y permite compartir bloques, por ejemplo, entre múltiples salidas desde el mismo mensaje.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro de PagedAttention y vLLM

vLLM se ha convertido en una columna vertebral de inferencia de código abierto predeterminada y las ideas de PagedAttention ahora aparecen en la mayoría de las pilas de servicios. Espere un almacenamiento en caché de prefijos más profundo (reutilización de indicaciones del sistema en caché entre usuarios), precarga y decodificación desagregadas en máquinas separadas, políticas de desalojo más inteligentes y una estrecha integración con la cuantificación y la decodificación especulativa. A medida que las ventanas de contexto crecen hasta alcanzar los millones de tokens, la gestión eficiente de KV paginado se vuelve aún más central para mantener el servicio asequible.

Implementación en el mundo real

Alojamiento de una API LLM de código abierto donde vLLM atiende a muchos usuarios de chat simultáneos desde una GPU con alto rendimiento

Compartir un mensaje largo del sistema entre miles de solicitudes a través del almacenamiento en caché de prefijos para que se procese una vez, no repetidamente

Ejecutar una búsqueda de haz o múltiples finalizaciones de muestra que comparten bloques KV para el mensaje común mediante copia en escritura

Reducir el desperdicio de memoria de la GPU debido a la fragmentación para que un proveedor pueda incluir más sesiones simultáneas en el mismo hardware.

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is PagedAttention and vLLM?

PagedAttention es una técnica de gestión de memoria que almacena la memoria caché de atención de un modelo de lenguaje en pequeños bloques reutilizables en lugar de en un gran fragmento contiguo. Impulsa vLLM, un motor de servicio de código abierto que aumenta drásticamente la cantidad de solicitudes que puede manejar una sola GPU.

¿Qué almacena la 'caché KV' durante la generación de texto?

La caché KV contiene vectores de clave y valor para cada token anterior, lo que permite que el modelo atienda el contexto completo sin volver a calcularlo en cada paso.

¿Qué concepto de sistema operativo inspiró PagedAttention?

PagedAttention toma prestada la paginación de la memoria virtual: la caché KV se divide en páginas de tamaño fijo que pueden vivir en cualquier lugar, asignadas por una tabla de bloques.

¿Qué problema con la asignación de caché KV tradicional resuelve PagedAttention?

Reservar una gran losa contigua por solicitud, dimensionada para la longitud máxima, desperdiciaba enormes cantidades de memoria de GPU. La paginación asigna pequeños bloques según demanda, reduciendo drásticamente el desperdicio.

¿Cómo permite PagedAttention que varias salidas compartan memoria para un mensaje común?

Los prefijos idénticos (solicitudes compartidas o ramas de búsqueda de haces) hacen referencia a las mismas páginas físicas de KV y se copian solo cuando una rama diverge.

¿Dónde se desarrollaron originalmente vLLM y PagedAttention?

vLLM y el algoritmo PagedAttention surgieron de UC Berkeley en un artículo de 2023 y rápidamente se convirtieron en un motor de servicio de código abierto ampliamente utilizado.