A continuaciónSiguiente guía
Privacidad diferencial
Técnico
GUÍA Técnica
PagedAttention es una técnica de gestión de memoria que almacena la memoria caché de atención de un modelo de lenguaje en pequeños bloques reutilizables en lugar de en un gran fragmento contiguo.
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
Cuando un modelo de lenguaje genera texto, mantiene una 'caché KV' (vectores de clave y valor) para cada token que ha visto, de modo que el siguiente token pueda atender al contexto completo. Tradicionalmente, cada solicitud reservaba una gran porción contigua de memoria GPU dimensionada para su longitud máxima posible, desperdiciando grandes cantidades cuando las secuencias eran más cortas o variaban en longitud. PagedAttention, presentado en el artículo vLLM de 2023 de UC Berkeley, toma prestada la idea de paginación de memoria virtual de los sistemas operativos: divide la caché KV en bloques de tamaño fijo que pueden vivir en cualquier lugar de la memoria y asignarse según demanda. Una tabla de búsqueda asigna posiciones de tokens lógicos a bloques físicos. Esto casi elimina la fragmentación de la memoria y permite compartir bloques, por ejemplo, entre múltiples salidas desde el mismo mensaje.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
vLLM se ha convertido en una columna vertebral de inferencia de código abierto predeterminada y las ideas de PagedAttention ahora aparecen en la mayoría de las pilas de servicios. Espere un almacenamiento en caché de prefijos más profundo (reutilización de indicaciones del sistema en caché entre usuarios), precarga y decodificación desagregadas en máquinas separadas, políticas de desalojo más inteligentes y una estrecha integración con la cuantificación y la decodificación especulativa. A medida que las ventanas de contexto crecen hasta alcanzar los millones de tokens, la gestión eficiente de KV paginado se vuelve aún más central para mantener el servicio asequible.
Alojamiento de una API LLM de código abierto donde vLLM atiende a muchos usuarios de chat simultáneos desde una GPU con alto rendimiento
Compartir un mensaje largo del sistema entre miles de solicitudes a través del almacenamiento en caché de prefijos para que se procese una vez, no repetidamente
Ejecutar una búsqueda de haz o múltiples finalizaciones de muestra que comparten bloques KV para el mensaje común mediante copia en escritura
Reducir el desperdicio de memoria de la GPU debido a la fragmentación para que un proveedor pueda incluir más sesiones simultáneas en el mismo hardware.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
PagedAttention es una técnica de gestión de memoria que almacena la memoria caché de atención de un modelo de lenguaje en pequeños bloques reutilizables en lugar de en un gran fragmento contiguo. Impulsa vLLM, un motor de servicio de código abierto que aumenta drásticamente la cantidad de solicitudes que puede manejar una sola GPU.
La caché KV contiene vectores de clave y valor para cada token anterior, lo que permite que el modelo atienda el contexto completo sin volver a calcularlo en cada paso.
PagedAttention toma prestada la paginación de la memoria virtual: la caché KV se divide en páginas de tamaño fijo que pueden vivir en cualquier lugar, asignadas por una tabla de bloques.
Reservar una gran losa contigua por solicitud, dimensionada para la longitud máxima, desperdiciaba enormes cantidades de memoria de GPU. La paginación asigna pequeños bloques según demanda, reduciendo drásticamente el desperdicio.
Los prefijos idénticos (solicitudes compartidas o ramas de búsqueda de haces) hacen referencia a las mismas páginas físicas de KV y se copian solo cuando una rama diverge.
vLLM y el algoritmo PagedAttention surgieron de UC Berkeley en un artículo de 2023 y rápidamente se convirtieron en un motor de servicio de código abierto ampliamente utilizado.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Privacidad diferencial
Técnico