GUÍA Técnica

Publicación desagregada de precarga y decodificación

Una arquitectura de servicio que divide la inferencia de modelos de lenguaje grandes en dos fases separadas (precarga y decodificación) y las ejecuta en diferentes grupos de GPU.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro del servicio de precarga y decodificación desagregado
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

It matters because these two phases have opposite hardware appetites, and forcing them onto the same machines wastes capacity and hurts latency.

Buceo profundo

Cuando un LLM responde, funciona en dos etapas. Prefill lee el mensaje completo a la vez y crea la caché de valores clave (KV); se trata de una gran explosión paralela vinculada a la computación que satura las unidades matemáticas de la GPU. Luego, Decode genera tokens uno a la vez, y en cada paso se lee todo el caché KV: un goteo de computación ligera y limitado por el ancho de banda de la memoria. Al ejecutarse juntos, un prellenado largo detiene la decodificación de todos (bloqueo de cabecera de línea) y el procesamiento por lotes de los dos crea interferencia. La desagregación coloca el precarga en un grupo de GPU y la decodifica en otro, transfiriendo el caché KV entre ellos a través de interconexiones rápidas como NVLink o InfiniBand. Cada grupo se ajusta y escala de forma independiente, lo que mejora el buen rendimiento, suaviza la latencia de cola y permite a los operadores alcanzar objetivos ajustados de tiempo para el primer token y de tiempo por token de salida simultáneamente.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro del servicio de precarga y decodificación desagregado

Espere que la desagregación se convierta en una opción predeterminada en las pilas de producción. Sistemas como DistServe, Splitwise y Mooncake lo popularizaron, y vLLM y NVIDIA Dynamo ahora ofrecen modos desagregados. Las investigaciones están impulsando optimizaciones de transferencia de caché KV, agrupación y reutilización de caché en todas las solicitudes, reequilibrio dinámico de las proporciones de precarga/decodificación bajo tráfico cambiante y una integración más estrecha con el almacenamiento en caché de prefijos y el precarga fragmentado. A medida que las ventanas de contexto crecen hasta alcanzar los millones de tokens, separar estas fases se vuelve cada vez más esencial para un servicio rentable y de baja latencia.

Implementación en el mundo real

Un asistente de chat enruta mensajes largos de documentos a un clúster de precarga con gran capacidad informática y luego transmite las respuestas desde un clúster de decodificación optimizado para memoria para mantener la latencia de escritura sin problemas.

NVIDIA Dynamo y vLLM permiten a los operadores implementar grupos de trabajadores de precarga y decodificación separados para que una ráfaga de indicaciones largas no congele a las generaciones en curso.

Mooncake (utilizado por Kimi de Moonshot AI) desagrega el prellenado y la decodificación y agrega un grupo de caché KV distribuido para eliminar el recálculo rápido redundante a escala.

Un servicio de finalización de código dedica un pequeño grupo de precarga para indicaciones breves y un gran grupo de decodificación, ya que la mayor parte del costo proviene de la transmisión de muchos tokens de salida.

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Disaggregated Prefill and Decode Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Disaggregated Prefill and Decode Serving?

Una arquitectura de servicio que divide la inferencia de modelos de lenguaje grandes en dos fases separadas (precarga y decodificación) y las ejecuta en diferentes grupos de GPU. Es importante porque estas dos fases tienen apetitos de hardware opuestos y forzarlas a instalarse en las mismas máquinas desperdicia capacidad y perjudica la latencia.

¿Cuál es la razón principal del hardware para separar el precarga y la decodificación en diferentes grupos de GPU?

Prefill procesa todo el mensaje en paralelo y satura la computación, mientras que la decodificación lee el caché KV en cada paso y está limitada por el ancho de banda de la memoria, apetitos opuestos que justifican grupos separados y sintonizados de forma independiente.

¿Qué estructura de datos se debe transferir de los trabajadores de prellenado a los trabajadores de decodificación?

Prefill crea la caché KV para el mensaje; La decodificación necesita que ese caché continúe generándose, por lo que el caché se envía a través de una interconexión rápida al grupo de decodificación.

¿Qué problema reduce específicamente la desagregación en una configuración de GPU compartida?

En GPU compartidas, una ráfaga de precarga larga puede bloquear los pasos de decodificación en curso; separarlos evita esa interferencia y estabiliza la latencia de la cola.

¿Por qué el precargado se puede realizar por lotes de forma agresiva pero la decodificación se beneficia de diferentes ajustes?

Prefill procesa todos los tokens de aviso juntos, por lo que lotes más grandes alimentan bien los núcleos tensoriales; decode genera un token a la vez y está controlado por la memoria, por lo que escala de manera diferente.

¿Qué interconexiones se utilizan normalmente para mover la caché KV entre grupos desagregados?

Se necesitan enlaces de alto ancho de banda y baja latencia como NVLink (intra-nodo) e InfiniBand (entre-nodo) para que la transferencia de caché KV no se convierta en el nuevo cuello de botella.