Cuestionario vinculado a una guía · duro Nivel

Prueba de optimización de inferencia de IA

Acelere el servicio de LLM con caché KV, decodificación especulativa, PagedAttention, procesamiento por lotes continuo y cuantificación de 4 bits, y por qué la decodificación está limitada a la memoria.

Rutas de guía relacionadasOptimización de inferencia de IA
Pregunta 1 de 6

During autoregressive LLM generation, what does the KV cache store?