Cuestionario vinculado a una guía · duro Nivel
Prueba de optimización de inferencia de IA
Acelere el servicio de LLM con caché KV, decodificación especulativa, PagedAttention, procesamiento por lotes continuo y cuantificación de 4 bits, y por qué la decodificación está limitada a la memoria.
Pregunta 1 de 6