Questionário vinculado ao guia · Médio Nível

Teste de roteamento de inferência e balanceamento de carga LLM

Checks replica and model routing, cache affinity, live telemetry, variable token cost and latency-aware goodput for LLM inference.

Pergunta 1 de 8

Por que o round-robin simples costuma ser uma estratégia de balanceamento de carga ruim para inferência de LLM?