Usar un modelo de lenguaje para calificar o comparar resultados de otros modelos durante la evaluación.