Uma métrica de modelo de linguagem que mede o quão surpreso o modelo fica com os próximos tokens verdadeiros.