Estudo descobre que modelos de linguagem visual atingiram o teto da classe de modelo em adaptação de poucas fotos
Um novo estudo arXiv relata que ajustar a combinação entre protótipos de texto e imagem não é o principal limite para a precisão do modelo de linguagem de visão em poucas tomadas. Em experimentos abrangendo 4.800 células de avaliação, as sondas lineares sem validação superaram até mesmo uma combinação selecionada com informações do conjunto de testes.