Une étude révèle que les modèles de vision et de langage ont atteint un plafond de classe de modèle en quelques étapes d'adaptation
Une nouvelle étude arXiv rapporte que le réglage du mélange entre les prototypes de texte et d'image n'est pas la principale limite à la précision du modèle de langage de vision en quelques plans. Dans des expériences portant sur 4 800 cellules d’évaluation, les sondes linéaires sans validation ont surpassé même un mélange sélectionné avec les informations de l’ensemble de test.