Studiul constată că modelele în limbajul vizual ating un plafon de clasă de model într-o adaptare cu câteva fotografii
Un nou studiu arXiv raportează că reglarea amestecului dintre prototipurile de text și imagine nu este limita principală a acurateței modelului în limbajul vizual pentru câteva fotografii. În experimentele care au cuprins 4.800 de celule de evaluare, sondele liniare fără validare au depășit chiar și un amestec selectat cu informații despre set de testare.