Дослідження показує, що моделі візуальної мови досягають максимальної межі модельного класу за кілька кадрів адаптації
У новому дослідженні arXiv повідомляється, що налаштування поєднання прототипів тексту та зображення не є основним обмеженням точності візуально-мовної моделі для кількох знімків. В експериментах, які охоплювали 4800 клітинок оцінки, лінійні зонди без перевірки перевершили навіть суміш, вибрану з інформацією про тестовий набір.