Badanie wykazało, że modele języka wizyjnego trafiają w sufit klasy modelowej w adaptacji w kilku strzałach
Nowe badanie arXiv donosi, że dostrojenie połączenia prototypów tekstu i obrazu nie jest głównym ograniczeniem dokładności modelu wizyjnego w kilku ujęciach. W eksperymentach obejmujących 4800 komórek oceniających, niewymagające walidacji sondy liniowe uzyskały lepsze wyniki nawet od mieszanki wybranej na podstawie informacji o zestawie testowym.