Исследование показывает, что модели на языке видения достигают потолка модельного класса при адаптации за несколько кадров
Новое исследование arXiv сообщает, что настройка сочетания прототипов текста и изображений не является основным ограничением точности модели визуального языка, состоящей из нескольких кадров. В экспериментах, охватывающих 4800 оценочных ячеек, линейные датчики, не требующие проверки, превзошли даже смесь, выбранную с использованием информации тестового набора.