Наборът от данни CoVA-SFT има за цел да научи мултимодалния AI да разсъждава чрез визуални абстракции
Изследователите представят CoVA-SFT, набор от данни от 51 900 мултимодални примера и повече от 222 000 стъпки за разсъждение, съобщавайки, че фино настроените модели повече от удвоиха производителността на базовите линии на преплетени вериги от мисли в съпътстващия бенчмарк.