CoVA-SFT dataset syftar till att lära multimodal AI att resonera genom visuella abstraktioner
Forskare introducerar CoVA-SFT, en datauppsättning med 51 900 multimodala exempel och mer än 222 000 resonemangssteg, och rapporterar att finjusterade modeller mer än fördubblade prestandan för sammanflätade tankekedjans baslinjer på dess följeslagare.