การศึกษาพบว่าโมเดลที่มีวิสัยทัศน์และภาษามีขีดจำกัดในระดับโมเดลด้วยการปรับเปลี่ยนเพียงไม่กี่ขั้นตอน
การศึกษา arXiv ใหม่รายงานว่าการปรับการผสมผสานระหว่างต้นแบบข้อความและรูปภาพไม่ใช่ข้อจำกัดหลักในเรื่องความแม่นยำของโมเดลภาษาการมองเห็นแบบไม่กี่ช็อต ในการทดลองที่ครอบคลุมเซลล์ประเมินผล 4,800 เซลล์ โพรบเชิงเส้นที่ปราศจากการตรวจสอบความถูกต้องมีประสิทธิภาพเหนือกว่าแม้แต่การผสมผสานที่เลือกกับข้อมูลชุดทดสอบ