Apa yang berlaku
Sebuah kertas kerja mengkaji kaedah penyesuaian beberapa tangkapan untuk model bahasa penglihatan yang menggabungkan prototaip teks tangkapan sifar dengan ciri min set kecil imej berlabel. Penulis melaporkan bahawa nisbah campuran optimum secara teorinya menganggarkan ralat prototaip dan bukannya prestasi pengelasan, manakala probe linear tanpa pengesahan boleh mengatasi prestasi walaupun campuran oracle.
Makalah ini mengkaji keluarga kaedah penyesuaian beberapa pukulan untuk model bahasa penglihatan. Kaedah ini mengelaskan imej menggunakan gabungan cembung dua perwakilan kelas: prototaip teks tangkapan sifar dan ciri min yang dikira daripada imej berlabel K. Nisbah campuran tunggal mengawal jumlah berat yang diterima oleh setiap perwakilan. Menurut pengarang, nisbah itu sering ditala pada label yang ditahan dan, dalam beberapa kes, terus pada set ujian. Kajian itu menanyakan tiga soalan berkaitan: apakah nisbah yang meminimumkan ralat prototaip, sama ada nisbah boleh dianggarkan tanpa data pengesahan, dan sama ada mengoptimumkan nisbah adalah cara paling penting untuk meningkatkan prestasi.
Penulis memperoleh pekali bentuk tertutup untuk nisbah yang meminimumkan ralat min kuasa dua prototaip. Mereka menerangkan versi set sokongan bagi pekali ini sebagai anggaran pengecutan James-Stein bahagian positif terhadap prototaip teks. Merentasi 4,800 sel yang meliputi sepuluh set data, lima tulang belakang, lima kiraan pukulan, lima biji rawak dan empat peringkat segera, kertas itu mengatakan nisbah bermotivasi secara teori ini adalah anggaran yang boleh dipercayai bagi sasaran yang salah. Pada 950 sel peringkat primer di mana pekali ditakrifkan, ia mengekori nisbah oracle set ujian sebanyak 8.5 mata peratusan.
Kertas itu mengaitkan jurang itu kepada perbezaan antara pembinaan semula prototaip dan klasifikasi. Pekali berasaskan ralat menganggap jarak antara teks dan prototaip imej sebagai berat sebelah, tetapi penulis melaporkan bahawa 78% daripada jarak ini ialah offset bebas kelas yang sebahagian besarnya dibatalkan apabila pengelas mengambil keputusan arg-max. Akibatnya, pekali cenderung tepu hampir 1, dengan berkesan membuang teks sebelum dan menghampiri pengelas min kelas terdekat. Analisis kontrafaktual dalam kertas membataskan bahagian kerosakan prestasi yang disebabkan oleh mekanisme ini pada 26%.
Kajian ini juga menilai kaedah yang tidak memerlukan set pengesahan. Penilaian biarkan satu keluar pada set sokongan sahaja menghasilkan nisbah dalam 0.9 mata peratusan daripada campuran oracle, menurut kertas itu. Lebih penting lagi, probe linear tanpa pengesahan berprestasi lebih baik daripada campuran yang ditala oracle secara purata: pengarang melaporkan kelebihan 1.9 mata untuk CLAP dan kelebihan 1.5 mata untuk LP++. Pada empat atau lebih contoh berlabel bagi setiap kelas, keempat-empat garis dasar bebas pengesahan berada di atas oracle, dengan margin probe linear tidak termasuk sifar. Pengarang menyediakan kod, ciri cache dan rekod setiap sel melalui set data Hugging Face yang dipautkan.
Mengapa ia penting
Penemuan ini mencabar andaian umum bahawa prestasi beberapa tangkapan boleh dipertingkatkan dengan ketara dengan mencari campuran maklumat teks dan imej yang betul. Jika direplikasi, mereka mencadangkan bahawa pengamal harus lebih menumpukan perhatian pada model penyesuaian itu sendiri daripada penalaan nisbah yang mahal atau boleh dipersoalkan secara metodologi.
Mesej praktikal ialah nisbah campuran mungkin sasaran pengoptimuman sekunder. Seorang pengamal yang menyesuaikan model bahasa penglihatan dengan hanya beberapa contoh yang dilabelkan mungkin menghabiskan masa yang munasabah mencari keseimbangan terbaik antara prototaip kelas terbitan teks dan imej. Kajian ini melaporkan bahawa penalaan sedemikian boleh meninggalkan prestasi di atas meja kerana model pengadunan prototaip asas itu sendiri terlalu terhad. Peraturan penyesuaian yang lebih kukuh boleh menjadi lebih penting daripada memilih nilai terbaik dalam keluarga sempit peraturan itu.
Hasilnya juga bergantung pada metodologi penilaian. Memilih nisbah dengan label set ujian boleh menjadikan kaedah kelihatan lebih kukuh semasa menggunakan maklumat yang tidak akan tersedia dalam penggunaan sebenar. Perbandingan kertas dengan oracle set ujian mendedahkan skala perbezaan itu, dan keputusan cuti satu keluar menawarkan alternatif tanpa pengesahan. Untuk pasukan yang bekerja dengan set data berlabel kecil, mengelakkan penalaan set ujian boleh menjadikan prestasi yang dilaporkan lebih boleh dipercayai dan mengurangkan risiko memilih kaedah yang bergantung pada maklumat yang tidak tersedia.
Keuntungan kuar linear yang dilaporkan adalah bermakna kerana ia membandingkan dengan rujukan yang luar biasa menguntungkan: gabungan yang nisbahnya dipilih dengan akses oracle untuk menguji prestasi. Menewaskan rujukan itu menunjukkan bahawa had pusat bukan sekadar pemilihan hiperparameter yang lemah. Pengarang membingkai ini sebagai siling dalam kelas model. Dari segi praktikal, penemuan menunjukkan kaedah penyesuaian yang mempelajari pemetaan yang lebih kaya daripada ciri bahasa penglihatan beku dan bukannya menganggap penyesuaian sebagai masalah interpolasi satu dimensi.
Kertas itu masih merupakan hasil penyelidikan, bukan bukti bahawa setiap penggunaan bahasa penglihatan harus segera menggantikan pengadunan prototaip dengan probe linear. Buktinya datang daripada eksperimen dan analisis yang diterangkan dalam satu pracetak, dan sumbernya tidak menetapkan cara kaedah tersebut bertindak dalam aplikasi kritikal keselamatan, di bawah peralihan pengedaran, dengan label bising atau di luar konfigurasi penanda aras yang diuji. Ia juga tidak menunjukkan bahawa probe linear adalah optimum merentas semua tetapan beberapa tangkapan. Had tersebut penting apabila menterjemah kelebihan penanda aras purata kepada keputusan operasi.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Soalan terbuka utama ialah sama ada kelebihan yang dilaporkan berada di luar sepuluh set data kertas, lima tulang belakang, peringkat segera dan reka bentuk penilaian. Pengeluaran semula bebas harus menguji model bahasa penglihatan tambahan, domain, kiraan kelas dan keadaan penggunaan, sambil menyemak sama ada keuntungan berterusan apabila label terhad atau pengagihan beralih.
Replikasi harus menjadi ujian pertama. Pengarang menyediakan kod, ciri cache dan rekod setiap sel mereka, yang mewujudkan laluan konkrit untuk penyelidik bebas untuk mengesahkan jurang 8.5 mata yang dilaporkan, hasil cuti satu keluar 0.9 mata dan kelebihan kuar linear. Pengeluaran semula harus mengekalkan perbezaan antara maklumat set sokongan, data pengesahan dan maklumat oracle set ujian. Ia juga harus melaporkan hasil setiap set data dan tulang belakang dan bukannya hanya bergantung pada purata, kerana keuntungan agregat boleh menyembunyikan kegagalan pada tugas tertentu.
Kerja selanjutnya harus menguji sama ada mekanisme offset bebas kelas berterusan merentas reka bentuk segera yang berbeza, taksonomi kelas dan domain imej. Kertas itu merangkumi empat peringkat segera dan lima tulang belakang, termasuk SigLIP, tetapi sumbernya tidak mengenal pasti setiap model atau set data dalam abstrak yang boleh dilihat. Oleh itu, tidak diketahui sama ada perhubungan yang sama berlaku untuk seni bina baharu, domain khusus, pengekod berbilang mod dengan sifat penjajaran berbeza atau tugas di mana sempadan kelas adalah sangat tidak linear.
Peranan kiraan pukulan patut diberi perhatian. Abstrak mengatakan bahawa keempat-empat garis dasar bebas pengesahan berada di atas oracle pada K lebih besar daripada atau sama dengan 4, tetapi ia tidak memberikan lengkung prestasi penuh untuk setiap kiraan pukulan atau menerangkan cara kaedah bertindak pada saiz sokongan terkecil. Kaedah yang lebih baik dengan empat atau lebih contoh setiap kelas mungkin tidak sama berguna apabila hanya satu contoh tersedia. Penilaian masa depan harus menjadikan rejim data rendah tersebut jelas dan mengukur kepekaan terhadap pemilihan benih dan kualiti label.
Akhir sekali, penyelidik dan pengamal harus melihat bukti di luar klasifikasi penanda aras. Sumber semasa memfokuskan pada penyesuaian beberapa tangkapan model bahasa penglihatan dan melaporkan prestasi melalui prototaip dan perbandingan pengelas. Ia tidak mewujudkan kesan pada penentukuran, keteguhan, keadilan, pengecaman set terbuka, kependaman atau penggunaan memori. Sifat tersebut boleh menentukan sama ada probe linear bebas pengesahan sesuai untuk aplikasi sebenar. Sehingga bukti sedemikian wujud, kesimpulan yang disokong paling kukuh adalah lebih sempit: dalam tetapan yang diuji, menambah baik model penyesuaian kelihatan lebih menjanjikan daripada mengoptimumkan nisbah gabungan prototaip tunggal.