Apa yang berlaku
Laporan teknikal yang diserahkan kepada arXiv pada 25 Ogos menerangkan WeMM-, sebuah keluarga model pembenaman multimodal yang dibangunkan untuk teks, imej, video, dokumen visual dan input multimodal bersilang. Laporan itu mengatakan model itu tersedia dengan pemberat dan kod yang dikeluarkan dan telah digunakan di beberapa aplikasi carian dan pengesyoran WeChat.
Laporan itu memperkenalkan WeMM- sebagai keluarga model benam multimodal universal. Menurut abstrak, model mewakili teks, imej, video, dokumen visual dan input multimodal yang dijalin sewenang-wenangnya dalam ruang kongsi, dengan dimensi output yang fleksibel. Keluarga itu termasuk varian 2 bilion, 4 bilion dan 9 bilion parameter. Sumber yang dibekalkan tidak memberikan butiran teknikal lanjut tentang seni bina model, bahasa yang disokong atau konfigurasi output yang tepat.
Proses latihan yang dilaporkan mempunyai dua peringkat. Yang pertama ialah peringkat penjajaran multimodal berskala besar. Yang kedua ialah peringkat pemurnian menggunakan data yang dipilih susun, penyeliaan perkaitan yang terperinci dan pemindahan pengetahuan berskala silang. Penerangan ini menunjukkan bahawa sistem telah dioptimumkan bukan sahaja untuk menyambungkan jenis media yang berbeza, tetapi juga untuk membezakan tahap perkaitan antara item yang diambil. Sumber tidak mengenal pasti set data latihan, asalnya atau jumlah data yang digunakan.
Penulis melaporkan prestasi terkemuka pada pelbagai penanda aras awam. Dalam perbandingan khusus yang diserlahkan dalam abstrak, varian 2B dikatakan mengatasi garis dasar sumber terbuka 8B yang terkemuka sebelum ini pada MMEB-v2. Laporan itu juga mendakwa bahawa varian 9B mencapai skor terkini keseluruhan baharu sebanyak 80.6. Ini adalah tuntutan yang dibuat oleh laporan itu; halaman pendaratan arXiv yang dibekalkan tidak termasuk jadual penanda aras, syarat perbandingan atau pengesahan bebas.
Laporan itu juga menerangkan ujian praktikal dalam aplikasi WeChat. Ia mengatakan WeMM- menghasilkan keuntungan yang besar pada penanda aras dalaman 26 tugasan, meningkatkan hasil secara konsisten merentas 14 ujian A/B dalam talian dan digunakan secara berskala dalam aplikasi pengesyoran dan carian termasuk Saluran WeChat, Akaun Rasmi, Momen dan perkhidmatan e-dagang. Pengarang mengatakan bahawa berat model dan kod telah dikeluarkan, walaupun sumber yang dibekalkan tidak menyatakan lesen atau memberikan kandungan keluaran secara terperinci.
Mengapa ia penting
Laporan itu membentangkan keluaran model AI yang terikat dengan tuntutan penanda aras awam dan penggunaan aplikasi berskala besar. Jika diterbitkan semula secara bebas, keputusannya yang dilaporkan mungkin berkaitan dengan pembangun yang memilih antara sistem benam berbilang mod yang lebih besar dan lebih kecil untuk mendapatkan semula, pengesyoran, pengelasan dan aplikasi agen.
Pembenaman multimodal diterangkan dalam laporan sebagai komponen teras sistem AI moden. Tujuan mereka adalah untuk mewakili bentuk kandungan yang berbeza dalam ruang bersama supaya sistem boleh membandingkan, mendapatkan semula, mengesyorkan atau mengelaskannya. Itu menjadikan penyelidikan ini relevan dengan infrastruktur di bawah produk carian dan pengesyoran, bukannya hanya pada demonstrasi kendiri atau penanda aras model yang sempit.
Keputusan 2B-berbanding-8B yang dilaporkan berpotensi signifikan kerana ia menunjukkan model yang lebih kecil mengatasi garis dasar sumber terbuka yang lebih besar pada penilaian yang disebut. Jika perbandingan itu adil dan boleh dihasilkan semula, model yang lebih kecil boleh memberi pembangun pilihan lain apabila mengimbangi kualiti dengan memori, kapasiti penyajian dan kerumitan penggunaan. Sumber tidak melaporkan kependaman, keperluan perkakasan, penggunaan tenaga atau jumlah kos operasi, jadi ia tidak mewujudkan faedah tersebut.
Penggunaan yang dituntut merentas berbilang perkhidmatan WeChat memberikan laporan dimensi praktikal. Skor penanda aras luar talian tidak semestinya diterjemahkan kepada hasil yang lebih baik dalam produk langsung, di mana pengedaran data, corak trafik dan kekangan sistem boleh berbeza. Penanda aras 26 tugasan yang dilaporkan dan ujian 14 A/B mencadangkan usaha untuk mengukur prestasi aplikasi, tetapi sumber yang dibekalkan tidak memberikan angka peningkatan mutlak, saiz sampel, kepentingan statistik atau butiran tentang cara ujian dijalankan.
Pengeluaran berat model dan kod boleh meluaskan akses kepada penyelidikan pembenaman multimodal dan membolehkan penyelidik lain menguji dakwaan yang dilaporkan. Keterbukaan itu mungkin berguna untuk perbandingan dengan sistem lain dan untuk membina semula, pengesyoran atau aliran kerja agen. Nilai awamnya bergantung pada lesen sebenar, kesempurnaan keluaran, dokumentasi, kebolehulangan dan asal dan hak penggunaan data latihan, tiada satu pun daripadanya ditentukan oleh halaman yang dibekalkan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Tuntutan pusat masih memerlukan penelitian terhadap kertas penuh, artifak yang dikeluarkan dan butiran penilaian. Perkara yang tidak diketahui penting termasuk lesen, sumber data latihan, metodologi penanda aras, keuntungan mutlak dalam ujian dalam talian, skala penggunaan, kos operasi dan sama ada pengguna bebas boleh menghasilkan semula hasil yang dilaporkan di luar ekosistem WeChat.
Keutamaan pertama ialah pengesahan penilaian awam. Pembaca harus mencari keputusan penuh MMEB-v2, identiti dan konfigurasi garis dasar 8B, pemisahan set data, metrik, gesaan penilaian atau prapemprosesan dan sama ada semua model telah diuji dalam keadaan yang setanding. Skor tajuk 80.6 harus ditafsirkan bersama hasil setiap tugas, kerana skor keseluruhan boleh menyembunyikan kelemahan pada modaliti atau kes penggunaan tertentu.
Tuntutan dalam talian menjamin pelaporan yang sama khusus. Bahan susulan hendaklah mendedahkan takrifan 26 tugas dalaman, trafik dan tempoh masa yang diliputi oleh 14 ujian A/B, saiz kesan yang diukur, rawatan statistik dan sebarang pertukaran dalam kependaman, kebolehpercayaan atau penggunaan sumber. Sumber itu berkata model itu digunakan secara berskala tetapi tidak mengukur pengguna, permintaan, wilayah atau bahagian perkhidmatan WeChat yang berkaitan yang terjejas.
Keluaran itu sendiri harus diperiksa untuk berat yang boleh digunakan, kod sumber, dokumentasi dan lesen yang jelas. Pembangun juga perlu mengetahui format input dan bahasa yang disokong, cara dimensi output fleksibel dilaksanakan, perkakasan yang diperlukan dan sama ada keluaran itu boleh digunakan secara komersial atau hanya untuk penyelidikan. Sumber yang dibekalkan tidak menjawab soalan-soalan ini.
Ujian bebas harus memeriksa sama ada keuntungan yang dilaporkan digeneralisasikan di luar data WeChat dan penanda aras pilihan pengarang. Semakan berguna akan termasuk perolehan alih bahasa dan domain, pertanyaan teks dan imej bercampur, pengendalian dokumen visual, perwakilan video dan kes kegagalan yang melibatkan padanan silang mod yang tidak relevan atau mengelirukan. Oleh kerana laporan itu menyebut sistem agen sebagai kawasan aplikasi, kerja masa hadapan juga harus menjelaskan bagaimana ralat pembenaman boleh menjejaskan keputusan automatik hiliran, sambil menyedari bahawa sumber yang dibekalkan tidak melaporkan penilaian keselamatan.