PANDUAN Syarikat

LAION dan Set Data Terbuka

LAION ialah organisasi bukan untung Jerman yang mengeluarkan set data teks imej terbuka besar-besaran, yang paling terkenal LAION-5B, yang menyemarakkan latihan model generatif terbuka seperti Stable Diffusion.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it made web-scale multimodal data freely available to researchers outside large corporations.

Menyelam dalam

LAION (Rangkaian Terbuka Kecerdasan Buatan Berskala Besar) ialah organisasi bukan untung Jerman yang diasaskan pada 2021 untuk mendemokrasikan penyelidikan pembelajaran mesin dengan mengeluarkan set data terbuka yang besar. Keluaran yang paling terkenal, LAION-5B, mengandungi kira-kira 5.85 bilion pasangan teks imej yang ditapis daripada data web Common Crawl menggunakan model CLIP OpenAI untuk mengekalkan pasangan di mana kapsyen dan imej sejajar. Yang penting, LAION tidak mengehoskan imej itu sendiri; ia mengedarkan URL dan metadata, jadi pengguna memuat turun imej daripada sumber web asal. Set data ini memainkan peranan penting dalam melatih Resapan Stabil dan model teks-ke-imej terbuka yang lain. LAION telah menghadapi penelitian yang serius: pada tahun 2023 penyelidik menemui pautan kepada imejan penyalahgunaan haram dalam set data, mendorong LAION untuk menghapuskannya, membersihkannya dan mengeluarkan semula versi yang lebih selamat, menyerlahkan risiko pengikisan skala web yang tidak ditapis.

Wawasan Teknikal

LAION-5B dibina dengan mengimbas Common Crawl untuk tag imej HTML dengan teks alt, kemudian menggunakan CLIP untuk mengira persamaan antara setiap imej dan kapsyennya. Pasangan di bawah ambang kesamaan kosinus telah dibuang, jadi hanya pasangan teks imej yang dipadankan secara munasabah yang tinggal. Set data dipecah mengikut bahasa dan termasuk pembenaman CLIP yang diprahitung, membolehkan carian persamaan pantas. Kerana hanya URL yang disimpan, reput pautan secara beransur-ansur merendahkan kebolehulangan dari semasa ke semasa.

Kesan Strategik

Strategi vendor

Peta jalan vendor mempengaruhi ciri yang boleh dibina oleh pasukan anda seterusnya.

Kos dan bajet

Terma komersial dan pilihan penggunaan mempengaruhi kos dan risiko jangka panjang.

Risiko dan keselamatan

Insentif syarikat membentuk keingkaran produk, postur keselamatan dan keterbukaan.

Masa Depan LAION dan Set Data Terbuka

Set data multimodal terbuka akan menghadapi tekanan yang semakin meningkat di sekitar hak cipta, persetujuan dan kandungan berbahaya, mendorong ke arah penapisan yang lebih kukuh, pengumpulan sedar pelesenan dan pendaftaran menarik diri. Pengeluaran semula kumpulan data yang telah dibersihkan oleh LAION menandakan peralihan ke arah pengauditan keselamatan sebagai langkah lalai. Jangkakan lebih banyak data sintetik atau berlesen, piawaian asal dan alat pengesanan. Ketegangan antara akses terbuka untuk makmal kecil dan risiko undang-undang dan etika data yang dikikis web akan menentukan fasa seterusnya pembinaan set data.

Pelaksanaan Dunia Sebenar

Melatih model teks-ke-imej terbuka seperti Stable Diffusion pada berbilion-bilion pasangan kapsyen imej

Membina dan menanda aras sistem pengambilan imej-teks gaya CLIP dan sistem klasifikasi tangkapan sifar

Menyelidik bias set data, keselamatan kandungan dan asal data pada skala web

Menapis subset mengikut bahasa, resolusi atau skor estetik untuk membuat set data penalaan halus khusus

Risiko & Pengawal

Pengumuman pelancaran mungkin melebihi kestabilan dalam aliran kerja pengeluaran sebenar.

Harga API atau anjakan dasar boleh memecahkan andaian semalaman.

Kebergantungan vendor tunggal meningkatkan kos kunci masuk dan penghijrahan.

Hala Tuju Pelaksanaan

1

Nilai penyedia menggunakan tugasan dan set data anda sendiri.

2

Semak privasi, keselamatan dan syarat undang-undang sebelum penyepaduan.

3

Kekalkan pelan sandaran merentas model atau vendor.

4

Pantau nota keluaran supaya perubahan peta jalan tidak mengejutkan pasukan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LAION and Open Datasets quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

AI Sumber Terbuka

Soalan lazim

What is LAION and Open Datasets?

LAION ialah organisasi bukan untung Jerman yang mengeluarkan set data teks imej terbuka besar-besaran, yang paling terkenal LAION-5B, yang menyemarakkan latihan model generatif terbuka seperti Stable Diffusion. Ia penting kerana ia menjadikan data multimodal berskala web tersedia secara percuma kepada penyelidik di luar syarikat besar.

Apakah yang paling utama diedarkan oleh LAION dalam set data teks imejnya?

LAION tidak mengehoskan imej; ia mengedarkan URL dan metadata, jadi pengguna mengambil imej daripada sumber web asal mereka.

Secara kasar berapa banyak pasangan teks imej dalam LAION-5B?

LAION-5B mengandungi kira-kira 5.85 bilion pasangan teks imej, oleh itu '5B' dalam namanya.

Model manakah yang LAION gunakan untuk menapis pasangan teks imej untuk kualiti penjajaran?

LAION menggunakan CLIP OpenAI untuk mengukur persamaan kapsyen imej dan membuang pasangan yang kurang padan.

Model generatif terbuka yang terkenal manakah yang dilatih menggunakan data LAION?

Stable Diffusion, model teks-ke-imej terbuka, telah dilatih pada data teks imej LAION.

Apakah masalah serius yang ditemui oleh penyelidik dalam LAION-5B pada tahun 2023?

Penyelidik menemui pautan kepada bahan penderaan kanak-kanak yang menyalahi undang-undang, menyebabkan LAION menurunkan set data, membersihkannya dan mengeluarkan semula versi yang lebih selamat.