Pembelajaran Kendiri
Pembelajaran penyeliaan sendiri melatih model pada data tidak berlabel dengan mencipta tugasan yang jawapannya tersembunyi di dalam data itu sendiri.
Gambaran keseluruhan
Inilah cara model asas bahasa dan visi moden belajar daripada internet mentah tanpa tentera pelabelan manusia.
Menyelam dalam
Melabel data dengan tangan adalah perlahan dan mahal, namun dunia penuh dengan teks, imej, audio dan video yang tidak berlabel. Pembelajaran penyeliaan sendiri membuka kuncinya dengan mencipta 'tugas dalih' di mana data membekalkan jawapannya sendiri. Contoh klasik ialah pemodelan bahasa bertopeng, yang digunakan oleh BERT: sembunyikan beberapa perkataan dalam ayat dan latih model untuk meramalkannya daripada konteks. Model gaya GPT meramalkan perkataan seterusnya. Dalam penglihatan, kaedah kontrastif seperti SimCLR menunjukkan model dua tanaman tambahan imej yang sama dan mengajarnya bahawa ia adalah milik bersama sambil menolak imej yang berbeza. Menyelesaikan teka-teki buatan sendiri ini memaksa model untuk membina perwakilan dalaman yang kaya tentang makna dan struktur. Perwakilan tersebut kemudian dipindahkan dengan kuat kepada tugas hiliran sebenar dengan sedikit atau tiada data berlabel.
Wawasan Teknikal
Caranya ialah menjana isyarat pengawasan secara percuma. Dalam pemodelan bertopeng, token tersembunyi ialah label, jadi kerugian boleh dikira tanpa sebarang anotasi manusia. Dalam pembelajaran kontrastif, dua penambahan satu imej membentuk 'pasangan positif' yang sepatutnya terletak berdekatan dalam ruang benam, manakala imej lain adalah 'negatif' ditolak. Walau apa pun, model ini dioptimumkan pada label yang diperoleh semata-mata daripada struktur data itu sendiri, mempelajari ciri umum yang kemudiannya hanya memerlukan penalaan halus ringan.
Kesan Strategik
Keputusan yang lebih jelas
Ia membantu anda memisahkan tuntutan teknikal yang jelas daripada bahasa pemasaran.
Kos dan bajet
Anda boleh bertanya soalan pelaksanaan yang lebih baik sebelum menghabiskan wang atau masa.
Pasukan dan aliran kerja
Pasukan yang berkongsi pemahaman membuat keputusan produk, dasar dan pembelajaran yang lebih baik.
Masa Depan Pembelajaran Penyeliaan Kendiri
Pembelajaran penyeliaan sendiri ialah enjin di sebalik model asas hari ini, dan peranan itu hanya akan berkembang. Aliran yang jelas adalah ke arah pralatihan pelbagai mod, di mana satu model belajar bersama daripada teks, imej, audio dan video menggunakan objektif yang diselia sendiri. Penyelidik menolak kaedah kontrastif ke arah pendekatan ramalan bertopeng dalam penglihatan dan teknik penyulingan diri yang tidak memerlukan contoh negatif. Memandangkan data berlabel berkualiti tinggi menjadi hambatan, mempelajari struktur berguna secara langsung daripada aliran besar yang tidak berlabel akan kekal sebagai strategi utama untuk menskalakan AI.
Pelaksanaan Dunia Sebenar
BERT belajar bahasa dengan meramalkan perkataan bertopeng, kemudian diperhalusi untuk carian, sentimen atau menjawab soalan
SimCLR melatih pengekod imej pada foto tidak berlabel supaya ia kemudian boleh mengklasifikasikan dengan sangat sedikit label
Model gaya GPT belajar menulis dengan berulang kali meramalkan token seterusnya merentas korpora teks yang besar
Model pertuturan telah dilatih pada audio mentah tidak berlabel (meramalkan segmen bunyi bertopeng) sebelum disesuaikan dengan transkripsi
Risiko & Pengawal
Pasukan yang berbeza mungkin menggunakan istilah yang sama secara berbeza, jadi tentukan skop lebih awal.
Penanda aras boleh kelihatan kukuh manakala prestasi dunia sebenar tidak sekata.
Mengabaikan kualiti data dan rancangan penilaian sering menghasilkan hasil yang rapuh.
Hala Tuju Pelaksanaan
Mulakan dengan definisi bahasa biasa hasil yang anda perlukan.
Pilih satu metrik kejayaan dan satu keadaan kegagalan sebelum ujian.
Jalankan juruterbang kecil dengan data perwakilan, bukan set demo yang digilap.
Dokumen di mana Pembelajaran Penyeliaan Sendiri membantu dan kaedah yang lebih mudah adalah lebih baik.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Supervised Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pembelajaran yang diselia
Soalan lazim
Apakah Pembelajaran Yang Diawasi Kendiri?
Pembelajaran penyeliaan sendiri melatih model pada data tidak berlabel dengan mencipta tugasan yang jawapannya tersembunyi di dalam data itu sendiri. Begitulah cara model asas bahasa dan visi moden belajar daripada internet mentah tanpa tentera pelabel manusia.
Apakah yang menjadikan pembelajaran 'diawasi sendiri'?
Pembelajaran penyeliaan kendiri mencipta tugas alasan di mana jawapannya tersembunyi dalam data, jadi tiada pelabelan manusia diperlukan.
Mengapakah pembelajaran diselia sendiri sangat berharga untuk model asas?
Oleh kerana isyarat penyeliaan datang daripada data itu sendiri, model boleh dipralatih pada korpora besar yang tidak berlabel daripada web.
Selepas latihan pra-penyeliaan sendiri, apa yang biasanya berlaku seterusnya?
Pralatihan membina perwakilan umum yang dipindahkan dengan baik, jadi hanya penalaan halus pada data berlabel diperlukan untuk tugasan tertentu.
Bagaimanakah tugas penyeliaan sendiri model gaya GPT berbeza daripada BERT?
Model gaya GPT dilatih untuk meramalkan token seterusnya dalam urutan, manakala BERT meramalkan token bertopeng menggunakan kedua-dua konteks kiri dan kanan.