Pembelajaran Dalam Konteks
Pembelajaran dalam konteks adalah kemampuan mengejutkan dari model bahasa besar untuk mengambil tugas baru dari beberapa contoh yang ditempatkan di prompt, tanpa pelatihan ulang apa pun.
Ikhtisar
It is the reason you can 'teach' a model on the fly just by showing it what you want.
Menyelam Lebih Dalam
Biasanya, mengajarkan tugas baru pada jaringan saraf berarti memperbarui bobotnya melalui pelatihan. Pembelajaran dalam konteks berbeda: Anda menulis beberapa contoh langsung di prompt ('konteks'), dan model menyimpulkan polanya dan menerapkannya ke masukan baru. Tidak ada perubahan di dalam model; contohnya hanya mengarahkan prediksi token berikutnya. Anda akan mendengar 'zero-shot' (hanya instruksi), 'one-shot' (satu contoh), dan 'few-shot' (beberapa contoh). Perilaku ini dipopulerkan oleh GPT-3 pada tahun 2020 dan ternyata merupakan kemampuan yang muncul: model berukuran kecil tidak dapat melakukannya, tetapi setelah melewati skala sekitar 100 miliar parameter, akurasi pada perintah beberapa pengambilan gambar meningkat tajam. Model tersebut secara efektif belajar mengenali dan melanjutkan pola selama pra-pelatihan, sehingga dapat menggunakan kembali keterampilan tersebut pada waktu inferensi.
Wawasan Teknis
Penelitian interpretasi menelusuri sebagian besar kemampuan ini ke 'kepala induksi' - sirkuit perhatian yang muncul selama pelatihan dan melakukan pencocokan awalan yang tidak jelas: mereka memindai kembali di mana token serupa muncul, lalu menyalin apa yang mengikutinya. Jadi, ketika perintah Anda menampilkan 'apel -> buah, wortel -> sayur', model akan mencocokkan struktur dan memprediksi label yang tepat untuk item berikutnya. Yang terpenting, tidak ada aliran gradien dan tidak ada pembaruan bobot pada inferensi. Contoh-contoh tersebut hanya membentuk ulang aktivasi yang memberi makan distribusi probabilitas token berikutnya.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Pembelajaran Dalam Konteks
Memperluas jendela konteks (sekarang ratusan ribu token) mendorong pembelajaran dalam konteks menuju rezim 'banyak kesempatan', di mana lusinan atau ratusan contoh dapat menyaingi penyesuaian untuk beberapa tugas, tanpa biaya pelatihan. Harapkan integrasi yang lebih erat dengan pengambilan, sehingga contoh yang relevan diambil secara otomatis, dan teori yang lebih baik tentang kapan pembelajaran dalam konteks gagal atau terganggu. Ini akan tetap menjadi cara yang cepat dan murah untuk mengadaptasi model, melengkapi — bukan menggantikan — penyempurnaan untuk tugas-tugas yang stabil dan bervolume tinggi.
Implementasi Dunia Nyata
Memberi chatbot tiga contoh tiket dukungan dan kategorinya, lalu mengklasifikasikan tiket baru dengan cara yang sama
Menampilkan model dua pasangan teks berantakan sebelum/sesudah diformat ulang menjadi JSON bersih sehingga mengubah sisanya
Tempelkan beberapa contoh deskripsi produk dengan warna merek Anda sehingga deskripsi baru sesuai dengan gayanya
Mendemonstrasikan soal kata matematika yang rumit dikerjakan langkah demi langkah sehingga model menyelesaikan soal serupa dengan format penalaran yang sama
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the In-Context Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Konteks Windows
Pertanyaan yang sering diajukan
What is In-Context Learning?
Pembelajaran dalam konteks adalah kemampuan mengejutkan dari model bahasa besar untuk mengambil tugas baru dari beberapa contoh yang ditempatkan di prompt, tanpa pelatihan ulang apa pun. Ini adalah alasan Anda dapat 'mengajar' model dengan cepat hanya dengan menunjukkan apa yang Anda inginkan.
Apa perubahan mendasar dalam model selama pembelajaran dalam konteks?
Pembelajaran dalam konteks terjadi sepenuhnya pada inferensi. Contoh di prompt membentuk aktivasi model dan prediksi token berikutnya, namun tidak ada bobot yang diperbarui.
Mengapa pembelajaran dalam konteks digambarkan sebagai kemampuan yang 'muncul'?
Kemampuan tersebut lemah atau tidak ada pada model kecil dan meningkat tajam setelah model mencapai skala yang sangat besar, itulah sebabnya disebut muncul.
Mekanisme internal manakah yang paling terkait dengan pembelajaran dalam konteks pada transformator?
Pekerjaan interpretasi mengidentifikasi kepala induksi – sirkuit perhatian yang menemukan di mana token serupa muncul dan menyalin apa yang terjadi selanjutnya – sebagai pendorong inti pembelajaran dalam konteks.