Penyetelan Awalan
Penyetelan awalan adalah cara yang efisien terhadap parameter untuk mengadaptasi model bahasa beku dengan melatih sekumpulan kecil vektor kontinu yang ditambahkan ke masukan setiap lapisan.
Ikhtisar
It lets you customize giant models for new tasks while updating less than 1% of parameters.
Menyelam Lebih Dalam
Penyetelan awalan, yang diperkenalkan oleh peneliti Stanford Li dan Liang pada tahun 2021, mengadaptasi transformator yang telah dilatih sebelumnya tanpa menyentuh bobotnya. Alih-alih menyempurnakan semua parameter, ini menambahkan urutan 'token virtual' (awalan) yang dapat dilatih ke kunci dan nilai di setiap lapisan perhatian. Model beku memperhatikan awalan ini seolah-olah itu adalah konteks nyata, mengarahkan perilakunya menuju tugas target. Karena hanya vektor awalan yang dipelajari, Anda dapat menyimpan satu awalan kecil per tugas, bukan salinan model lengkap. Hal ini membuat melayani banyak tugas menjadi murah dan menghindari ledakan penyimpanan akibat penyempurnaan penuh. Performanya sangat baik terutama pada tugas-tugas pembuatan seperti tabel-ke-teks dan peringkasan, sering kali cocok dengan penyesuaian penuh dalam pengaturan data tinggi.
Wawasan Teknis
Tidak seperti penyetelan cepat, yang hanya menambahkan vektor pada lapisan penyematan masukan, penyetelan awalan memasukkan vektor kunci/nilai yang dapat dilatih ke dalam perhatian mandiri setiap lapisan transformator. Untuk menstabilkan pelatihan, awalan biasanya dihasilkan oleh jaringan feed-forward kecil (trik reparameterisasi) daripada dioptimalkan secara langsung; jaringan tersebut dibuang setelah pelatihan, hanya menyisakan matriks awalan yang dipelajari. Hanya parameter awalan ini yang menerima gradien—seluruh tulang punggung tetap dibekukan.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Penyetelan Awalan
Penyetelan awalan membantu meluncurkan gelombang penyempurnaan efisien parameter (PEFT) dan tetap menjadi elemen dasar dalam perpustakaan seperti Hugging Face PEFT. Seiring berkembangnya model dasar hingga ratusan miliar parameter, adaptor ringan seperti awalan semakin menarik untuk penyajian multi-penyewa dan personalisasi di perangkat. Harapkan pendekatan hybrid berkelanjutan yang memadukan awalan dengan pembaruan peringkat rendah gaya LoRA, dan semakin banyak digunakan dalam mengendalikan gaya, persona, dan perilaku keselamatan tanpa melatih ulang seluruh model.
Implementasi Dunia Nyata
Mengadaptasi satu backbone GPT-2 yang dibekukan untuk pembuatan tabel-ke-teks dengan melatih awalan kecil pada kumpulan data WebNLG
Melayani lusinan gaya ringkasan khusus pelanggan dari satu model bersama, masing-masing sebagai file awalan yang dapat ditukar
Mengarahkan nada atau persona model bahasa untuk chatbot tanpa melatih ulang bobot dasar
Adaptasi domain data rendah, seperti pembuatan teks hukum atau medis, yang memerlukan penyesuaian menyeluruh
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prefix Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Penyempurnaan Pengambilan Sampel Penolakan
Pertanyaan yang sering diajukan
What is Prefix Tuning?
Penyetelan awalan adalah cara yang efisien terhadap parameter untuk mengadaptasi model bahasa beku dengan melatih sekumpulan kecil vektor kontinu yang ditambahkan ke masukan setiap lapisan. Ini memungkinkan Anda menyesuaikan model raksasa untuk tugas-tugas baru sambil memperbarui kurang dari 1% parameter.
Apa yang sebenarnya dilatih oleh penyetelan awalan?
Penyetelan awalan membekukan tulang punggung dan hanya mempelajari sekumpulan kecil vektor awalan berkelanjutan, sehingga menjaganya tetap efisien dalam parameter.
Di mana vektor awalan disuntikkan?
Penyetelan awalan menambahkan vektor kunci/nilai yang dapat dilatih pada perhatian mandiri setiap lapisan transformator, bukan hanya masukan.
Siapa yang memperkenalkan penyetelan awalan dan kira-kira kapan?
Penyetelan awalan diusulkan oleh Xiang Lisa Li dan Percy Liang di Stanford pada tahun 2021.
Mengapa penyetelan awalan menarik untuk melakukan banyak tugas?
Karena hanya awalan kecil yang khusus untuk tugas, Anda menyimpan satu file kecil per tugas daripada menduplikasi keseluruhan model.
Trik apa yang sering digunakan untuk menstabilkan pelatihan awalan?
MLP kecil menghasilkan awalan selama pelatihan untuk stabilitas, kemudian dibuang, hanya menyisakan matriks awalan yang dipelajari.