PANDUAN AI Bahasa

Penyetelan Awalan

Penyetelan awalan adalah cara yang efisien terhadap parameter untuk mengadaptasi model bahasa beku dengan melatih sekumpulan kecil vektor kontinu yang ditambahkan ke masukan setiap lapisan.

2 min readTerakhir diperbarui

Ikhtisar

It lets you customize giant models for new tasks while updating less than 1% of parameters.

Menyelam Lebih Dalam

Penyetelan awalan, yang diperkenalkan oleh peneliti Stanford Li dan Liang pada tahun 2021, mengadaptasi transformator yang telah dilatih sebelumnya tanpa menyentuh bobotnya. Alih-alih menyempurnakan semua parameter, ini menambahkan urutan 'token virtual' (awalan) yang dapat dilatih ke kunci dan nilai di setiap lapisan perhatian. Model beku memperhatikan awalan ini seolah-olah itu adalah konteks nyata, mengarahkan perilakunya menuju tugas target. Karena hanya vektor awalan yang dipelajari, Anda dapat menyimpan satu awalan kecil per tugas, bukan salinan model lengkap. Hal ini membuat melayani banyak tugas menjadi murah dan menghindari ledakan penyimpanan akibat penyempurnaan penuh. Performanya sangat baik terutama pada tugas-tugas pembuatan seperti tabel-ke-teks dan peringkasan, sering kali cocok dengan penyesuaian penuh dalam pengaturan data tinggi.

Wawasan Teknis

Tidak seperti penyetelan cepat, yang hanya menambahkan vektor pada lapisan penyematan masukan, penyetelan awalan memasukkan vektor kunci/nilai yang dapat dilatih ke dalam perhatian mandiri setiap lapisan transformator. Untuk menstabilkan pelatihan, awalan biasanya dihasilkan oleh jaringan feed-forward kecil (trik reparameterisasi) daripada dioptimalkan secara langsung; jaringan tersebut dibuang setelah pelatihan, hanya menyisakan matriks awalan yang dipelajari. Hanya parameter awalan ini yang menerima gradien—seluruh tulang punggung tetap dibekukan.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Penyetelan Awalan

Penyetelan awalan membantu meluncurkan gelombang penyempurnaan efisien parameter (PEFT) dan tetap menjadi elemen dasar dalam perpustakaan seperti Hugging Face PEFT. Seiring berkembangnya model dasar hingga ratusan miliar parameter, adaptor ringan seperti awalan semakin menarik untuk penyajian multi-penyewa dan personalisasi di perangkat. Harapkan pendekatan hybrid berkelanjutan yang memadukan awalan dengan pembaruan peringkat rendah gaya LoRA, dan semakin banyak digunakan dalam mengendalikan gaya, persona, dan perilaku keselamatan tanpa melatih ulang seluruh model.

Implementasi Dunia Nyata

Mengadaptasi satu backbone GPT-2 yang dibekukan untuk pembuatan tabel-ke-teks dengan melatih awalan kecil pada kumpulan data WebNLG

Melayani lusinan gaya ringkasan khusus pelanggan dari satu model bersama, masing-masing sebagai file awalan yang dapat ditukar

Mengarahkan nada atau persona model bahasa untuk chatbot tanpa melatih ulang bobot dasar

Adaptasi domain data rendah, seperti pembuatan teks hukum atau medis, yang memerlukan penyesuaian menyeluruh

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prefix Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penyempurnaan Pengambilan Sampel Penolakan

Pertanyaan yang sering diajukan

What is Prefix Tuning?

Penyetelan awalan adalah cara yang efisien terhadap parameter untuk mengadaptasi model bahasa beku dengan melatih sekumpulan kecil vektor kontinu yang ditambahkan ke masukan setiap lapisan. Ini memungkinkan Anda menyesuaikan model raksasa untuk tugas-tugas baru sambil memperbarui kurang dari 1% parameter.

Apa yang sebenarnya dilatih oleh penyetelan awalan?

Penyetelan awalan membekukan tulang punggung dan hanya mempelajari sekumpulan kecil vektor awalan berkelanjutan, sehingga menjaganya tetap efisien dalam parameter.

Di mana vektor awalan disuntikkan?

Penyetelan awalan menambahkan vektor kunci/nilai yang dapat dilatih pada perhatian mandiri setiap lapisan transformator, bukan hanya masukan.

Siapa yang memperkenalkan penyetelan awalan dan kira-kira kapan?

Penyetelan awalan diusulkan oleh Xiang Lisa Li dan Percy Liang di Stanford pada tahun 2021.

Mengapa penyetelan awalan menarik untuk melakukan banyak tugas?

Karena hanya awalan kecil yang khusus untuk tugas, Anda menyimpan satu file kecil per tugas daripada menduplikasi keseluruhan model.

Trik apa yang sering digunakan untuk menstabilkan pelatihan awalan?

MLP kecil menghasilkan awalan selama pelatihan untuk stabilitas, kemudian dibuang, hanya menyisakan matriks awalan yang dipelajari.