PANDUAN AI Bahasa

QLoRA dan Penyempurnaan 4-Bit

QLoRA adalah teknik yang memungkinkan Anda menyempurnakan model bahasa besar-besaran pada GPU konsumen tunggal dengan menyimpan model beku hanya dalam 4 bit per bobot.

2 min readTerakhir diperbarui

Ikhtisar

It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.

Menyelam Lebih Dalam

Biasanya, menyempurnakan model besar berarti memuat setiap bobot dalam presisi 16-bit dan memperbarui semuanya, yang memerlukan memori sangat besar. QLoRA menggabungkan dua ide. Pertama, ini membekukan model yang telah dilatih sebelumnya dan mengkuantisasikannya menjadi 4 bit, sehingga mengurangi memori sekitar empat kali lipat. Kedua, ia menggunakan LoRA: alih-alih memperbarui matriks bobot raksasa, ia menyuntikkan matriks adaptor peringkat rendah kecil yang dapat dilatih di sampingnya, sehingga hanya beberapa juta parameter yang diperbarui. Basis 4-bit tetap sementara gradien hanya mengalir melalui adaptor kecil. Diperkenalkan pada tahun 2023 oleh Dettmers dan rekannya, QLoRA menunjukkan bahwa penyempurnaan model 65B pada satu GPU 48 GB dapat menyamai kualitas penyempurnaan 16-bit penuh.

Wawasan Teknis

QLoRA memperkenalkan tiga trik. NF4 (4-bit NormalFloat) adalah tipe data yang dioptimalkan untuk distribusi bobot neural kurva lonceng, memberikan akurasi yang lebih baik daripada int4 biasa. Kuantisasi ganda memampatkan konstanta kuantisasi itu sendiri, menghemat memori ekstra. Pengoptimal halaman menggunakan memori terpadu GPU-CPU untuk menyerap lonjakan selama rangkaian panjang, mencegah kerusakan kehabisan memori. Selama forward dan backward pass, bobot 4-bit didekuantisasi menjadi just-in-time 16-bit untuk perkalian matriks, lalu dibuang.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan QLoRA dan Penyempurnaan 4-Bit

Penyempurnaan 4-bit telah menjadi praktik standar, dan penelitian kini mendorong ke arah presisi yang lebih rendah lagi, termasuk representasi 2-bit dan 1-bit (terner). Skema kuantisasi yang lebih baru seperti AWQ, GPTQ, dan HQQ menyempurnakan akurasi lebih lanjut, sementara teknik seperti QA-LoRA bertujuan untuk menjaga model tetap terkuantisasi bahkan setelah menggabungkan adaptor. Seiring berkembangnya model open-weight, diharapkan alat yang memungkinkan para penghobi menyempurnakan model 70B-plus pada satu GPU gaming menjadi rutinitas dan mendemokratisasikan penyesuaian.

Implementasi Dunia Nyata

Sebuah startup menyempurnakan model Llama 70B pada satu GPU 48 GB untuk membangun asisten dukungan pelanggan sesuai mereknya sendiri tanpa menyewa cluster server.

Seorang peneliti dengan satu konsumen RTX 4090 mengadaptasi model terbuka ke kumpulan data penjawab pertanyaan medis khusus dalam semalam.

Pengembang membuat lusinan adaptor LoRA kecil yang dapat ditukar untuk berbagai tugas, semuanya berbagi satu model dasar 4-bit yang dimuat di memori.

Seorang penghobi menyempurnakan model di log obrolan pribadinya untuk meniru gaya penulisan tertentu menggunakan perangkat keras gratis tingkat Colab.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the QLoRA and 4-Bit Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penyempurnaan Pengambilan Sampel Penolakan

Pertanyaan yang sering diajukan

What is QLoRA and 4-Bit Fine-Tuning?

QLoRA adalah teknik yang memungkinkan Anda menyempurnakan model bahasa besar-besaran pada GPU konsumen tunggal dengan menyimpan model beku hanya dalam 4 bit per bobot. Hal ini memungkinkan penyesuaian model dengan parameter 65B pada perangkat keras yang sebelumnya hanya dapat menangani model berukuran kecil.

Apa ide inti penghematan memori di balik bagian '4-bit' QLoRA?

QLoRA menyimpan bobot beku yang telah dilatih sebelumnya pada 4 bit per nilai, memotong memori sekitar empat kali lipat dibandingkan dengan 16-bit.

Selama penyempurnaan QLoRA, parameter mana yang sebenarnya diperbarui dengan penurunan gradien?

Model dasar dibekukan; hanya matriks adaptor tingkat rendah yang disuntikkan yang menerima pembaruan gradien, yang hanya merupakan sebagian kecil dari parameter.

Apa itu NF4 dalam konteks QLoRA?

NF4 (NormalFloat 4-bit) adalah tipe data yang dirancang berdasarkan distribusi bobot jaringan saraf berbentuk lonceng untuk akurasi yang lebih baik daripada int4 biasa.

Masalah apa yang diatasi oleh 'pengoptimal halaman' di QLoRA?

Pengoptimal halaman menggunakan memori terpadu GPU-CPU untuk menyerap lonjakan memori, mencegah error karena kehabisan memori selama pelatihan pada input yang panjang.

Kapan bobot 4-bit diubah kembali ke presisi yang lebih tinggi selama pelatihan?

Bobot 4-bit didekuantisasi menjadi presisi 16-bit dengan cepat untuk setiap perkalian matriks, kemudian salinan dengan presisi lebih tinggi dibuang untuk menghemat memori.