Dil AI KILAVUZU

QLoRA ve 4-Bit İnce Ayar

QLoRA, dondurulmuş modeli ağırlık başına yalnızca 4 bit olarak depolayarak, tek bir tüketici GPU'sunda çok büyük bir dil modeline ince ayar yapmanıza olanak tanıyan bir tekniktir.

2 min readSon güncelleme

Genel Bakış

It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.

Derin Dalış

Normalde, büyük bir modele ince ayar yapmak, her ağırlığın 16 bit hassasiyetle yüklenmesi ve hepsinin güncellenmesi anlamına gelir; bu da çok büyük bir bellek gerektirir. QLoRA iki fikri birleştiriyor. İlk olarak, önceden eğitilmiş modeli dondurur ve onu 4 bit'e kadar niceler, böylece belleği kabaca dört kat azaltır. İkincisi, LoRA'yı kullanıyor: dev ağırlık matrislerini güncellemek yerine, bunların yanına küçük, eğitilebilir düşük dereceli adaptör matrisleri enjekte ediyor, böylece yalnızca birkaç milyon parametre güncelleniyor. Degradeler yalnızca küçük adaptörlerden akarken 4 bitlik taban sabit kalır. Dettmers ve meslektaşları tarafından 2023 yılında tanıtılan QLoRA, 48 GB'lık bir GPU'da 65B modeline ince ayar yapılmasının, tam 16 bitlik ince ayarın kalitesiyle eşleşebileceğini gösterdi.

Teknik Bilgi

QLoRA üç numara tanıttı. NF4 (4-bit NormalFloat), sinir ağırlıklarının çan eğrisi dağılımı için optimize edilmiş bir veri türüdür ve düz int4'ten daha iyi doğruluk sağlar. Çift niceleme, niceleme sabitlerini kendileri sıkıştırarak ekstra bellekten tasarruf sağlar. Disk belleği optimize ediciler, uzun diziler sırasındaki ani artışları absorbe etmek ve yetersiz bellek çökmelerini önlemek için GPU-CPU birleşik belleğini kullanır. İleri ve geri geçiş sırasında, 4 bitlik ağırlıklar, matris çarpımı için tam zamanında 16 bitlik değere dönüştürülür ve ardından atılır.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

QLoRA ve 4-Bit İnce Ayarın Geleceği

4 bitlik ince ayar standart uygulama haline geldi ve araştırmalar artık 2 bitlik ve 1 bitlik (üçlü) temsiller de dahil olmak üzere daha da düşük hassasiyete doğru ilerliyor. AWQ, GPTQ ve HQQ gibi daha yeni niceleme şemaları doğruluğu daha da geliştirirken, QA-LoRA gibi teknikler bağdaştırıcılar birleştirildikten sonra bile modeli nicelenmiş halde tutmayı amaçlar. Açık ağırlıklı modeller büyüdükçe, meraklıların tek bir oyun GPU'sunda 70B ve üzeri modellere ince ayar yapmasına olanak tanıyan araçların rutin hale gelmesini ve özelleştirmeyi demokratikleştirmesini bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Yeni kurulan bir şirket, bir sunucu kümesi kiralamadan kendi marka sesiyle bir müşteri destek asistanı oluşturmak için tek bir 48 GB GPU üzerinde 70B Llama modeline ince ayar yapıyor.

Bir tüketici RTX 4090'ına sahip bir araştırmacı, açık bir modeli bir gecede niş bir tıbbi soru yanıtlama veri kümesine uyarlıyor.

Bir geliştirici, farklı görevler için düzinelerce küçük, değiştirilebilir LoRA bağdaştırıcısı oluşturur; bunların tümü belleğe yüklenmiş tek bir 4 bitlik temel modeli paylaşır.

Bir hobici, ücretsiz Colab sınıfı donanım kullanarak belirli bir yazma stilini taklit etmek için kişisel sohbet günlüklerindeki bir modele ince ayar yapar.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the QLoRA and 4-Bit Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Reddetme Örnekleme İnce Ayarı

Sık sorulan sorular

What is QLoRA and 4-Bit Fine-Tuning?

QLoRA, dondurulmuş modeli ağırlık başına yalnızca 4 bit olarak depolayarak, tek bir tüketici GPU'sunda çok büyük bir dil modeline ince ayar yapmanıza olanak tanıyan bir tekniktir. Daha önce bu boyutun yalnızca küçük bir kısmını işleyebilen donanımlarda 65B parametreli modellerin özelleştirilmesi mümkün hale geldi.

QLoRA'nın '4 bit' kısmının ardındaki temel bellek tasarrufu fikri nedir?

QLoRA, dondurulmuş önceden eğitilmiş ağırlıkları değer başına 4 bit olarak saklar ve belleği 16 bit ile karşılaştırıldığında kabaca dört kat azaltır.

QLoRA ince ayarı sırasında, aslında hangi parametreler degrade inişiyle güncellenir?

Temel model dondurulmuştur; yalnızca enjekte edilen düşük dereceli bağdaştırıcı matrisleri, parametrelerin yalnızca küçük bir kısmı olan degrade güncellemelerini alır.

QLoRA bağlamında NF4 nedir?

NF4 (NormalFloat 4-bit), düz int4'ten daha iyi doğruluk için sinir ağı ağırlıklarının çan eğrisi dağılımı etrafında tasarlanmış bir veri türüdür.

QLoRA adresindeki 'disk belleği optimize ediciler' hangi sorunu yaratır?

Disk belleği optimize ediciler, bellek ani artışlarını absorbe etmek için GPU-CPU birleşik belleğini kullanır ve uzun girişlerde eğitim sırasında bellek yetersiz çökmelerini önler.

Eğitim sırasında 4 bitlik ağırlıklar ne zaman daha yüksek hassasiyete dönüştürülür?

Her matris çarpımı için 4 bitlik ağırlıkların niceliği anında 16 bit hassasiyete çıkarılır, ardından daha yüksek hassasiyetli kopya bellekten tasarruf etmek için atılır.