Teknik KILAVUZ

Karma Hassas Eğitim

Karma hassas eğitim, matematiğin çoğunu 32 bit yerine 16 bit kayan noktada gerçekleştirerek sinir ağı eğitimini hızlandırır ve bellek kullanımını azaltır.

2 min readSon güncelleme

Genel Bakış

It lets the same GPU train bigger models faster with almost no loss in accuracy.

Derin Dalış

Geleneksel eğitim ağırlıkları saklar ve matematiği 32 bitlik kayan noktada (FP32) çalıştırır. Karma hassasiyet, ağır matris çarpımları için daha düşük hassasiyetli 16 bit formatları (FP16 veya bfloat16) kullanırken, kararlı güncellemeler için ağırlıkların 32 bitlik 'ana kopyasını' saklar. 16 bitlik sayılar yarı boyutta olduğundan GPU belleğine daha fazla sığar ve Tensör Çekirdekleri bunları kabaca 2-8 kat daha hızlı işler. Önemli olan FP16'nın dar aralığıdır: küçük eğimler sıfıra kadar akabilir. Standart düzeltme, geri yayılımdan önce kaybı büyük bir faktörle çarparak küçük gradyanların temsil edilebilir kalmasını sağlayan ve ardından ağırlık güncellemesinden önce onu tekrar bölen kayıp ölçeklendirmedir. NVIDIA'nın Apex'i ve PyTorch ile TensorFlow'daki yerleşik AMP (Otomatik Karma Hassasiyet) bunu otomatikleştirir.

Teknik Bilgi

FP16'nın yalnızca 5 üslü biti vardır ve bu da degrade düşük akışına neden olan küçük bir dinamik aralık sağlar. Bfloat16, 8 üslü bit (FP32'nin aralığına uygun) tutar ancak daha az mantis biti tutar, bu nedenle nadiren kayıp ölçeklendirmeye ihtiyaç duyar - Google TPU'ların ve modern GPU'ların onu tercih etmesinin temel nedeni budur. Tensör Çekirdekleri, 16 bitlik işlenenleri çarparak ancak kısmi toplamları FP32'de biriktirerek işi hızlandırır ve aksi takdirde toplama hatalarının birleşeceği durumlarda hassasiyeti korur.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Karma Hassas Eğitimin Geleceği

Hassasiyet düşmeye devam ediyor. NVIDIA Hopper ve Blackwell GPU'larında desteklenen FP8 eğitimi, ileri modeller için standart hale geliyor ve FP4 ve mikro ölçeklendirme formatları (MXFP) üzerine yapılan araştırmalar daha da ileri gidiyor. Katman başına hassasiyeti otomatik olarak seçecek çerçeveler, giderek daha dar formatları yerel olarak işleyecek donanım ve düşük hassasiyetli eğitim ile çıkarım arasındaki çizgiyi bulanıklaştırarak trilyon parametreli modellerin eğitim maliyetini azaltacak niceleme bilinçli eğitim bekleyebilirsiniz.

Gerçek Dünya Uygulaması

PyTorch'un torch.cuda.amp.autocast'i, tek bir GPU'da belleği kabaca yarıya indirmek ve verimi iki katına çıkarmak için bir eğitim döngüsünü sarıyor

Kayıp ölçeklendirme ayarlamasını önlemek için TPU'larda bfloat16'da GPT tarzı transformatörler gibi büyük dil modellerini eğitmek

ResNet görüntü eğitimini FP32'den FP16'ya geçirerek tüketici RTX GPU'suna daha büyük bir toplu iş boyutu yerleştirme

Sınır ölçekli modellerin ön eğitim maliyetini azaltmak için NVIDIA H100 GPU'larda FP8 karma hassasiyeti

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixed Precision Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sözde Etiketleme ve Kendi Kendine Eğitim

Sık sorulan sorular

What is Mixed Precision Training?

Karma hassas eğitim, matematiğin çoğunu 32 bit yerine 16 bit kayan noktada gerçekleştirerek sinir ağı eğitimini hızlandırır ve bellek kullanımını azaltır. Aynı GPU'nun daha büyük modelleri doğrulukta neredeyse hiç kayıp olmadan daha hızlı eğitmesine olanak tanır.

Karma hassas eğitim neden ağırlıkların 32 bitlik 'ana kopyasını' saklıyor?

Ağırlık güncellemeleri genellikle çok küçüktür; bunları 16 bit olarak biriktirmek kesinliği kaybeder, bu nedenle tam duyarlıklı bir ana kopya güncellemelerin doğru kalmasını sağlar.

Kayıp ölçeklendirme FP16 eğitiminde hangi sorunu çözer?

FP16'nın dinamik aralığı sınırlıdır, dolayısıyla küçük eğimler sıfıra yuvarlanabilir; kaybın backprop'tan önce çarpılması, bunların temsil edilebilir olmasını sağlar.

Bfloat16'nın FP16'ya göre avantajı nedir?

Bfloat16, FP32 gibi 8 üslü biti korur, bu nedenle dinamik aralığı geniştir ve degrade alt akışı nadirdir.

Tensör Çekirdekleri 16 bit girişleri kullanırken doğruluğu nasıl korur?

Tensör Çekirdekleri 16 bitlik işlenenleri çoğaltır ancak 32 bitlik işlenenleri toplayarak toplama hatalarının birleşimini önler.

Eğitim sırasında 32 bitlik değerler yerine 16 bitlik değerler kullanmanın birincil faydası nedir?

Yarım boyutlu sayılar GPU belleğine daha fazla veri sığdırır ve özel donanımın matris matematiğini birkaç kat daha hızlı işlemesine olanak tanır.