Teknik KILAVUZ

FP8 ve Düşük Hassasiyetli Formatlar

FP8, yapay zeka modellerinin ağırlıkları depolamasına ve standart 32 bit sayıların belleğinin dörtte birini kullanarak matematik çalıştırmasına olanak tanıyan 8 bitlik kayan noktalı sayı formatıdır.

2 min readSon güncelleme

Genel Bakış

It is a key trick for making giant models cheaper and faster to train and serve.

Derin Dalış

Sinir ağları milyarlarca sayıdan oluşur. Geleneksel olarak bu sayıların her biri 32 bit (FP32) veya 16 bit (FP16/BF16) kullanıyordu. FP8 bunları yalnızca 8 bit'e küçülterek belleği ve bant genişliğini 16 bit'e kıyasla kabaca yarı yarıya azaltır. İki yaygın FP8 düzeni vardır: E4M3 (4 üslü bit, 3 mantis biti) daha fazla hassasiyet verir ancak daha küçük bir aralık sağlar ve E5M2 (5 üslü, 2 mantis) daha geniş bir aralık ancak daha kaba adımlar verir. Takas aslına uygunluktur: daha az bit, yuvarlama hataları anlamına gelir. Doğruluğu korumak için çerçeveler, değerleri FP8'in kullanılabilir aralığına göre yeniden ölçeklendiren tensör başına veya blok başına ölçeklendirme faktörleri uygular. NVIDIA'nın Hopper ve Blackwell GPU'ları, donanımsal FP8 matris motorlarını ekleyerek onu hem eğitim hem de çıkarım için pratik hale getirdi. MXFP8, MXFP4 ve NVFP4 gibi daha yeni formatlar, paylaşılan mikro ölçeklendirme bloklarıyla daha da düşük seviyelere çıkıyor.

Teknik Bilgi

FP8'in karşılaştığı zorluk dinamik aralıktır. Yalnızca bir avuç üs bitiyle, büyük veya küçük aktivasyonlar sıfıra taşar veya yetersiz kalır. Çözüm ölçeklendirmedir: bir tensörü bir faktörle çarpın, böylece değerleri FP8'in temsil edilebilir penceresine yerleşir, FP8'de çarpma-birikimi yapılır, ardından geri bölünür, çoğunlukla kısmi toplamlar daha yüksek hassasiyette biriktirilir (FP16/FP32). E4M3 genellikle ağırlıklar ve aktivasyonlar için kullanılırken, E5M2 aralığın hassasiyetten daha önemli olduğu eğimler için kullanılır.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

FP8'in Geleceği ve Düşük Hassasiyetli Formatlar

Hassasiyet aşağıya doğru yarışıyor. FP8'den sonra, küçük blok başına küçük bir paylaşılan ölçek sunan 4 bitlik mikro ölçeklendirme formatları (MXFP4, NVFP4) geldi ve Blackwell donanımı artık FP4'ü doğrudan hızlandırıyor. Farklı katmanların farklı bit genişlikleri kullandığı karışık duyarlıklı tarifler ve ayrıca 4 bit'in çıkarım için varsayılan haline gelmesi için daha iyi niceleme odaklı eğitim bekleyin. Oyunun sonu, ölçülebilir kalite kaybı olmadan sınır ölçeğindeki modelleri daha az sayıda, daha ucuz çiplere sıkıştırmaktır.

Gerçek Dünya Uygulaması

BF16'ya kıyasla verimi kabaca iki katına çıkarmak için FP8 kullanarak büyük dil modellerini NVIDIA Hopper/Blackwell GPU'larında eğitmek

Bir modelin daha az GPU'ya sığması ve saniyede daha fazla isteği yanıtlaması için FP8'de chatbot çıkarımı sunulması

Düğümler arasındaki ağ bant genişliğini azaltmak amacıyla dağıtılmış eğitim sırasında gradyan iletişimi için E5M2'yi kullanma

Daha ucuz çıkarım için MXFP4/NVFP4 ile nicelenmiş modellerin sınır ölçekli bir modele sığacak şekilde tek bir yüksek bellekli GPU'ya dağıtılması

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model Serileştirme Formatları

Sık sorulan sorular

What is FP8 and Low-Precision Formats?

FP8, yapay zeka modellerinin ağırlıkları depolamasına ve standart 32 bit sayıların belleğinin dörtte birini kullanarak matematik çalıştırmasına olanak tanıyan 8 bitlik kayan noktalı sayı formatıdır. Bu, dev modellerin daha ucuz ve daha hızlı eğitilmesi ve hizmete sunulması için önemli bir püf noktasıdır.

Bir FP8 numarası standart bir FP32 numarasına kıyasla kaç bit kullanır?

FP8 8 bit kullanırken FP32 32 bit kullanır, dolayısıyla FP8 depolama ve bant genişliğinin dörtte birini alır.

'E4M3' ve 'E5M2' etiketleri FP8 formatı hakkında neyi tanımlar?

E4M3, 4 üslü bit ve 3 mantis biti anlamına gelir; E5M2, 5 üs ve 2 mantis biti anlamına gelir. Daha fazla üslü bit aralığı genişletir; daha fazla mantis parçası hassasiyeti artırır.

FP8 işlem hatları neden tensörlere ölçeklendirme faktörleri uyguluyor?

Bu kadar az üslü bit ile büyük değerler taşar, küçük değerler ise sıfıra düşer. Ölçeklendirme, tensörleri matematik işleminden önce FP8'in kullanılabilir penceresine yeniden ölçeklendirir.

FP8 kullanmanın ana dezavantajı hangi ödünleşimdir?

Daha az bit, daha kaba gösterim ve daha fazla yuvarlama hatası anlamına gelir. Avantajı, çok daha az bellek ve bant genişliği ve desteklenen donanımda daha hızlı matematiktir.

Hangi NVIDIA GPU nesli, FP8 matris matematiği için özel donanım desteğini ilk ekledi?

H100 gibi Hopper tabanlı GPU'lar FP8 Tensör Çekirdeği desteğini sundu ve Blackwell daha sonra bunu FP4'e kadar genişletti.