FP8 dan Format Presisi Rendah
FP8 adalah format angka floating-point 8-bit yang memungkinkan model AI menyimpan bobot dan menjalankan matematika menggunakan seperempat memori angka standar 32-bit.
Ikhtisar
It is a key trick for making giant models cheaper and faster to train and serve.
Menyelam Lebih Dalam
Jaringan saraf terbuat dari miliaran angka. Biasanya angka-angka tersebut menggunakan masing-masing 32 bit (FP32) atau 16 bit (FP16/BF16). FP8 memperkecilnya menjadi hanya 8 bit, memotong memori dan bandwidth kira-kira setengahnya dibandingkan 16-bit. Ada dua tata letak FP8 yang umum: E4M3 (4 bit eksponen, 3 bit mantissa) memberikan presisi lebih tinggi tetapi rentang lebih kecil, dan E5M2 (5 eksponen, 2 mantissa) memberikan rentang lebih luas tetapi langkah lebih kasar. Keuntungannya adalah kesetiaan: lebih sedikit bit berarti kesalahan pembulatan. Agar tetap akurat, kerangka kerja menerapkan faktor penskalaan per tensor atau per blok yang mengubah skala nilai ke dalam rentang FP8 yang dapat digunakan. GPU Hopper dan Blackwell NVIDIA menambahkan mesin matriks FP8 perangkat keras, sehingga praktis untuk pelatihan dan inferensi. Format yang lebih baru seperti MXFP8, MXFP4, dan NVFP4 mendorong lebih rendah lagi dengan blok penskalaan mikro bersama.
Wawasan Teknis
Tantangan FP8 adalah rentang dinamis. Dengan hanya sedikit bit eksponen, aktivasi besar atau kecil meluap atau mengalir ke nol. Cara mengatasinya adalah penskalaan: kalikan tensor dengan faktor sehingga nilainya masuk ke jendela yang dapat diwakilkan FP8, lakukan akumulasi perkalian FP8, lalu bagi kembali, sering kali mengumpulkan jumlah sebagian dengan presisi lebih tinggi (FP16/FP32). E4M3 biasanya digunakan untuk bobot dan aktivasi, E5M2 untuk gradien yang rentangnya lebih penting daripada presisi.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan FP8 dan Format Presisi Rendah
Presisi berpacu ke bawah. Setelah FP8 hadir format penskalaan mikro 4-bit (MXFP4, NVFP4) yang mengemas skala kecil bersama per blok kecil, dan perangkat keras Blackwell kini mempercepat FP4 secara langsung. Harapkan resep dengan presisi campuran di mana lapisan yang berbeda menggunakan lebar bit yang berbeda, ditambah pelatihan sadar kuantisasi yang lebih baik sehingga 4-bit menjadi default untuk inferensi. Tujuan akhirnya adalah memasukkan model skala terdepan ke dalam chip yang lebih sedikit dan lebih murah tanpa kehilangan kualitas yang terukur.
Implementasi Dunia Nyata
Melatih model bahasa besar pada GPU NVIDIA Hopper/Blackwell menggunakan FP8 untuk menggandakan throughput dibandingkan BF16
Melayani inferensi chatbot di FP8 sehingga model cocok dengan GPU yang lebih sedikit dan menjawab lebih banyak permintaan per detik
Menggunakan E5M2 untuk komunikasi gradien selama pelatihan terdistribusi untuk memotong bandwidth jaringan antar node
Menerapkan model terkuantisasi MXFP4/NVFP4 agar sesuai dengan model skala frontier pada satu GPU dengan memori tinggi untuk inferensi yang lebih murah
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Format Serialisasi Model
Pertanyaan yang sering diajukan
What is FP8 and Low-Precision Formats?
FP8 adalah format angka floating-point 8-bit yang memungkinkan model AI menyimpan bobot dan menjalankan matematika menggunakan seperempat memori angka standar 32-bit. Ini adalah trik utama untuk membuat model raksasa lebih murah dan lebih cepat untuk dilatih dan dilayani.
Berapa bit yang digunakan nomor FP8 dibandingkan dengan nomor FP32 standar?
FP8 menggunakan 8 bit sedangkan FP32 menggunakan 32 bit, sehingga FP8 memakan seperempat penyimpanan dan bandwidth.
Apa yang dijelaskan oleh label 'E4M3' dan 'E5M2' tentang format FP8?
E4M3 berarti 4 bit eksponen dan 3 bit mantissa; E5M2 berarti 5 eksponen dan 2 bit mantissa. Bit eksponen yang lebih banyak akan memperluas jangkauannya; lebih banyak bit mantissa menambah presisi.
Mengapa pipeline FP8 menerapkan faktor penskalaan pada tensor?
Dengan bit eksponen yang sangat sedikit, nilai yang besar meluap dan nilai yang kecil mengalir ke nol. Penskalaan akan mengubah skala tensor ke jendela FP8 yang dapat digunakan sebelum penghitungan.
Pertukaran apa yang menjadi kelemahan utama penggunaan FP8?
Bit yang lebih sedikit berarti representasi yang lebih kasar dan kesalahan pembulatan yang lebih banyak. Keuntungannya adalah memori dan bandwidth yang jauh lebih sedikit, dan perhitungan matematika yang lebih cepat pada perangkat keras yang didukung.
Generasi GPU NVIDIA manakah yang pertama kali menambahkan dukungan perangkat keras khusus untuk matematika matriks FP8?
GPU berbasis hopper seperti H100 memperkenalkan dukungan FP8 Tensor Core, dan Blackwell kemudian memperluasnya ke FP4.