PANDUAN Teknis

FP8 dan Format Presisi Rendah

FP8 adalah format angka floating-point 8-bit yang memungkinkan model AI menyimpan bobot dan menjalankan matematika menggunakan seperempat memori angka standar 32-bit.

2 min readTerakhir diperbarui

Ikhtisar

It is a key trick for making giant models cheaper and faster to train and serve.

Menyelam Lebih Dalam

Jaringan saraf terbuat dari miliaran angka. Biasanya angka-angka tersebut menggunakan masing-masing 32 bit (FP32) atau 16 bit (FP16/BF16). FP8 memperkecilnya menjadi hanya 8 bit, memotong memori dan bandwidth kira-kira setengahnya dibandingkan 16-bit. Ada dua tata letak FP8 yang umum: E4M3 (4 bit eksponen, 3 bit mantissa) memberikan presisi lebih tinggi tetapi rentang lebih kecil, dan E5M2 (5 eksponen, 2 mantissa) memberikan rentang lebih luas tetapi langkah lebih kasar. Keuntungannya adalah kesetiaan: lebih sedikit bit berarti kesalahan pembulatan. Agar tetap akurat, kerangka kerja menerapkan faktor penskalaan per tensor atau per blok yang mengubah skala nilai ke dalam rentang FP8 yang dapat digunakan. GPU Hopper dan Blackwell NVIDIA menambahkan mesin matriks FP8 perangkat keras, sehingga praktis untuk pelatihan dan inferensi. Format yang lebih baru seperti MXFP8, MXFP4, dan NVFP4 mendorong lebih rendah lagi dengan blok penskalaan mikro bersama.

Wawasan Teknis

Tantangan FP8 adalah rentang dinamis. Dengan hanya sedikit bit eksponen, aktivasi besar atau kecil meluap atau mengalir ke nol. Cara mengatasinya adalah penskalaan: kalikan tensor dengan faktor sehingga nilainya masuk ke jendela yang dapat diwakilkan FP8, lakukan akumulasi perkalian FP8, lalu bagi kembali, sering kali mengumpulkan jumlah sebagian dengan presisi lebih tinggi (FP16/FP32). E4M3 biasanya digunakan untuk bobot dan aktivasi, E5M2 untuk gradien yang rentangnya lebih penting daripada presisi.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan FP8 dan Format Presisi Rendah

Presisi berpacu ke bawah. Setelah FP8 hadir format penskalaan mikro 4-bit (MXFP4, NVFP4) yang mengemas skala kecil bersama per blok kecil, dan perangkat keras Blackwell kini mempercepat FP4 secara langsung. Harapkan resep dengan presisi campuran di mana lapisan yang berbeda menggunakan lebar bit yang berbeda, ditambah pelatihan sadar kuantisasi yang lebih baik sehingga 4-bit menjadi default untuk inferensi. Tujuan akhirnya adalah memasukkan model skala terdepan ke dalam chip yang lebih sedikit dan lebih murah tanpa kehilangan kualitas yang terukur.

Implementasi Dunia Nyata

Melatih model bahasa besar pada GPU NVIDIA Hopper/Blackwell menggunakan FP8 untuk menggandakan throughput dibandingkan BF16

Melayani inferensi chatbot di FP8 sehingga model cocok dengan GPU yang lebih sedikit dan menjawab lebih banyak permintaan per detik

Menggunakan E5M2 untuk komunikasi gradien selama pelatihan terdistribusi untuk memotong bandwidth jaringan antar node

Menerapkan model terkuantisasi MXFP4/NVFP4 agar sesuai dengan model skala frontier pada satu GPU dengan memori tinggi untuk inferensi yang lebih murah

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Format Serialisasi Model

Pertanyaan yang sering diajukan

What is FP8 and Low-Precision Formats?

FP8 adalah format angka floating-point 8-bit yang memungkinkan model AI menyimpan bobot dan menjalankan matematika menggunakan seperempat memori angka standar 32-bit. Ini adalah trik utama untuk membuat model raksasa lebih murah dan lebih cepat untuk dilatih dan dilayani.

Berapa bit yang digunakan nomor FP8 dibandingkan dengan nomor FP32 standar?

FP8 menggunakan 8 bit sedangkan FP32 menggunakan 32 bit, sehingga FP8 memakan seperempat penyimpanan dan bandwidth.

Apa yang dijelaskan oleh label 'E4M3' dan 'E5M2' tentang format FP8?

E4M3 berarti 4 bit eksponen dan 3 bit mantissa; E5M2 berarti 5 eksponen dan 2 bit mantissa. Bit eksponen yang lebih banyak akan memperluas jangkauannya; lebih banyak bit mantissa menambah presisi.

Mengapa pipeline FP8 menerapkan faktor penskalaan pada tensor?

Dengan bit eksponen yang sangat sedikit, nilai yang besar meluap dan nilai yang kecil mengalir ke nol. Penskalaan akan mengubah skala tensor ke jendela FP8 yang dapat digunakan sebelum penghitungan.

Pertukaran apa yang menjadi kelemahan utama penggunaan FP8?

Bit yang lebih sedikit berarti representasi yang lebih kasar dan kesalahan pembulatan yang lebih banyak. Keuntungannya adalah memori dan bandwidth yang jauh lebih sedikit, dan perhitungan matematika yang lebih cepat pada perangkat keras yang didukung.

Generasi GPU NVIDIA manakah yang pertama kali menambahkan dukungan perangkat keras khusus untuk matematika matriks FP8?

GPU berbasis hopper seperti H100 memperkenalkan dukungan FP8 Tensor Core, dan Blackwell kemudian memperluasnya ke FP4.