GUIDA TECNICA

FP8 e formati a bassa precisione

FP8 è un formato numerico a virgola mobile a 8 bit che consente ai modelli di intelligenza artificiale di memorizzare pesi ed eseguire calcoli utilizzando un quarto della memoria dei numeri standard a 32 bit.

2 minuti di letturaUltimo aggiornamento

Panoramica

It is a key trick for making giant models cheaper and faster to train and serve.

Immersione profonda

Le reti neurali sono composte da miliardi di numeri. Tradizionalmente questi numeri utilizzavano 32 bit (FP32) o 16 bit (FP16/BF16) ciascuno. L'FP8 li riduce a soli 8 bit, tagliando la memoria e la larghezza di banda all'incirca della metà rispetto a 16 bit. Esistono due layout comuni FP8: E4M3 (4 bit di esponente, 3 bit di mantissa) offre maggiore precisione ma un intervallo più piccolo, ed E5M2 (5 esponente, 2 bit di mantissa) offre un intervallo più ampio ma passi più grossolani. Il compromesso è la fedeltà: meno bit significano errori di arrotondamento. Per rimanere accurati, i framework applicano fattori di ridimensionamento per tensore o per blocco che ridimensionano i valori nell'intervallo utilizzabile dell'8° PQ. Le GPU Hopper e Blackwell di NVIDIA hanno aggiunto motori a matrice hardware FP8, rendendolo pratico sia per l'addestramento che per l'inferenza. I formati più recenti come MXFP8, MXFP4 e NVFP4 si spingono ancora più in basso con blocchi di micro-scaling condivisi.

Approfondimento tecnico

La sfida dell'8PQ è la gamma dinamica. Con solo una manciata di bit esponenti, attivazioni grandi o piccole vanno in overflow o underflow fino a zero. La soluzione è il ridimensionamento: moltiplicare un tensore per un fattore in modo che i suoi valori arrivino nella finestra rappresentabile di FP8, moltiplicare-accumulare FP8, quindi dividere di nuovo, spesso accumulando somme parziali con maggiore precisione (FP16/FP32). E4M3 viene generalmente utilizzato per pesi e attivazioni, E5M2 per gradienti in cui la portata conta più della precisione.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro dell'8° PQ e dei formati a bassa precisione

La precisione corre verso il basso. Dopo l'FP8 sono arrivati ​​i formati di micro-scaling a 4 bit (MXFP4, NVFP4) che racchiudono una piccola scala condivisa per piccolo blocco, e l'hardware Blackwell ora accelera direttamente l'FP4. Aspettatevi ricette a precisione mista in cui livelli diversi utilizzano larghezze di bit diverse, oltre a una migliore formazione in grado di riconoscere la quantizzazione in modo che 4 bit diventi l'impostazione predefinita per l'inferenza. Il risultato finale è comprimere i modelli su scala di frontiera su un minor numero di chip più economici senza una perdita di qualità misurabile.

Implementazione nel mondo reale

Addestramento di modelli linguistici di grandi dimensioni su GPU NVIDIA Hopper/Blackwell utilizzando FP8 per raddoppiare all'incirca il throughput rispetto a BF16

Servire l'inferenza del chatbot nell'FP8 in modo che un modello si adatti a meno GPU e risponda a più richieste al secondo

Utilizzo di E5M2 per la comunicazione gradiente durante l'addestramento distribuito per ridurre la larghezza di banda della rete tra i nodi

Distribuzione di modelli quantizzati MXFP4/NVFP4 per adattare un modello su scala di frontiera su una singola GPU ad alta memoria per un'inferenza più economica

Rischi e guardrail

L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

1

Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

2

Benchmark in condizioni di carico e dati realistiche.

3

Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

4

Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Formati di serializzazione dei modelli

Domande frequenti

What is FP8 and Low-Precision Formats?

FP8 è un formato numerico a virgola mobile a 8 bit che consente ai modelli di intelligenza artificiale di memorizzare pesi ed eseguire calcoli utilizzando un quarto della memoria dei numeri standard a 32 bit. Si tratta di un trucco fondamentale per rendere i modelli giganti più economici e veloci da addestrare e servire.

Quanti bit utilizza un numero FP8 rispetto a un numero FP32 standard?

FP8 utilizza 8 bit mentre FP32 utilizza 32 bit, quindi FP8 occupa un quarto dello spazio di archiviazione e della larghezza di banda.

Cosa descrivono le etichette "E4M3" e "E5M2" su un formato FP8?

E4M3 significa 4 bit dell'esponente e 3 bit della mantissa; E5M2 significa 5 esponenti e 2 bit di mantissa. Bit più esponenti ampliano l'intervallo; più bit di mantissa aggiungono precisione.

Perché i gasdotti dell'8° PQ applicano fattori di scala ai tensori?

Con così pochi bit esponenti, i valori grandi vanno in overflow e quelli piccoli vanno in overflow fino a zero. Il ridimensionamento ridimensiona i tensori nella finestra utilizzabile dell'FP8 prima dei calcoli.

Quale compromesso è il principale svantaggio dell’utilizzo dell’8° PQ?

Meno bit significano una rappresentazione più grossolana e un maggiore errore di arrotondamento. Il vantaggio è una memoria e una larghezza di banda molto inferiori e calcoli più rapidi sull'hardware supportato.

Quale generazione di GPU NVIDIA ha aggiunto per prima il supporto hardware dedicato per la matematica della matrice FP8?

Le GPU basate su Hopper come l'H100 hanno introdotto il supporto Tensor Core FP8 e Blackwell in seguito lo ha esteso a FP4.