A continuaciónSiguiente guía
Formatos de serialización de modelos
Técnico
GUÍA Técnica
FP8 es un formato numérico de punto flotante de 8 bits que permite a los modelos de IA almacenar pesos y ejecutar cálculos utilizando una cuarta parte de la memoria de los números estándar de 32 bits.
It is a key trick for making giant models cheaper and faster to train and serve.
Las redes neuronales están formadas por miles de millones de números. Tradicionalmente, esos números usaban 32 bits (FP32) o 16 bits (FP16/BF16) cada uno. El FP8 los reduce a sólo 8 bits, reduciendo la memoria y el ancho de banda aproximadamente a la mitad en comparación con los 16 bits. Hay dos diseños comunes del FP8: E4M3 (4 bits de exponente, 3 bits de mantisa) brinda más precisión pero un rango más pequeño, y E5M2 (5 exponentes, 2 mantisa) brinda un rango más amplio pero pasos más aproximados. La compensación es la fidelidad: menos bits significan errores de redondeo. Para mantener la precisión, los marcos aplican factores de escala por tensor o por bloque que reescalan los valores al rango utilizable del FP8. Las GPU Hopper y Blackwell de NVIDIA agregaron motores de matriz FP8 de hardware, lo que las hace prácticas tanto para el entrenamiento como para la inferencia. Los formatos más nuevos, como MXFP8, MXFP4 y NVFP4, bajan aún más con bloques de microescalado compartidos.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
La precisión está cayendo. Después del FP8 vinieron los formatos de microescalado de 4 bits (MXFP4, NVFP4) que incluyen una pequeña escala compartida por bloque pequeño, y el hardware de Blackwell ahora acelera el FP4 directamente. Espere recetas de precisión mixta en las que diferentes capas utilicen diferentes anchos de bits, además de un mejor entrenamiento consciente de la cuantificación para que los 4 bits se conviertan en el valor predeterminado para la inferencia. El objetivo final es exprimir modelos a escala fronteriza en menos chips y más baratos sin una pérdida de calidad mensurable.
Entrenamiento de modelos de lenguaje grandes en GPU NVIDIA Hopper/Blackwell usando FP8 para aproximadamente duplicar el rendimiento en comparación con BF16
Ofrecer inferencia de chatbot en FP8 para que un modelo se ajuste a menos GPU y responda a más solicitudes por segundo
Uso de E5M2 para comunicación en gradiente durante el entrenamiento distribuido para reducir el ancho de banda de la red entre nodos
Implementación de modelos cuantificados MXFP4/NVFP4 para ajustar un modelo a escala de frontera en una única GPU de alta memoria para una inferencia más económica
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
FP8 es un formato numérico de punto flotante de 8 bits que permite a los modelos de IA almacenar pesos y ejecutar cálculos utilizando una cuarta parte de la memoria de los números estándar de 32 bits. Es un truco clave para hacer que los modelos gigantes sean más baratos y más rápidos de entrenar y servir.
FP8 usa 8 bits mientras que FP32 usa 32 bits, por lo que FP8 ocupa una cuarta parte del almacenamiento y el ancho de banda.
E4M3 significa 4 bits de exponente y 3 bits de mantisa; E5M2 significa 5 exponentes y 2 bits de mantisa. Más bits exponentes amplían el rango; más bits de mantisa añaden precisión.
Con tan pocos bits de exponente, los valores grandes se desbordan y los pequeños se desbordan hasta llegar a cero. El escalado reescala los tensores en la ventana utilizable del FP8 antes de las matemáticas.
Menos bits significa una representación más burda y más error de redondeo. El beneficio es mucha menos memoria y ancho de banda, y cálculos más rápidos en el hardware compatible.
Las GPU basadas en Hopper como la H100 introdujeron la compatibilidad con FP8 Tensor Core, y Blackwell luego lo amplió a FP4.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Formatos de serialización de modelos
Técnico