GUÍA de IA en idiomas

Cuantización

La cuantificación reduce un modelo de IA al almacenar sus números con menor precisión, por lo que un modelo que necesitaba una GPU de centro de datos a veces puede ejecutarse en una computadora portátil o un teléfono.

2 minutos de lecturaÚltima actualización

Descripción general

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Buceo profundo

Una red neuronal es principalmente una pila gigante de números llamados pesos, normalmente almacenados como valores de punto flotante de 16 o 32 bits. La cuantificación restaura esos pesos utilizando menos bits, comúnmente enteros de 8 bits (INT8) o incluso de 4 bits. Pasar de 16 bits a 4 bits reduce aproximadamente cuatro veces la memoria, por lo que un modelo de 70 mil millones de parámetros que necesita alrededor de 140 GB a 16 bits puede caber aproximadamente 35 GB a 4 bits. Los números más pequeños también se mueven más rápido a través de la memoria, lo que generalmente acelera la generación. El problema es la precisión: comprimir una amplia gama de valores en unos pocos niveles introduce un error de redondeo. Los buenos métodos minimizan esa pérdida al elegir cuidadosamente los factores de escala y proteger los pesos más sensibles, de modo que el modelo se comporte casi de manera idéntica y utilice una fracción de los recursos.

Información técnica

Cada grupo de ponderaciones obtiene un factor de escala que asigna valores reales a un pequeño conjunto de números enteros; multiplicar por la escala reconstruye aproximadamente el número original. Los métodos de cuantificación posteriores al entrenamiento, como GPTQ y AWQ, analizan un pequeño conjunto de datos de calibración para decidir qué pesos son más importantes y establecer escalas para minimizar el error de salida, en lugar de redondear todo a ciegas. Las activaciones a menudo se mantienen con mayor precisión porque varían más en tiempo de ejecución. El resultado es un modelo que almacena números enteros de 4 bits pero calcula resultados extremadamente cercanos a la versión de precisión total.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro de la cuantización

Espere que la cuantificación se convierta en la opción predeterminada en lugar de una optimización. Los proveedores de hardware están agregando soporte nativo de 4 bits e incluso de bits inferiores, y técnicas como el entrenamiento consciente de la cuantificación incorporan tolerancia para una baja precisión en el modelo desde el principio, reduciendo aún más la pérdida de precisión. La investigación sobre representaciones de 2 bits y 1 bit (binaria) está activa, con el objetivo de ejecutar modelos capaces en teléfonos y chips integrados. A medida que crezca la IA privada y en el dispositivo, los modelos cuantificados eficientes serán fundamentales para ejecutar asistentes localmente sin enviar datos a la nube.

Implementación en el mundo real

Ejecutar un modelo de chat como Llama localmente en una GPU de consumo utilizando archivos GGUF o GPTQ de 4 bits en lugar de necesitar varias tarjetas de centro de datos.

Asistentes en los dispositivos de los teléfonos, donde los modelos de 8 o 4 bits permiten que las funciones de voz y texto se ejecuten sin una conexión de red.

Reducir los costos de inferencia en la nube para un bot de atención al cliente al ofrecer un modelo INT8, adaptando más solicitudes en cada GPU.

Dispositivos de borde, como cámaras inteligentes o sensores de IoT, que ejecutan modelos compactos de lenguaje de visión cuantificados dentro de límites de memoria estrictos.

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Cuantización del vector residual

Preguntas frecuentes

What is Quantization?

La cuantificación reduce un modelo de IA al almacenar sus números con menor precisión, por lo que un modelo que necesitaba una GPU de centro de datos a veces puede ejecutarse en una computadora portátil o un teléfono. Es el truco principal que hace que los modelos de lenguaje grandes sean lo suficientemente baratos y rápidos para implementarlos ampliamente.

¿Qué cambia principalmente la cuantificación en una red neuronal?

La cuantificación restaura los pesos del modelo con una precisión numérica más baja, como enteros de 8 o 4 bits en lugar de flotantes de 16 o 32 bits.

¿Aproximadamente cuánta memoria se ahorra al mover pesos de 16 bits a 4 bits?

4 bits son un cuarto de 16 bits, por lo que el almacenamiento de peso se reduce a aproximadamente un cuarto, aproximadamente una reducción de 4 veces.

¿Cuál es la principal desventaja de la cuantificación agresiva?

Representar valores con menos niveles introduce un error de redondeo, que puede degradar la calidad de la salida si no se gestiona con cuidado.

¿Para qué utilizan métodos como GPTQ y AWQ un pequeño conjunto de datos de calibración?

Estos métodos posteriores al entrenamiento analizan algunas entradas de muestra para establecer factores de escala y proteger pesos sensibles, manteniendo los resultados cercanos al original.

¿Por qué la cuantificación a menudo hace que un modelo sea más rápido, no sólo más pequeño?

Los valores de menor precisión requieren menos ancho de banda de memoria para cargarse y moverse, lo que suele ser el cuello de botella durante la generación, por lo que la inferencia se acelera.