GUÍA DE FUNDAMENTOS

Normalización de grupo

La normalización de grupo es una técnica que estabiliza el entrenamiento de redes neuronales normalizando características dentro de pequeños grupos de canales, de forma independiente para cada ejemplo.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because, unlike Batch Normalization, it works well even when batches are tiny.

Buceo profundo

Las capas de normalización mantienen los números fluyendo a través de una red bien escalada, lo que acelera y estabiliza el entrenamiento. La normalización de lotes hace esto calculando la media y la varianza de cada característica en todo el mini lote, pero eso lo hace frágil cuando los lotes son pequeños, ya que las estadísticas se vuelven ruidosas y poco confiables. La normalización de grupo, introducida por Wu y He en 2018, elimina por completo el lote de la ecuación. Para cada ejemplo individual, divide los canales en un número fijo de grupos y luego normaliza cada grupo utilizando solo los valores propios de ese ejemplo. Debido a que el cálculo nunca depende de otros ejemplos del lote, el rendimiento se mantiene estable ya sea que el lote contenga 32 imágenes o solo una, lo que lo hace popular en tareas de detección, segmentación y visión con mucha memoria.

Información técnica

Group Norm calcula la media y la varianza de las dimensiones espaciales y de los canales dentro de cada grupo, por muestra. Luego se normaliza a media cero y varianza unitaria y aplica la escala aprendida por canal (gamma) y el desplazamiento (beta). Generaliza otros esquemas: con un grupo se convierte en Normalización de Capas, y con un canal por grupo se convierte en Normalización de Instancias. El recuento de grupo es un hiperparámetro, a menudo establecido en 32.

Impacto Estratégico

Decisiones más claras

Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.

Costo y presupuesto

Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.

Equipo y flujo de trabajo

Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.

El futuro de la normalización grupal

La normalización de grupos sigue siendo la opción preferida cuando los lotes deben ser pequeños, como la detección y segmentación de alta resolución, los modelos 3D y de vídeo, y el entrenamiento con memoria limitada. También está integrado en arquitecturas generativas ampliamente utilizadas, como las U-Nets, dentro de modelos de difusión. A medida que los modelos crecen y la presión de la memoria reduce el tamaño de los lotes, es probable que los normalizadores independientes de lotes, entre ellos Group Norm junto con Layer Norm, sigan siendo bloques de construcción predeterminados, con una investigación continua sobre híbridos y alternativas libres de normalización.

Implementación en el mundo real

Detección de objetos y segmentación de instancias (por ejemplo, modelos de estilo Mask R-CNN) entrenadas con lotes muy pequeños por GPU.

La columna vertebral de U-Net está dentro de los generadores de imágenes de difusión, donde Group Norm estabiliza las escalas de características.

Redes de vídeo y 3D donde el uso elevado de memoria obliga a reducir el tamaño de los lotes a uno o dos.

Ajuste de modelos de visión de gran tamaño en hardware limitado donde los lotes pequeños hacen que las estadísticas de Batch Norm no sean confiables.

Riesgos y barandillas

Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.

Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.

Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.

Hoja de ruta de implementación

1

Comience con una definición en lenguaje sencillo del resultado que necesita.

2

Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.

3

Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.

4

Documente dónde ayuda la normalización de grupos y dónde son mejores los métodos más simples.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Normalización de recompensas agrupadas en RLHF

Preguntas frecuentes

What is Group Normalization?

La normalización de grupo es una técnica que estabiliza el entrenamiento de redes neuronales normalizando características dentro de pequeños grupos de canales, de forma independiente para cada ejemplo. Es importante porque, a diferencia de la normalización por lotes, funciona bien incluso cuando los lotes son pequeños.

¿Cuál es la principal ventaja de la normalización grupal sobre la normalización por lotes?

Debido a que Group Norm calcula estadísticas por ejemplo en lugar de a través del lote, no se degrada en lotes pequeños, a diferencia de Batch Norm.

¿Sobre qué calcula la normalización de grupo su media y varianza?

Divide los canales en grupos y normaliza cada grupo utilizando solo los valores y ubicaciones espaciales de ese único ejemplo, ignorando el resto del lote.

¿La normalización de grupo se convierte en normalización de capas en qué caso especial?

Con un solo grupo, todos los canales se normalizan juntos por ejemplo, que es exactamente Normalización de capas.

La normalización de grupo se convierte en normalización de instancias, ¿en qué caso especial?

Si cada grupo tiene un solo canal, cada canal se normaliza por sí solo, por ejemplo, que es la normalización de instancias.

Después de la normalización, ¿qué se aplica la norma grupal para restaurar la flexibilidad representacional?

Al igual que otras capas de normalización, Group Norm incluye parámetros de cambio y escala que se pueden aprender para que la red pueda deshacer o ajustar la normalización según sea necesario.