A continuaciónSiguiente guía
DenseNet y conectividad densa
Técnico
GUÍA Técnica
La Minimización consciente de la nitidez (SAM) es un método de optimización que busca no solo una pérdida baja, sino también una pérdida baja en todo un conjunto de pesos: un mínimo fijo.
Flatter minima tend to generalize better, so SAM often improves test accuracy and robustness without changing the model architecture.
El entrenamiento estándar minimiza la pérdida en un solo punto en el espacio de peso, pero dos soluciones con la misma pérdida de entrenamiento pueden comportarse de manera muy diferente: un mínimo "agudo" se ubica en un valle estrecho donde pequeñas perturbaciones de peso aumentan la pérdida, mientras que un mínimo "plano" tolera la perturbación y generalmente generaliza mejor a datos invisibles. SAM, presentado por investigadores de Google en 2020, lo hace explícito. En cada paso, primero encuentra la perturbación de peso cercana (dentro de un radio pequeño rho) que maximiza la pérdida (el vecino en el peor de los casos) y luego actualiza los pesos originales para reducir la pérdida en ese punto perturbado. Este objetivo mínimo-máximo impulsa la optimización hacia regiones que son uniformemente bajas, lo que produce una generalización notablemente mejor en la clasificación de imágenes y más.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
SAM ha generado una familia de seguimientos dirigidos a su mayor debilidad, el cómputo duplicado: variantes eficientes como ESAM, LookSAM y métodos que perturban solo un subconjunto de pesos o aplican SAM cada pocos pasos. Adaptive SAM (ASAM) reparametriza el radio para que sea invariante en escala. Los investigadores continúan debatiendo exactamente por qué ayuda la planitud y cómo medirla, y se están difundiendo ideas conscientes de la nitidez para ajustar grandes modelos de lenguaje y mejorar la solidez al cambio de distribución.
Impulsar la precisión de Vision Transformer y ResNet en ImageNet mediante el entrenamiento con SAM en lugar de SGD simple.
Mejorar la solidez al ruido de las etiquetas, ya que es menos probable que los mínimos planos memoricen etiquetas corruptas.
Ajuste de modelos de lenguaje previamente entrenados con SAM para obtener una mejor generalización en pequeños conjuntos de datos posteriores.
Usar variantes de ESAM o LookSAM cuando el costo de cómputo duplicado de Vanilla SAM es demasiado costoso.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
La Minimización consciente de la nitidez (SAM) es un método de optimización que busca no solo una pérdida baja, sino también una pérdida baja en todo un conjunto de pesos: un mínimo fijo. Los mínimos más planos tienden a generalizarse mejor, por lo que SAM a menudo mejora la precisión y la solidez de las pruebas sin cambiar la arquitectura del modelo.
SAM apunta a mínimos planos porque la pérdida que permanece baja bajo pequeñas perturbaciones de peso tiende a generalizarse mejor a datos invisibles.
SAM calcula un gradiente para encontrar el punto cercano en el peor de los casos y luego otro gradiente allí para actualizarlo, aproximadamente el doble del costo habitual.
Rho establece qué tan lejos se mueve el paso de 'ascenso' para encontrar el vecino en el peor de los casos, definiendo qué tan grande es la región plana que busca SAM.
SAM primero perturba los pesos dentro del radio rho en la dirección que maximiza la pérdida, luego desciende desde el punto original utilizando el gradiente calculado allí.
La memorización de etiquetas ruidosas normalmente requiere mínimos nítidos y estrechos; al favorecer las regiones planas, SAM resiste ese sobreajuste.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
DenseNet y conectividad densa
Técnico