A continuaciónSiguiente guía
Compensaciones de recálculo de activación
Técnico
GUÍA Técnica
SwiGLU es una función de activación cerrada que multiplica una proyección lineal de la entrada por una segunda proyección activada por Swish, actuando como una puerta aprendible y dependiente de los datos dentro de las capas de alimentación directa del transformador.
It consistently improves language-model quality, which is why nearly every modern LLM uses it.
Un bloque de alimentación directa de transformador estándar consta de dos capas lineales con un ReLU o GELU en el medio. Unidades lineales cerradas, propuestas por Dauphin et al. en 2016, divida la primera proyección en dos mitades y use una mitad para bloquear la otra mediante la multiplicación de elementos. SwiGLU, popularizado por Noam Shazeer en 2020, utiliza la función Swish (SiLU) para esa puerta: salida = (Swish(xW) * (xV)) W2, con tres matrices de peso en lugar de dos. La puerta permite a la red pasar o suprimir información selectivamente por dimensión. Debido a que al agregar la tercera matriz aumentan los parámetros, las implementaciones reducen la dimensión oculta a aproximadamente dos tercios, por lo que el cálculo total sigue siendo comparable a un GELU MLP. Los experimentos de Shazeer mostraron ganancias mensurables en la perplejidad, y LLaMA, PaLM y Mistral lo adoptaron.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
SwiGLU está arraigado como el MLP predeterminado en los LLM abiertos y es poco probable que sea desplazado pronto. Las direcciones activas incluyen variantes GeGLU y ReGLU, núcleos de GPU fusionados que calculan ambas proyecciones en una sola pasada y combinan MLP cerrados con una mezcla de expertos para que cada experto sea en sí mismo un bloque SwiGLU. Los investigadores también están estudiando por qué las puertas ayudan a la optimización, con el objetivo de diseñar puertas aún más económicas.
LLaMA, PaLM y Mistral reemplazan la capa de avance GELU con SwiGLU para reducir la perplejidad en el mismo cálculo
La dimensión oculta se escala a aproximadamente dos tercios (8/3 d) para que la matriz de activación adicional no infle los FLOP
Los modelos de combinación de expertos, como Mixtral, utilizan bloques SwiGLU como red de avance por experto
Los transformadores multimodales y de visión toman prestado el control GeGLU/SwiGLU para mejorar sus subcapas MLP
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
SwiGLU es una función de activación cerrada que multiplica una proyección lineal de la entrada por una segunda proyección activada por Swish, actuando como una puerta aprendible y dependiente de los datos dentro de las capas de alimentación directa del transformador. Mejora constantemente la calidad del modelo de lenguaje, razón por la cual casi todos los LLM modernos lo utilizan.
Una GLU multiplica una proyección de valor por una proyección de puerta por elementos, permitiendo que la red controle el flujo de información por dimensión.
SwiGLU usa Swish, también llamado SiLU, definido como x * sigmoide(beta*x), para la rama de puerta.
SwiGLU necesita tres matrices: la proyección de puerta, la proyección de valor y la proyección de salida.
De lo contrario, la tercera matriz inflaría el cálculo, por lo que reducir el tamaño oculto a aproximadamente 8/3 d mantiene el presupuesto igualado.
La nota de 2020 de Noam Shazeer 'Las variantes de GLU mejoran el transformador' presentó SwiGLU y mostró sus ganancias de perplejidad.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Compensaciones de recálculo de activación
Técnico