A seguirPróximo guia
Compensações de recomputação de ativação
Técnico
GUIA Técnico
SwiGLU é uma função de ativação fechada que multiplica uma projeção linear da entrada por uma segunda projeção ativada por Swish, atuando como uma porta que pode ser aprendida e dependente de dados dentro das camadas feed-forward do transformador.
It consistently improves language-model quality, which is why nearly every modern LLM uses it.
Um bloco feed-forward de transformador padrão consiste em duas camadas lineares com um ReLU ou GELU entre elas. Unidades Lineares Gated, propostas por Dauphin et al. em 2016, divida a primeira projeção em duas metades e use uma metade para delimitar a outra por meio de multiplicação elemento a elemento. SwiGLU, popularizado por Noam Shazeer em 2020, usa a função Swish (SiLU) para essa porta: saída = (Swish(xW) * (xV)) W2, com três matrizes de peso em vez de duas. O gate permite que a rede passe ou suprima seletivamente informações por dimensão. Como a adição da terceira matriz aumenta os parâmetros, as implementações reduzem a dimensão oculta para cerca de dois terços, de modo que a computação total permanece comparável a um GELU MLP. Os experimentos de Shazeer mostraram ganhos mensuráveis de perplexidade, e LLaMA, PaLM e Mistral os adotaram.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
SwiGLU está consolidado como o MLP padrão em LLMs abertos e é improvável que seja substituído em breve. As direções ativas incluem variantes GeGLU e ReGLU, núcleos de GPU fundidos que calculam ambas as projeções em uma passagem e combinação de MLPs fechados com mistura de especialistas para que cada especialista seja um bloco SwiGLU. Os pesquisadores também estão estudando por que os portões ajudam na otimização, com o objetivo de projetar portões ainda mais baratos.
LLaMA, PaLM e Mistral substituem a camada feed-forward GELU por SwiGLU para diminuir a perplexidade em computação igual
A dimensão oculta é dimensionada para cerca de dois terços (8/3 d) para que a matriz de portas extra não aumente os FLOPs
Modelos de mistura de especialistas, como Mixtral, usam blocos SwiGLU como rede feed-forward por especialista
Os transformadores de visão e multimodais emprestam o gating GeGLU/SwiGLU para melhorar suas subcamadas MLP
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
SwiGLU é uma função de ativação fechada que multiplica uma projeção linear da entrada por uma segunda projeção ativada por Swish, atuando como uma porta que pode ser aprendida e dependente de dados dentro das camadas feed-forward do transformador. Ele melhora consistentemente a qualidade do modelo de linguagem, e é por isso que quase todos os LLM modernos o utilizam.
Uma GLU multiplica uma projeção de valor por uma projeção de porta elemento a elemento, permitindo que a rede controle o fluxo de informações por dimensão.
SwiGLU usa Swish, também chamado de SiLU, definido como x * sigmoid(beta*x), para o ramo de gating.
SwiGLU precisa de três matrizes: a projeção da porta, a projeção do valor e a projeção da saída.
Caso contrário, a terceira matriz aumentaria a computação, portanto, reduzir o tamanho oculto para aproximadamente 8/3 d mantém o orçamento compatível.
A nota de 2020 de Noam Shazeer 'Variantes GLU melhoram o transformador' apresentou o SwiGLU e mostrou seus ganhos de perplexidade.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Compensações de recomputação de ativação
Técnico