GUIA Técnico

SwiGLU e ativações fechadas

SwiGLU é uma função de ativação fechada que multiplica uma projeção linear da entrada por uma segunda projeção ativada por Swish, atuando como uma porta que pode ser aprendida e dependente de dados dentro das camadas feed-forward do transformador.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro do SwiGLU e das ativações fechadas
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It consistently improves language-model quality, which is why nearly every modern LLM uses it.

Mergulho profundo

Um bloco feed-forward de transformador padrão consiste em duas camadas lineares com um ReLU ou GELU entre elas. Unidades Lineares Gated, propostas por Dauphin et al. em 2016, divida a primeira projeção em duas metades e use uma metade para delimitar a outra por meio de multiplicação elemento a elemento. SwiGLU, popularizado por Noam Shazeer em 2020, usa a função Swish (SiLU) para essa porta: saída = (Swish(xW) * (xV)) W2, com três matrizes de peso em vez de duas. O gate permite que a rede passe ou suprima seletivamente informações por dimensão. Como a adição da terceira matriz aumenta os parâmetros, as implementações reduzem a dimensão oculta para cerca de dois terços, de modo que a computação total permanece comparável a um GELU MLP. Os experimentos de Shazeer mostraram ganhos mensuráveis ​​de perplexidade, e LLaMA, PaLM e Mistral os adotaram.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro do SwiGLU e das ativações fechadas

SwiGLU está consolidado como o MLP padrão em LLMs abertos e é improvável que seja substituído em breve. As direções ativas incluem variantes GeGLU e ReGLU, núcleos de GPU fundidos que calculam ambas as projeções em uma passagem e combinação de MLPs fechados com mistura de especialistas para que cada especialista seja um bloco SwiGLU. Os pesquisadores também estão estudando por que os portões ajudam na otimização, com o objetivo de projetar portões ainda mais baratos.

Implementação no mundo real

LLaMA, PaLM e Mistral substituem a camada feed-forward GELU por SwiGLU para diminuir a perplexidade em computação igual

A dimensão oculta é dimensionada para cerca de dois terços (8/3 d) para que a matriz de portas extra não aumente os FLOPs

Modelos de mistura de especialistas, como Mixtral, usam blocos SwiGLU como rede feed-forward por especialista

Os transformadores de visão e multimodais emprestam o gating GeGLU/SwiGLU para melhorar suas subcamadas MLP

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SwiGLU and Gated Activations quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is SwiGLU and Gated Activations?

SwiGLU é uma função de ativação fechada que multiplica uma projeção linear da entrada por uma segunda projeção ativada por Swish, atuando como uma porta que pode ser aprendida e dependente de dados dentro das camadas feed-forward do transformador. Ele melhora consistentemente a qualidade do modelo de linguagem, e é por isso que quase todos os LLM modernos o utilizam.

Qual operação principal define uma unidade linear fechada?

Uma GLU multiplica uma projeção de valor por uma projeção de porta elemento a elemento, permitindo que a rede controle o fluxo de informações por dimensão.

Qual função de ativação o SwiGLU usa para sua ramificação de portão?

SwiGLU usa Swish, também chamado de SiLU, definido como x * sigmoid(beta*x), para o ramo de gating.

Quantas matrizes de peso um bloco feedforward SwiGLU usa?

SwiGLU precisa de três matrizes: a projeção da porta, a projeção do valor e a projeção da saída.

Por que a dimensão oculta é normalmente dimensionada para cerca de dois terços nas camadas SwiGLU?

Caso contrário, a terceira matriz aumentaria a computação, portanto, reduzir o tamanho oculto para aproximadamente 8/3 d mantém o orçamento compatível.

Quem popularizou o SwiGLU para camadas feed-forward de transformadores em 2020?

A nota de 2020 de Noam Shazeer 'Variantes GLU melhoram o transformador' apresentou o SwiGLU e mostrou seus ganhos de perplexidade.