GUIA de IA de linguagem

Viés de posição ALiBi

ALiBi (Atenção com Vieses Lineares) é uma maneira inteligente de dar aos transformadores um senso de ordem das palavras sem os tradicionais encaixes de posição.

2 minutos de leituraÚltima atualização

Visão geral

It lets a model trained on short text handle much longer inputs at inference time.

Mergulho profundo

Os transformadores não têm noção embutida de ordem de palavras, portanto, precisam de uma maneira de codificar a posição. A abordagem clássica adiciona incorporações posicionais aos vetores de token. ALiBi, lançado por Press, Smith e Lewis em 2021, descarta-os completamente. Em vez disso, ele estimula as pontuações de atenção diretamente: quando um token de consulta olha para um token chave, o ALiBi subtrai uma penalidade proporcional à distância entre eles. Tokens distantes recebem uma penalidade maior, então o modelo naturalmente prefere contexto próximo. Cada cabeça de atenção recebe sua própria inclinação de penalidade fixa, de modo que algumas cabeças olham localmente enquanto outras veem mais longe. Como o viés é apenas uma função da distância, o ALiBi extrapola graciosamente para sequências muito mais longas do que aquelas observadas no treinamento.

Visão Técnica

Para uma consulta na posição i e chave na posição j, ALiBi adiciona m * (j - i) à pontuação de atenção bruta antes do softmax, onde m é uma constante específica da cabeça (as inclinações formam uma sequência geométrica como 1/2, 1/4, 1/8). Como j é menor ou igual a i na atenção causal, este termo é zero ou negativo, penalizando tokens distantes. Nenhum parâmetro aprendido e nenhuma incorporação são adicionados, portanto, a única sobrecarga é uma matriz de polarização pré-computada.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro do preconceito de posição do ALiBi

ALiBi provou que os vieses relativos baseados na distância superam os embeddings de posição absoluta para generalização de comprimento, e essa ideia agora permeia o design moderno de contexto longo. Alguns modelos recentes preferem embeddings rotativos (RoPE), mas ALiBi continua popular onde a extrapolação extrema é importante e foi usado em modelos como BLOOM e MPT. Espere uma experimentação híbrida contínua, combinando tendências de distância com escalonamento RoPE, à medida que os laboratórios empurram janelas de contexto para milhões de tokens sem retreinar do zero.

Implementação no mundo real

Treinar um chatbot em exemplos de 1.024 tokens, mas implantá-lo em documentos de 4.096 tokens sem retreinamento, contando com a extrapolação do ALiBi.

O modelo multilíngue BLOOM 176B, que adotou ALiBi para seu manejo de posição.

Modelos MPT do MosaicML, que usavam ALiBi para anunciar comprimento de contexto efetivamente ilimitado na inferência.

Resumindo contratos legais longos que excedem a duração original do treinamento do modelo, onde o viés do contexto próximo mantém a atenção coerente.

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Interpolação de posição para extensão de contexto

Perguntas frequentes

What is ALiBi Position Bias?

ALiBi (Atenção com Vieses Lineares) é uma maneira inteligente de dar aos transformadores um senso de ordem das palavras sem os tradicionais encaixes de posição. Ele permite que um modelo treinado em texto curto lide com entradas muito mais longas no momento da inferência.

O que significa ALiBi?

ALiBi é a abreviatura de Attention with Linear Biases, nomeado devido à penalidade linear que adiciona às pontuações de atenção.

Como o ALiBi penaliza tokens distantes?

ALiBi subtrai um valor proporcional à distância da chave de consulta da pontuação de atenção, de modo que tokens mais distantes tenham menos peso.

Qual é a vantagem prática mais celebrada do ALiBi?

Como o viés depende apenas da distância, os modelos treinados em sequências curtas podem lidar com sequências muito mais longas no tempo de inferência.

O que há de diferente no viés linear entre as cabeças de atenção?

ALiBi atribui a cada cabeça uma inclinação fixa e distinta (por exemplo, 1/2, 1/4, 1/8), de modo que cabeças diferentes atendem a faixas diferentes.

Comparado aos embeddings posicionais tradicionais, o ALiBi adiciona quantos parâmetros aprendidos?

ALiBi não introduz novos parâmetros aprendidos; as inclinações por cabeça são constantes predeterminadas.