GUIA de IA de linguagem

Incorporações de posição rotativa

Rotary Position Embeddings (RoPE) codifica onde cada token fica em uma sequência, girando sua consulta e vetores-chave em um ângulo proporcional à posição.

2 minutos de leituraÚltima atualização

Visão geral

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Mergulho profundo

Os transformadores não têm um senso de ordem integrado, portanto, precisam de informações de posição adicionadas de alguma forma. Os primeiros modelos adicionaram vetores senoidais fixos ou incorporações de posição aprendidas às entradas. RoPE, proposto por Su e colegas em 2021, adota uma abordagem diferente: em vez de adicionar um vetor de posição, ele gira pares de dimensões na consulta e nos vetores-chave em um ângulo que cresce com a posição do token. Quando o modelo calcula o produto escalar entre uma consulta na posição m e uma chave na posição n, a matemática funciona de modo que o resultado depende apenas da distância relativa m menos n. Isso proporciona uma consciência genuína da posição relativa, funciona bem com núcleos de atenção eficientes e diminui a atenção suavemente com a distância. RoPE agora é usado em Llama, Mistral, Qwen e nos modelos abertos mais modernos.

Visão Técnica

RoPE trata a incorporação de dimensões em pares e aplica uma rotação 2D a cada par, com pares diferentes girando em frequências diferentes, como os ponteiros de muitos relógios funcionando em velocidades diferentes. Como girar pela posição m e depois obter um produto escalar com algo girado pela posição n deixa apenas a diferença angular, as pontuações de atenção tornam-se funções da posição relativa. Pares de alta frequência capturam ordem local precisa; pares de baixa frequência capturam posição de longo alcance. Fundamentalmente, ele modifica consultas e chaves, não valores.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro das incorporações de posições rotativas

Muitos trabalhos recentes concentram-se em estender o RoPE a contextos muito mais longos do que os quais o modelo foi treinado. Técnicas como interpolação de posição, escalonamento com reconhecimento de NTK e YaRN ajustam as frequências de rotação para que um modelo treinado em, digamos, tokens de 4K possa lidar com 32K ou mais com ajuste fino leve. Espere que o RoPE continue sendo o esquema posicional dominante, com refinamentos contínuos em sua frequência base e escalonamento para contextos de milhões de tokens, e estudo contínuo de como ele interage com o comportamento de atenção.

Implementação no mundo real

Dando aos modelos Llama, Mistral e Qwen seu senso de ordem simbólica sem incorporações de posição separadas

Estendendo o contexto utilizável de um modelo de alguns milhares para dezenas de milhares de tokens por meio de interpolação ou YaRN

Ajudar os modelos de código a rastrear distâncias relativas entre colchetes, funções e referências em arquivos longos

Apoiar a resposta a perguntas de documentos longos, onde a posição relativa entre a pergunta e a evidência é importante

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) codifica onde cada token fica em uma sequência, girando sua consulta e vetores-chave em um ângulo proporcional à posição. Este truque elegante permite que os transformadores entendam distâncias relativas e se estendam normalmente para contextos mais longos.

Como o RoPE injeta informações de posição em um transformador?

O RoPE gira os vetores de consulta e de chave em um ângulo proporcional à posição, em vez de adicionar um vetor de posição separado.

Quais partes do cálculo da atenção o RoPE modifica?

RoPE aplica suas rotações aos vetores de consulta e chave, deixando os vetores de valor intactos.

Por que pares de dimensões diferentes giram em frequências diferentes no RoPE?

Assim como os ponteiros do relógio funcionam em velocidades diferentes, as frequências variadas permitem que alguns pares codifiquem ordens de curto alcance e outros, posições de longo alcance.

Qual é o objetivo de técnicas como interpolação de posição, escalonamento com reconhecimento de NTK e YaRN?

Esses métodos redimensionam as frequências de rotação do RoPE para que um modelo possa lidar com contextos muito mais longos do que seu comprimento de treinamento original.