Incorporações de posição rotativa
Rotary Position Embeddings (RoPE) codifica onde cada token fica em uma sequência, girando sua consulta e vetores-chave em um ângulo proporcional à posição.
Visão geral
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Mergulho profundo
Os transformadores não têm um senso de ordem integrado, portanto, precisam de informações de posição adicionadas de alguma forma. Os primeiros modelos adicionaram vetores senoidais fixos ou incorporações de posição aprendidas às entradas. RoPE, proposto por Su e colegas em 2021, adota uma abordagem diferente: em vez de adicionar um vetor de posição, ele gira pares de dimensões na consulta e nos vetores-chave em um ângulo que cresce com a posição do token. Quando o modelo calcula o produto escalar entre uma consulta na posição m e uma chave na posição n, a matemática funciona de modo que o resultado depende apenas da distância relativa m menos n. Isso proporciona uma consciência genuína da posição relativa, funciona bem com núcleos de atenção eficientes e diminui a atenção suavemente com a distância. RoPE agora é usado em Llama, Mistral, Qwen e nos modelos abertos mais modernos.
Visão Técnica
RoPE trata a incorporação de dimensões em pares e aplica uma rotação 2D a cada par, com pares diferentes girando em frequências diferentes, como os ponteiros de muitos relógios funcionando em velocidades diferentes. Como girar pela posição m e depois obter um produto escalar com algo girado pela posição n deixa apenas a diferença angular, as pontuações de atenção tornam-se funções da posição relativa. Pares de alta frequência capturam ordem local precisa; pares de baixa frequência capturam posição de longo alcance. Fundamentalmente, ele modifica consultas e chaves, não valores.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro das incorporações de posições rotativas
Muitos trabalhos recentes concentram-se em estender o RoPE a contextos muito mais longos do que os quais o modelo foi treinado. Técnicas como interpolação de posição, escalonamento com reconhecimento de NTK e YaRN ajustam as frequências de rotação para que um modelo treinado em, digamos, tokens de 4K possa lidar com 32K ou mais com ajuste fino leve. Espere que o RoPE continue sendo o esquema posicional dominante, com refinamentos contínuos em sua frequência base e escalonamento para contextos de milhões de tokens, e estudo contínuo de como ele interage com o comportamento de atenção.
Implementação no mundo real
Dando aos modelos Llama, Mistral e Qwen seu senso de ordem simbólica sem incorporações de posição separadas
Estendendo o contexto utilizável de um modelo de alguns milhares para dezenas de milhares de tokens por meio de interpolação ou YaRN
Ajudar os modelos de código a rastrear distâncias relativas entre colchetes, funções e referências em arquivos longos
Apoiar a resposta a perguntas de documentos longos, onde a posição relativa entre a pergunta e a evidência é importante
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Viés de posição ALiBi
Perguntas frequentes
What is Rotary Position Embeddings?
Rotary Position Embeddings (RoPE) codifica onde cada token fica em uma sequência, girando sua consulta e vetores-chave em um ângulo proporcional à posição. Este truque elegante permite que os transformadores entendam distâncias relativas e se estendam normalmente para contextos mais longos.
Como o RoPE injeta informações de posição em um transformador?
O RoPE gira os vetores de consulta e de chave em um ângulo proporcional à posição, em vez de adicionar um vetor de posição separado.
Quais partes do cálculo da atenção o RoPE modifica?
RoPE aplica suas rotações aos vetores de consulta e chave, deixando os vetores de valor intactos.
Por que pares de dimensões diferentes giram em frequências diferentes no RoPE?
Assim como os ponteiros do relógio funcionam em velocidades diferentes, as frequências variadas permitem que alguns pares codifiquem ordens de curto alcance e outros, posições de longo alcance.
Qual é o objetivo de técnicas como interpolação de posição, escalonamento com reconhecimento de NTK e YaRN?
Esses métodos redimensionam as frequências de rotação do RoPE para que um modelo possa lidar com contextos muito mais longos do que seu comprimento de treinamento original.