GUIA de IA de linguagem

Dimensionamento da janela de contexto do YaRN

YaRN (Yet another RoPE extensioN) é uma técnica que estende a janela de contexto utilizável de um transformador muito além do que foi treinado, com ajuste mínimo mínimo.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it lets existing models handle much longer documents without retraining from scratch.

Mergulho profundo

A maioria dos LLMs modernos codificam posições de palavras usando Rotary Position Embeddings (RoPE), que funcionam bem apenas até o comprimento que o modelo viu durante o treinamento. Alimente em uma sequência mais longa e o modelo se degrada gravemente. O YaRN resolve isso redimensionando as frequências de rotação do RoPE de uma forma consciente da frequência: as dimensões de alta frequência (que capturam relacionamentos locais e próximos) são deixadas praticamente intactas, enquanto as dimensões de baixa frequência (que capturam a posição de longo alcance) são interpoladas. Ele também adiciona um ajuste de temperatura à atenção para manter os logits bem comportados em longas distâncias. O resultado, demonstrado em modelos LLaMA, estende o contexto de tokens de 4K para 64K-128K usando apenas cerca de 0,1% dos dados de treinamento originais e algumas centenas de etapas de ajuste fino.

Visão Técnica

RoPE gira vetores de consulta e chaves em um ângulo proporcional à posição e a uma frequência por dimensão. A interpolação linear ingênua (interpolação de posição) comprime todas as frequências igualmente, prejudicando os detalhes locais. Em vez disso, o YaRN aplica 'NTK por partes': ele interpola apenas as dimensões de baixa frequência (comprimento de onda longo), deixa as de alta frequência em paz e aumenta entre elas. Uma escala de temperatura de atenção compensa a mudança de entropia, preservando a precisão em comprimentos estendidos.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro do dimensionamento da janela de contexto do YaRN

A extensão com reconhecimento de frequência no estilo YaRN tornou-se um ingrediente padrão para o envio de modelos de contexto longo; variantes e sucessores continuam aparecendo à medida que os laboratórios avançam em direção a janelas de milhões de tokens. Espere uma integração mais estreita com atenção eficiente, compactação de cache KV e escalonamento dinâmico que se ajusta rapidamente de acordo com a solicitação. A tendência mais ampla é dissociar “por quanto tempo um modelo foi treinado” de “por quanto tempo ele pode ser lido de forma útil”, tornando o contexto longo um recurso pós-treinamento barato, em vez de um compromisso arquitetônico caro.

Implementação no mundo real

Estendendo um modelo LLaMA aberto de 4K para 128K tokens para que ele possa ingerir uma base de código inteira ou um contrato longo em uma única passagem

Permitir que um chatbot retenha históricos de conversas muito longos sem truncar turnos anteriores

Resumindo documentos do tamanho de um livro ou transcrições de várias horas que excedem a janela nativa do modelo base

Adaptação barata de um modelo pré-treinado para tarefas de recuperação de contexto longo usando apenas uma pequena execução de ajuste fino

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is YaRN Context Window Scaling?

YaRN (Yet another RoPE extensioN) é uma técnica que estende a janela de contexto utilizável de um transformador muito além do que foi treinado, com ajuste mínimo mínimo. É importante porque permite que os modelos existentes lidem com documentos muito mais longos sem precisar retreinar do zero.

Qual esquema de codificação de posição o YaRN modifica para estender o comprimento do contexto?

YaRN significa 'Yet another RoPE extensioN' e funciona redimensionando as frequências de rotação usadas em Rotary Position Embeddings.

Como o YaRN trata as dimensões RoPE de alta frequência versus baixa frequência?

A abordagem 'NTK por partes' do YaRN preserva dimensões de alta frequência (locais) enquanto interpola as de baixa frequência (longo alcance) para evitar danos aos detalhes locais.

Qual é a principal vantagem de eficiência do YaRN em relação ao treinamento de um modelo de contexto longo do zero?

O YaRN pode estender o contexto usando aproximadamente 0,1% dos dados de treinamento originais e um pequeno número de etapas de ajuste fino, muito mais barato do que o retreinamento.

Além de redimensionar as frequências, que ajuste extra o YaRN aplica para manter estável a atenção de longo alcance?

O YaRN modifica a temperatura de atenção para compensar a mudança de entropia/logit que ocorre quando as sequências ficam muito mais longas.

Que problema ocorre se você alimentar sequências de modelo RoPE por muito mais tempo do que foi treinado, sem qualquer escalonamento?

O RoPE generaliza mal para posições longas invisíveis, portanto a qualidade entra em colapso, a menos que as frequências sejam redimensionadas.