GUIA Técnico

YaRN e extensão de comprimento de contexto

YaRN (Yet another RoPE extensioN) é uma técnica eficiente para estender a janela de contexto utilizável de um modelo muito além do que foi treinado.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro do YaRN e extensão de comprimento de contexto
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Mergulho profundo

A maioria dos LLMs modernos codificam posições de token com RoPE (Rotary Position Embeddings), que giram a consulta e os vetores-chave por ângulos vinculados à posição. Quando você alimenta sequências maiores que a duração do treinamento, essas rotações entram em intervalos invisíveis e o modelo quebra. YaRN, introduzido em 2023 por Bowen Peng e colaboradores, corrige isso com interpolação compatível com NTK aplicada por frequência: ele deixa as dimensões de alta frequência (que capturam relacionamentos locais de curto alcance) praticamente intocadas enquanto interpola dimensões de baixa frequência (que rastreiam a posição de longo alcance). O YaRN também adiciona um ajuste de temperatura à atenção para combater as mudanças de entropia que vêm de contextos mais longos. O resultado é um forte desempenho em contextos longos, após o ajuste fino de apenas uma pequena fração dos dados e das etapas exigidas pelas abordagens ingênuas.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro do YaRN e extensão de comprimento de contexto

A extensão de contexto agora é uma prática padrão: modelos abertos enviam rotineiramente variantes estendidas do YaRN atingindo 128 mil tokens ou mais. A pesquisa está avançando em direção a métodos que ampliam o contexto com ajuste fino zero ou próximo de zero, combinam o reescalonamento RoPE com truques de padrão de atenção e mantêm a qualidade em toda a janela, em vez de apenas nas extremidades. Espere uma integração mais estreita dessas técnicas no pré-treinamento, desde que o contexto seja nativo e não adaptado.

Implementação no mundo real

Estendendo um modelo de contexto aberto de 4K para 32K ou 128K para respostas a perguntas de documentos longos com breve ajuste fino

Habilitando sistemas de recuperação aumentada para ingerir muitas passagens concatenadas sem truncamento

Capacitando assistentes de código que precisam de um grande arquivo de repositório inteiro ou de vários arquivos em um único prompt

Adaptando um modelo básico para longas conversas múltiplas que acumulam grandes históricos de bate-papo

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is YaRN and Context Length Extension?

YaRN (Yet another RoPE extensioN) é uma técnica eficiente para estender a janela de contexto utilizável de um modelo muito além do que foi treinado. Ele redimensiona habilmente os embeddings de posição rotativa para que um modelo treinado em, digamos, tokens de 4K possa lidar com 32K ou mais com o mínimo de ajuste fino.

Qual método de codificação de posição o YaRN modifica para estender o contexto?

YaRN, cujo nome significa Mais uma extensão RoPE, redimensiona os embeddings de posição rotativa usados ​​​​na maioria dos LLMs modernos.

O que dá errado quando um modelo RoPE vê sequências maiores que a duração do treinamento?

Posições além do treinamento produzem ângulos de rotação que o modelo nunca viu, de modo que o comportamento de atenção se degrada drasticamente.

Como o YaRN trata as diferentes dimensões de frequência do RoPE?

YaRN usa uma rampa NTK por partes que interpola dims de baixa frequência de comprimento de onda longo e deixa dims de alta frequência de curto alcance praticamente intactos.

Além de redimensionar as frequências, que ajustes extras o YaRN aplica?

O YaRN adiciona uma escala de temperatura aos logits de atenção para neutralizar as mudanças de entropia que ocorrem à medida que o contexto cresce.

Qual é a principal vantagem prática do YaRN em relação à interpolação ingênua?

O YaRN alcança forte qualidade de contexto longo após o ajuste fino em uma pequena fração dos dados que os métodos ingênuos exigem.