A seguirPróximo guia
Interpolação de posição para extensão de contexto
IA de linguagem
GUIA Técnico
YaRN (Yet another RoPE extensioN) é uma técnica eficiente para estender a janela de contexto utilizável de um modelo muito além do que foi treinado.
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
A maioria dos LLMs modernos codificam posições de token com RoPE (Rotary Position Embeddings), que giram a consulta e os vetores-chave por ângulos vinculados à posição. Quando você alimenta sequências maiores que a duração do treinamento, essas rotações entram em intervalos invisíveis e o modelo quebra. YaRN, introduzido em 2023 por Bowen Peng e colaboradores, corrige isso com interpolação compatível com NTK aplicada por frequência: ele deixa as dimensões de alta frequência (que capturam relacionamentos locais de curto alcance) praticamente intocadas enquanto interpola dimensões de baixa frequência (que rastreiam a posição de longo alcance). O YaRN também adiciona um ajuste de temperatura à atenção para combater as mudanças de entropia que vêm de contextos mais longos. O resultado é um forte desempenho em contextos longos, após o ajuste fino de apenas uma pequena fração dos dados e das etapas exigidas pelas abordagens ingênuas.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
A extensão de contexto agora é uma prática padrão: modelos abertos enviam rotineiramente variantes estendidas do YaRN atingindo 128 mil tokens ou mais. A pesquisa está avançando em direção a métodos que ampliam o contexto com ajuste fino zero ou próximo de zero, combinam o reescalonamento RoPE com truques de padrão de atenção e mantêm a qualidade em toda a janela, em vez de apenas nas extremidades. Espere uma integração mais estreita dessas técnicas no pré-treinamento, desde que o contexto seja nativo e não adaptado.
Estendendo um modelo de contexto aberto de 4K para 32K ou 128K para respostas a perguntas de documentos longos com breve ajuste fino
Habilitando sistemas de recuperação aumentada para ingerir muitas passagens concatenadas sem truncamento
Capacitando assistentes de código que precisam de um grande arquivo de repositório inteiro ou de vários arquivos em um único prompt
Adaptando um modelo básico para longas conversas múltiplas que acumulam grandes históricos de bate-papo
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
YaRN (Yet another RoPE extensioN) é uma técnica eficiente para estender a janela de contexto utilizável de um modelo muito além do que foi treinado. Ele redimensiona habilmente os embeddings de posição rotativa para que um modelo treinado em, digamos, tokens de 4K possa lidar com 32K ou mais com o mínimo de ajuste fino.
YaRN, cujo nome significa Mais uma extensão RoPE, redimensiona os embeddings de posição rotativa usados na maioria dos LLMs modernos.
Posições além do treinamento produzem ângulos de rotação que o modelo nunca viu, de modo que o comportamento de atenção se degrada drasticamente.
YaRN usa uma rampa NTK por partes que interpola dims de baixa frequência de comprimento de onda longo e deixa dims de alta frequência de curto alcance praticamente intactos.
O YaRN adiciona uma escala de temperatura aos logits de atenção para neutralizar as mudanças de entropia que ocorrem à medida que o contexto cresce.
O YaRN alcança forte qualidade de contexto longo após o ajuste fino em uma pequena fração dos dados que os métodos ingênuos exigem.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Interpolação de posição para extensão de contexto
IA de linguagem