GUIA de fundamentos

Tokenização

A tokenização é a etapa que divide o texto em pedaços menores chamados tokens, as unidades que um modelo de linguagem realmente lê e prevê.

2 minutos de leituraÚltima atualização

Visão geral

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

Mergulho profundo

Antes que um modelo veja seu texto, um tokenizer o divide em tokens, que geralmente são pedaços de subpalavras, em vez de palavras inteiras ou letras únicas. A palavra 'infelicidade' pode se tornar 'in', 'felicidade', ou 'tokenização' pode se dividir em 'token' e 'ização'. Palavras comuns geralmente são mapeadas para um único token, enquanto palavras, nomes ou códigos raros são divididos em vários. Cada token é então mapeado para um número de identificação que o modelo converte em um vetor. Isso é importante na prática porque os modelos têm janelas de contexto fixas medidas em tokens e as APIs cobram por token, portanto, uma regra prática em inglês é de cerca de 4 caracteres ou 0,75 palavras por token. A tokenização também explica as peculiaridades do modelo clássico: contar letras ou escrever com exatidão é difícil porque o modelo vê pedaços, não caracteres individuais.

Visão Técnica

A maioria dos LLMs modernos usa tokenização de subpalavras, como Byte Pair Encoding (BPE) ou suas variantes em nível de byte. O BPE começa com caracteres e mescla repetidamente os pares adjacentes mais frequentes para construir um vocabulário fixo (geralmente de 30.000 a 100.000+ tokens). Isso equilibra dois extremos: a tokenização em nível de palavra não consegue lidar com palavras invisíveis, enquanto a tokenização em nível de caractere torna as sequências muito longas. As subpalavras permitem que o modelo represente qualquer string, incluindo erros de digitação e palavras novas, compondo peças conhecidas, enquanto mantém as sequências razoavelmente curtas.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da tokenização

A tokenização é uma área de pesquisa ativa precisamente porque limita a eficiência e a justiça. As línguas que são tokenizadas em mais partes custam mais e utilizam o contexto mais rapidamente, pelo que a justiça multilingue é uma preocupação real que deve ser abordada com vocabulários melhores e mais equilibrados. Os pesquisadores também estão explorando modelos sem token ou em nível de byte (como ByT5) e tokenização aprendida que poderia remover totalmente a frágil etapa de ajuste manual. Por enquanto, espere vocabulários maiores, tokenizadores multilíngues mais inteligentes e uma crescente conscientização dos usuários sobre preços baseados em tokens e orçamento de contexto.

Implementação no mundo real

O preço da API para modelos como GPT e Claude é cobrado por token de entrada e saída, portanto, a contagem de tokens afeta diretamente o custo.

Os limites da janela de contexto (por exemplo, 128 mil ou 200 mil tokens) são medidos em tokens, limitando a quantidade de texto ou código que você pode incluir.

Os desenvolvedores usam tokenizadores (como o tiktoken) para estimar o tamanho do prompt e cortar o conteúdo antes de enviar solicitações.

A tokenização explica por que os modelos têm dificuldade para contar letras em uma palavra ou reverter uma string, já que veem pedaços de subpalavras, não caracteres.

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde a tokenização ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Tokenização de FrasePiece

Perguntas frequentes

What is Tokenization?

A tokenização é a etapa que divide o texto em pedaços menores chamados tokens, as unidades que um modelo de linguagem realmente lê e prevê. Ele molda silenciosamente o custo, os limites de contexto e até mesmo o quão bem um modelo lida com a ortografia e palavras raras.

O que é um 'token' no contexto de um modelo de linguagem?

Tokens são as unidades que um modelo processa, geralmente pedaços de subpalavras, às vezes palavras inteiras ou caracteres únicos.

Qual abordagem de tokenização a maioria dos LLMs modernos usa?

Métodos de subpalavras, como BPE, mesclam pares de caracteres frequentes, equilibrando os pontos fracos das abordagens puras em nível de palavra e em nível de caractere.

Por que a tokenização dificulta tarefas como contar as letras de uma palavra para LLMs?

Como o texto é agrupado em tokens de subpalavras, o modelo não percebe diretamente cada caractere, tornando as tarefas em nível de letra propensas a erros.

Por que a tokenização é importante para o custo da API e os limites de contexto?

A fatura dos provedores por token e as janelas de contexto são dimensionadas em tokens, portanto, a contagem de tokens determina o preço e quanto você pode incluir.

Por que a mesma frase pode custar mais tokens em alguns idiomas do que em inglês?

Os vocabulários treinados principalmente em inglês dividem outros idiomas em mais tokens, aumentando os custos e consumindo o contexto mais rapidamente.