Tokenização WordPiece
WordPiece é o algoritmo de tokenização de subpalavras que alimenta o BERT e muitos modelos Google, dividindo palavras em fragmentos reutilizáveis para que um modelo possa lidar com qualquer texto com um vocabulário fixo.
Visão geral
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Mergulho profundo
WordPiece constrói um vocabulário de unidades de subpalavras em vez de palavras inteiras ou caracteres únicos. Começando com caracteres individuais, ele mescla avidamente o par de símbolos que mais aumenta a probabilidade do corpus de treinamento, repetindo até atingir um tamanho de vocabulário alvo (BERT usa cerca de 30.000 tokens). Na inferência, ele tokeniza avidamente da esquerda para a direita, combinando a subpalavra mais longa do vocabulário e continuando com o restante. As peças de continuação dentro de uma palavra são marcadas com um prefixo '##', então 'playing' se torna 'play' + '##ing'. Isso resolve o problema da falta de vocabulário: palavras raras ou invisíveis simplesmente se decompõem em fragmentos conhecidos, até caracteres únicos, se necessário, enquanto palavras comuns permanecem como tokens únicos para maior eficiência.
Visão Técnica
WordPiece difere da codificação de pares de bytes em seu critério de mesclagem. BPE mescla o par adjacente mais frequente; O WordPiece mescla o par que maximiza a probabilidade dos dados de treinamento, escolhendo aproximadamente o par cuja frequência conjunta mais excede o produto das frequências de suas partes. O marcador '##' distingue as partes iniciais das palavras das continuações, permitindo que o tokenizador reconstrua os limites das palavras de forma inequívoca ao decodificar de volta para o texto.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro da tokenização WordPiece
Os modelos de linguagem grandes mais recentes favorecem cada vez mais os modelos de unigrama BPE (família GPT) ou SentencePiece em nível de byte, que evitam o pré-processamento específico da linguagem e lidam com qualquer entrada Unicode. WordPiece continua sendo fundamental em codificadores derivados de BERT, ainda amplamente implantados para pesquisa e classificação. Espere o uso contínuo na produção de PNL, juntamente com pesquisas em modelos de bytes e caracteres livres de tokenizer que podem eventualmente reduzir completamente a dependência de vocabulários de subpalavras fixas.
Implementação no mundo real
O BERT tokeniza as consultas de pesquisa na pesquisa Google, dividindo termos desconhecidos em subpalavras para que o modelo ainda possa corresponder às páginas relevantes.
O BertTokenizer da Hugging Face usa WordPiece para converter texto bruto em IDs de token alimentados ao BERT para análise de sentimento e reconhecimento de entidade nomeada.
O BERT multilíngue usa um vocabulário WordPiece compartilhado em mais de 100 idiomas, permitindo que fragmentos sejam reutilizados em scripts relacionados.
As variantes do DistilBERT e do BERT clínico/biomédico herdam o WordPiece, lidando com termos médicos raros como 'pneumonoconiose', dividindo-os em pedaços conhecidos.
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Tokenização de subpalavras
Perguntas frequentes
What is WordPiece Tokenization?
WordPiece é o algoritmo de tokenização de subpalavras que alimenta o BERT e muitos modelos Google, dividindo palavras em fragmentos reutilizáveis para que um modelo possa lidar com qualquer texto com um vocabulário fixo. É por isso que um modelo que nunca viu 'infelicidade' ainda pode entendê-la lendo 'un', '##happy' e '##ness'.
O que o prefixo '##' indica na saída do WordPiece?
WordPiece marca continuações de subpalavras com '##', então 'playing' se torna 'play' + '##ing', permitindo que o decodificador reconstrua os limites das palavras.
Qual é aproximadamente o tamanho do vocabulário WordPiece usado pelo BERT original?
O BERT usa um vocabulário WordPiece de aproximadamente 30.000 unidades de subpalavras, equilibrando a cobertura com o tamanho da tabela de incorporação.
Como o critério de mesclagem do WordPiece difere da codificação padrão de pares de bytes?
O BPE mescla o par adjacente mais frequente, enquanto o WordPiece mescla o par que mais aumenta a probabilidade do corpus, favorecendo pares cuja frequência conjunta excede o produto de suas partes.
Como o WordPiece lida com uma palavra nunca vista durante o treinamento?
Palavras invisíveis são divididas nas subpalavras conhecidas mais longas, voltando a caracteres únicos, o que resolve o problema de falta de vocabulário.
No momento da inferência, como o WordPiece escolhe como dividir uma palavra?
WordPiece tokeniza avidamente, combinando a entrada de vocabulário mais longa começando na posição atual e repetindo no restante.