Tokenización de subpalabras
La tokenización de subpalabras divide el texto en unidades más pequeñas que las palabras pero más grandes que los caracteres, como "token" más "ización".
Descripción general
It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.
Buceo profundo
Las palabras son demasiadas para enumerarlas (los vocabularios serían enormes y omitirían palabras raras), mientras que los caracteres individuales tienen poco significado y hacen secuencias muy largas. La tokenización de subpalabras es el compromiso: mantiene completas las palabras frecuentes pero divide las palabras raras o complejas en fragmentos significativos. La "infelicidad" podría convertirse en "infelicidad", "infelicidad". Los algoritmos principales incluyen codificación de par de bytes (utilizado por GPT), WordPiece (utilizado por BERT) y Unigram/SentencePiece (utilizado por T5 y muchos modelos multilingües). Este enfoque maneja palabras invisibles con elegancia, comparte piezas entre palabras relacionadas ("play", "playing", "played") y admite cualquier idioma. Cada fragmento se asigna a un ID entero, y estos ID son los que la capa de incrustación del modelo convierte en vectores.
Información técnica
Los diferentes algoritmos eligen las subpalabras de manera diferente: BPE fusiona pares frecuentes de abajo hacia arriba, WordPieza selecciona las fusiones que aumentan la probabilidad del corpus y Unigram comienza con un vocabulario amplio y elimina los tokens que menos dañan la probabilidad. WordPieza marca partes internas de palabras con un prefijo '##', mientras que SentencePieza trata los espacios como un símbolo especial por lo que funciona directamente en texto sin formato sin dividir previamente los espacios en blanco, ideal para idiomas sin espacios.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la tokenización de subpalabras
La tokenización de subpalabras seguirá siendo dominante porque es rápida y compacta, pero sus debilidades, divisiones incómodas en matemáticas, código y escrituras raras, además de costos desiguales de tokens en todos los idiomas, están impulsando la investigación sobre modelos a nivel de bytes y sin tokens. Espere tokenizadores más inteligentes, posiblemente aprendidos o adaptables, y una mayor equidad multilingüe para que el texto que no esté en inglés no se vea penalizado con muchos más tokens por oración.
Implementación en el mundo real
BERT utiliza la tokenización de WordPieza, marcando piezas de continuación como '##ing' para reconstruir las palabras originales.
T5 y muchos modelos multilingües utilizan SentencePiece, que maneja directamente idiomas sin espacios como el japonés.
Los modelos de chat dividen un término técnico poco común en fragmentos conocidos en lugar de fallar en una palabra desconocida.
Los tokenizadores comparten subpalabras entre "ejecutar", "ejecutar" y "corredor", lo que permite que el modelo generalice la morfología de manera eficiente.
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Tokenización de SentencePiece
Preguntas frecuentes
What is Subword Tokenization?
La tokenización de subpalabras divide el texto en unidades más pequeñas que las palabras pero más grandes que los caracteres, como "token" más "ización". Es la forma estándar en que los modelos de lenguaje modernos convierten el texto en identificaciones discretas que realmente procesan, equilibrando el tamaño del vocabulario con el significado.
¿Qué problema resuelve la tokenización de subpalabras en comparación con el uso de palabras completas?
Los vocabularios de palabras completas son enormes y todavía faltan palabras raras; Las subpalabras mantienen los vocabularios manejables y dividen con elegancia las palabras desconocidas.
¿Cuál de estos es un algoritmo de tokenización de subpalabras utilizado por BERT?
BERT utiliza WordPiece, que selecciona las combinaciones que más aumentan la probabilidad del corpus de entrenamiento.
¿Cómo suele marcar WordPiece un fragmento que continúa una palabra?
WordPieza antepone las subpalabras internas de palabras con '##', por lo que 'playing' se convierte en 'play' más '##ing'.
¿Por qué SentencePiece se adapta bien a idiomas como el japonés?
SentencePiece opera con texto sin formato y codifica espacios como un símbolo especial, por lo que funciona incluso sin espacios entre palabras.
¿A qué se asigna en última instancia cada fragmento de subpalabra antes de llegar al modelo?
A cada subpalabra se le asigna un ID entero, que la capa de incrustación convierte en un vector que el modelo puede procesar.