Tokenización
La tokenización es el paso que corta el texto en partes más pequeñas llamadas tokens, las unidades que un modelo de lenguaje realmente lee y predice.
Descripción general
It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.
Buceo profundo
Antes de que un modelo vea su texto, un tokenizador lo divide en tokens, que generalmente son fragmentos de subpalabras en lugar de palabras completas o letras individuales. La palabra "infelicidad" podría convertirse en "no", "felicidad" o "tokenización" podría dividirse en "token" y "ización". Las palabras comunes a menudo se asignan a un solo token, mientras que las palabras, nombres o códigos raros se dividen en varios. Luego, cada token se asigna a un número de identificación que el modelo convierte en un vector. Esto es importante en la práctica porque los modelos tienen ventanas de contexto fijas medidas en tokens y las API facturan por token, por lo que una regla general aproximada en inglés es aproximadamente 4 caracteres o 0,75 palabras por token. La tokenización también explica las peculiaridades clásicas del modelo: contar letras o escribir con exactitud es difícil porque el modelo ve fragmentos, no caracteres individuales.
Información técnica
La mayoría de los LLM modernos utilizan tokenización de subpalabras, como la codificación de pares de bytes (BPE) o sus variantes a nivel de bytes. BPE comienza a partir de caracteres y fusiona repetidamente los pares adyacentes más frecuentes para crear un vocabulario fijo (a menudo entre 30.000 y 100.000+ tokens). Esto equilibra dos extremos: la tokenización a nivel de palabra no puede manejar palabras invisibles, mientras que a nivel de carácter hace que las secuencias sean muy largas. Las subpalabras permiten que el modelo represente cualquier cadena, incluidos errores tipográficos y palabras nuevas, componiendo piezas conocidas, manteniendo las secuencias razonablemente cortas.
Impacto Estratégico
Decisiones más claras
Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.
Costo y presupuesto
Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.
Equipo y flujo de trabajo
Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.
El futuro de la tokenización
La tokenización es un área de investigación activa precisamente porque limita la eficiencia y la equidad. Los idiomas que se tokenizan en más partes cuestan más y consumen el contexto más rápido, por lo que la equidad multilingüe es una preocupación real que se aborda con vocabularios mejores y más equilibrados. Los investigadores también están explorando modelos sin token o a nivel de bytes (como ByT5) y han aprendido la tokenización que podría eliminar por completo el frágil paso ajustado a mano. Por ahora, espere vocabularios más amplios, tokenizadores multilingües más inteligentes y una mayor conciencia de los usuarios sobre los precios basados en tokens y la presupuestación contextual.
Implementación en el mundo real
El precio de API para modelos como GPT y Claude se factura por token de entrada y salida, por lo que el recuento de tokens afecta directamente el costo.
Los límites de la ventana de contexto (por ejemplo, 128 000 o 200 000 tokens) se miden en tokens, lo que limita la cantidad de texto o código que puede incluir.
Los desarrolladores utilizan tokenizadores (como tiktoken) para estimar el tamaño del mensaje y recortar el contenido antes de enviar las solicitudes.
La tokenización explica por qué los modelos tienen dificultades para contar letras en una palabra o invertir una cadena, ya que ven fragmentos de subpalabras, no caracteres.
Riesgos y barandillas
Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.
Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.
Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.
Hoja de ruta de implementación
Comience con una definición en lenguaje sencillo del resultado que necesita.
Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.
Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.
Documente dónde ayuda la tokenización y dónde son mejores los métodos más simples.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Tokenización de SentencePiece
Preguntas frecuentes
What is Tokenization?
La tokenización es el paso que corta el texto en partes más pequeñas llamadas tokens, las unidades que un modelo de lenguaje realmente lee y predice. Determina silenciosamente el costo, los límites del contexto e incluso qué tan bien un modelo maneja la ortografía y las palabras raras.
¿Qué es un 'token' en el contexto de un modelo de lenguaje?
Los tokens son las unidades que procesa un modelo, generalmente fragmentos de subpalabras, a veces palabras completas o caracteres individuales.
¿Qué enfoque de tokenización utilizan la mayoría de los LLM modernos?
Los métodos de subpalabras como BPE fusionan pares de caracteres frecuentes, equilibrando las debilidades de los enfoques puros a nivel de palabra y de carácter.
¿Por qué la tokenización dificulta tareas como contar las letras de una palabra para los LLM?
Debido a que el texto se agrupa en tokens de subpalabras, el modelo no percibe directamente cada carácter, lo que hace que las tareas a nivel de letras sean propensas a errores.
¿Por qué la tokenización es importante para el costo de la API y los límites de contexto?
Los proveedores facturan por token y las ventanas de contexto se dimensionan en tokens, por lo que el recuento de tokens determina tanto el precio como la cantidad que se puede incluir.
¿Por qué la misma frase puede costar más tokens en algunos idiomas que en inglés?
Los vocabularios entrenados principalmente en inglés dividen otros idiomas en más tokens, lo que aumenta el costo y consume el contexto más rápido.