Entrenamiento de predicción de múltiples tokens
En lugar de predecir sólo el siguiente token, el modelo está entrenado para predecir varios tokens futuros a la vez.
Descripción general
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Buceo profundo
Los modelos de lenguaje estándar se entrenan con predicción del siguiente token: dado un contexto, predice el siguiente token. La predicción de múltiples tokens (MTP), popularizada por un artículo Meta de 2024 y adoptada en DeepSeek-V3, agrega cabezales de salida extra livianos para que el modelo prediga simultáneamente el siguiente token más el segundo, tercer y cuarto tokens por delante desde el mismo estado oculto. Esto obliga a la red a planificar más hacia el futuro y densifica la señal de entrenamiento: cada posición ahora contribuye con múltiples términos de pérdida. Meta informó avances especialmente grandes en codificación y razonamiento generativo, y los modelos más grandes se beneficiaron más. Lo más importante es que los cabezales adicionales se pueden descartar después del entrenamiento, por lo que no es necesario que el tamaño del modelo en el momento de la implementación aumente.
Información técnica
MTP conecta n cabezales de predicción independientes en la parte superior del tronco del transformador compartido; head k predice el token en la posición t+k a partir de la representación en la posición t. Las pérdidas se suman durante el entrenamiento. En la inferencia, los cabezales auxiliares permiten una decodificación autoespeculativa: el modelo propone varios tokens en una sola pasada, luego los verifica, logrando una generación hasta aproximadamente 3 veces más rápida sin cambiar la distribución de salida.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro del entrenamiento de predicción multitoken
MTP se está convirtiendo en un ingrediente predeterminado en las recetas de entrenamiento de frontera porque mejora tanto la calidad como la velocidad de inferencia a bajo costo. Espere una integración más estrecha con la decodificación especulativa, horizontes de predicción más profundos y su uso como objetivo auxiliar que mejore la planificación a largo plazo. Combinado con modelos de razonamiento, predecir múltiples pasos a seguir puede ayudar a los modelos a simular internamente las consecuencias antes de comprometerse con una respuesta.
Implementación en el mundo real
DeepSeek-V3 utiliza un objetivo MTP durante el entrenamiento previo para aumentar la eficiencia de los datos y permitir la decodificación especulativa
Los modelos de generación de código de Meta muestran mejoras en la precisión en HumanEval y MBPP al predecir múltiples tokens
Decodificación autoespeculativa: redactar de 3 a 4 tokens por pase directo y luego verificar para obtener una salida más rápida que preserve la distribución
Autocompletar más rápido en asistentes de codificación donde se proponen y verifican múltiples tokens plausibles en un solo paso
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Streaming especulativo y predicción de tokens múltiples
Preguntas frecuentes
What is Multi-Token Prediction Training?
En lugar de predecir sólo el siguiente token, el modelo está entrenado para predecir varios tokens futuros a la vez. Esto agudiza las señales de aprendizaje y desbloquea una inferencia más rápida a través de una decodificación autoespeculativa.
¿Qué aporta la predicción de múltiples tokens en comparación con el entrenamiento estándar del siguiente token?
MTP agrega cabezales de salida adicionales para que el modelo prediga el siguiente token más varios tokens más adelante desde un estado oculto.
¿Qué modelo utilizó en particular un objetivo de predicción de múltiples tokens en el preentrenamiento?
DeepSeek-V3 adoptó un objetivo de entrenamiento MTP para mejorar la eficiencia de los datos y permitir la decodificación especulativa.
¿Por qué MTP densifica la señal de entrenamiento?
Predecir varios tokens futuros significa que cada posición del token produce varias pérdidas de predicción, lo que genera más señal de aprendizaje por token.
¿Qué beneficio de inferencia permiten los cabezales de predicción adicionales?
Los cabezales auxiliares pueden redactar múltiples tokens por pasada que luego se verifican, acelerando la generación sin cambiar la distribución de salida.
¿Qué pasa con los cabezales auxiliares después del entrenamiento si no necesitas aceleraciones?
Los cabezales adicionales son opcionales en el momento del despliegue; descartarlos mantiene el modelo del mismo tamaño que el modelo estándar del siguiente token.