GUÍA de IA en idiomas

Entrenamiento de predicción de múltiples tokens

En lugar de predecir sólo el siguiente token, el modelo está entrenado para predecir varios tokens futuros a la vez.

2 minutos de lecturaÚltima actualización

Descripción general

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

Buceo profundo

Los modelos de lenguaje estándar se entrenan con predicción del siguiente token: dado un contexto, predice el siguiente token. La predicción de múltiples tokens (MTP), popularizada por un artículo Meta de 2024 y adoptada en DeepSeek-V3, agrega cabezales de salida extra livianos para que el modelo prediga simultáneamente el siguiente token más el segundo, tercer y cuarto tokens por delante desde el mismo estado oculto. Esto obliga a la red a planificar más hacia el futuro y densifica la señal de entrenamiento: cada posición ahora contribuye con múltiples términos de pérdida. Meta informó avances especialmente grandes en codificación y razonamiento generativo, y los modelos más grandes se beneficiaron más. Lo más importante es que los cabezales adicionales se pueden descartar después del entrenamiento, por lo que no es necesario que el tamaño del modelo en el momento de la implementación aumente.

Información técnica

MTP conecta n cabezales de predicción independientes en la parte superior del tronco del transformador compartido; head k predice el token en la posición t+k a partir de la representación en la posición t. Las pérdidas se suman durante el entrenamiento. En la inferencia, los cabezales auxiliares permiten una decodificación autoespeculativa: el modelo propone varios tokens en una sola pasada, luego los verifica, logrando una generación hasta aproximadamente 3 veces más rápida sin cambiar la distribución de salida.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro del entrenamiento de predicción multitoken

MTP se está convirtiendo en un ingrediente predeterminado en las recetas de entrenamiento de frontera porque mejora tanto la calidad como la velocidad de inferencia a bajo costo. Espere una integración más estrecha con la decodificación especulativa, horizontes de predicción más profundos y su uso como objetivo auxiliar que mejore la planificación a largo plazo. Combinado con modelos de razonamiento, predecir múltiples pasos a seguir puede ayudar a los modelos a simular internamente las consecuencias antes de comprometerse con una respuesta.

Implementación en el mundo real

DeepSeek-V3 utiliza un objetivo MTP durante el entrenamiento previo para aumentar la eficiencia de los datos y permitir la decodificación especulativa

Los modelos de generación de código de Meta muestran mejoras en la precisión en HumanEval y MBPP al predecir múltiples tokens

Decodificación autoespeculativa: redactar de 3 a 4 tokens por pase directo y luego verificar para obtener una salida más rápida que preserve la distribución

Autocompletar más rápido en asistentes de codificación donde se proponen y verifican múltiples tokens plausibles en un solo paso

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Streaming especulativo y predicción de tokens múltiples

Preguntas frecuentes

What is Multi-Token Prediction Training?

En lugar de predecir sólo el siguiente token, el modelo está entrenado para predecir varios tokens futuros a la vez. Esto agudiza las señales de aprendizaje y desbloquea una inferencia más rápida a través de una decodificación autoespeculativa.

¿Qué aporta la predicción de múltiples tokens en comparación con el entrenamiento estándar del siguiente token?

MTP agrega cabezales de salida adicionales para que el modelo prediga el siguiente token más varios tokens más adelante desde un estado oculto.

¿Qué modelo utilizó en particular un objetivo de predicción de múltiples tokens en el preentrenamiento?

DeepSeek-V3 adoptó un objetivo de entrenamiento MTP para mejorar la eficiencia de los datos y permitir la decodificación especulativa.

¿Por qué MTP densifica la señal de entrenamiento?

Predecir varios tokens futuros significa que cada posición del token produce varias pérdidas de predicción, lo que genera más señal de aprendizaje por token.

¿Qué beneficio de inferencia permiten los cabezales de predicción adicionales?

Los cabezales auxiliares pueden redactar múltiples tokens por pasada que luego se verifican, acelerando la generación sin cambiar la distribución de salida.

¿Qué pasa con los cabezales auxiliares después del entrenamiento si no necesitas aceleraciones?

Los cabezales adicionales son opcionales en el momento del despliegue; descartarlos mantiene el modelo del mismo tamaño que el modelo estándar del siguiente token.