Modelos preliminares de decodificación especulativa
La decodificación especulativa utiliza un modelo de "borrador" pequeño y rápido para adivinar varios tokens próximos que luego un modelo grande verifica en una sola pasada.
Descripción general
It speeds up text generation 2-3x with no change to the output.
Buceo profundo
Los modelos de lenguaje grandes generan texto, un token a la vez, y cada paso requiere un avance completo a través de miles de millones de parámetros: lento y limitado por la memoria. La decodificación especulativa ataca esto combinando el gran modelo de "objetivo" con un modelo de "proyecto" barato. El borrador del modelo propone rápidamente una porción de, digamos, entre 4 y 8 tokens candidatos. Luego, el modelo grande los procesa todos en un único pase paralelo hacia adelante y los verifica cada uno. Se aceptan tokens que coincidan con lo que habría producido el modelo grande; se corrige el primer desajuste y se descarta el resto. Debido a que verificar varios tokens a la vez cuesta aproximadamente lo mismo que generar uno, las ejecuciones aceptadas son casi gratuitas. Fundamentalmente, un paso de muestreo de rechazo garantiza que la distribución final sea idéntica a ejecutar solo el modelo grande: velocidad sin pérdida de calidad.
Información técnica
El truco clave es una prueba de muestreo de rechazo modificada. Para cada token redactado, la probabilidad del modelo objetivo se compara con la del modelo borrador. Si el objetivo asigna igual o mayor probabilidad, se acepta el token; de lo contrario, se acepta con una probabilidad igual a la proporción y, al rechazarse, se toma una muestra de una ficha corregida a partir de una distribución residual ajustada. Esta matemática hace que el resultado sea demostrablemente equivalente al muestreo directo del modelo grande.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de los borradores de modelos de decodificación especulativa
Espere que los modelos preliminares se conviertan en una infraestructura estándar en servidores de inferencia como vLLM y TensorRT-LLM. Las variantes de autoespeculación (Medusa, EAGLE) eliminan por completo el modelo de borrador separado al agregar cabezas de predicción livianas, y la redacción basada en árboles verifica muchas continuaciones candidatas a la vez. A medida que las ventanas de contexto crecen y los costos de servicio dominan, los redactores más inteligentes y compatibles con los modelos y la verificación basada en el hardware aumentarán las tasas de aceptación y el rendimiento.
Implementación en el mundo real
Anthropic, OpenAI y Google utilizan decodificación especulativa para reducir la latencia y el costo de servicio en los asistentes de chat que atienden a millones de usuarios.
vLLM y NVIDIA TensorRT-LLM incluyen decodificación especulativa incorporada para que los autohospedadores puedan acelerar las implementaciones de Llama o Mistral.
Emparejar un modelo preliminar de 7B con un objetivo de 70B (por ejemplo, la familia Llama-3) para aproximadamente duplicar los tokens por segundo en una sola GPU.
Las herramientas de finalización de código utilizan un pequeño modelo borrador para proponer un texto estándar que el modelo más grande verifica, manteniendo las sugerencias ágiles en el editor.
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Ediciones especulativas para modelos de código
Preguntas frecuentes
What is Speculative Decoding Draft Models?
La decodificación especulativa utiliza un modelo de "borrador" pequeño y rápido para adivinar varios tokens próximos que luego un modelo grande verifica en una sola pasada. Acelera la generación de texto entre 2 y 3 veces sin cambios en la salida.
¿Cuál es el papel principal del modelo "borrador" en la decodificación especulativa?
El modelo de borrador pequeño adivina de manera económica los próximos tokens, que luego el modelo de destino grande verifica en una sola pasada paralela.
¿Por qué ahorrar tiempo al verificar varios tokens redactados a la vez?
La generación está ligada a la memoria; Verificar varios tokens en un pase por lotes es casi tan económico como un solo paso, por lo que las ejecuciones aceptadas son casi gratuitas.
¿Qué sucede con los tokens redactados después del primer token que el modelo objetivo rechaza?
La aceptación continúa hasta el primer desacuerdo; esa ficha se corrige y todas las fichas redactadas posteriormente se desechan.
¿Cómo garantiza la decodificación especulativa que la calidad de salida no se degrade?
Una prueba de muestreo de rechazo modificada garantiza que la distribución final del token coincida con el muestreo directamente del modelo objetivo.
¿Cuál de estos es un enfoque de 'autoespeculación' que evita un borrador de modelo separado?
Medusa y EAGLE agregan cabezales de predicción adicionales livianos al modelo principal para que pueda redactar sus propios tokens futuros.