GUÍA DE FUNDAMENTOS

Entrenamiento en el momento del examen

El entrenamiento en el momento de la prueba (TTT) permite que un modelo siga aprendiendo de cada nueva entrada en el momento en que hace una predicción, en lugar de permanecer congelado después del entrenamiento.

2 minutos de lecturaÚltima actualización

Descripción general

It is a powerful way to adapt to distribution shift and squeeze extra performance out of fixed models.

Buceo profundo

El aprendizaje automático convencional divide el mundo claramente: entrenas, congelas las pesas y luego te despliegas. El entrenamiento en el momento de la prueba desafía eso al realizar una pequeña ráfaga de aprendizaje en el ejemplo de prueba antes de predecir. Debido a que la etiqueta verdadera se desconoce en el momento de la prueba, TTT utiliza una tarea auxiliar autosupervisada, como predecir la orientación de una imagen rotada o reconstruir un parche enmascarado, cuya pérdida se puede calcular sin etiquetas. La optimización de esa tarea en la muestra entrante empuja la representación compartida para que se ajuste a los nuevos datos, luego el cabezal principal hace su predicción. Una variante moderna le da la vuelta a la idea: la capa TTT trata su propio estado oculto como un modelo diminuto que se actualiza mediante el descenso de gradiente a lo largo de una secuencia, ofreciendo una alternativa de aprendizaje a la atención para contextos prolongados.

Información técnica

En las capas TTT del modelo de secuencia, el estado oculto no es un vector fijo sino los pesos de un modelo interno actualizado por un paso de gradiente por token en una pérdida de reconstrucción autosupervisada. Esto hace que la actualización recurrente sea expresiva como atención pero lineal en la longitud de la secuencia, ya que cada token desencadena una rápida optimización del bucle interno en lugar de atender a todos los tokens anteriores. El entrenamiento de bucle externo aprende cómo debe comportarse este aprendizaje interno.

Impacto Estratégico

Decisiones más claras

Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.

Costo y presupuesto

Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.

Equipo y flujo de trabajo

Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.

El futuro de la formación en el momento de los exámenes

TTT está ganando terreno como remedio para la fragilidad de los modelos congelados que enfrentan datos cambiantes del mundo real, y como una primitiva arquitectónica para un modelado eficiente de contexto largo que rivaliza con Transformers sin costo cuadrático. Espere híbridos que combinen capas TTT con atención, un uso más amplio en robótica y percepción donde las condiciones cambian continuamente, e investigaciones de seguridad sobre cómo la adaptación sobre la marcha interactúa con la confiabilidad, ya que un modelo que se actualiza a sí mismo en la inferencia también puede derivar en direcciones inesperadas.

Implementación en el mundo real

Adaptar un clasificador de imágenes sobre la marcha cuando las fotos de despliegue difieren de los datos de entrenamiento (nueva iluminación, clima o cámaras)

Capas TTT como alternativa a Transformer que maneja secuencias muy largas con actualizaciones en tiempo lineal

Mejorar los modelos médicos o científicos a partir de datos distintos de un solo hospital o laboratorio sin necesidad de un reentrenamiento completo

Impulsar la robustez ante entradas corruptas o ruidosas ajustando rápidamente las representaciones por muestra

Riesgos y barandillas

Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.

Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.

Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.

Hoja de ruta de implementación

1

Comience con una definición en lenguaje sencillo del resultado que necesita.

2

Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.

3

Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.

4

Documente dónde ayuda la capacitación durante el tiempo de prueba y dónde son mejores los métodos más simples.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Aumento del tiempo de prueba

Preguntas frecuentes

What is Test-Time Training?

El entrenamiento en el momento de la prueba (TTT) permite que un modelo siga aprendiendo de cada nueva entrada en el momento en que hace una predicción, en lugar de permanecer congelado después del entrenamiento. Es una forma poderosa de adaptarse al cambio de distribución y obtener un rendimiento adicional de los modelos fijos.

¿Qué diferencia la formación previa al examen de la formación estándar?

TTT realiza una pequeña cantidad de aprendizaje en la propia muestra de prueba entrante, en lugar de congelar los pesos después de la fase de entrenamiento.

¿Por qué el TTT clásico depende de una tarea auxiliar autosupervisada?

Dado que se desconoce la verdadera etiqueta de un ejemplo de prueba, TTT utiliza una tarea como la predicción de rotación o la reconstrucción enmascarada cuya pérdida no necesita etiqueta.

En una capa de secuencia TTT, ¿en qué se convierte efectivamente el estado oculto?

La capa TTT trata su estado oculto como un modelo interno cuyos pesos se actualizan mediante un paso de gradiente en cada token.

¿Qué ventaja clave de eficiencia ofrecen las capas de secuencia TTT sobre la atención estándar?

Al realizar una actualización rápida del bucle interno por token en lugar de atender a todos los tokens anteriores, las capas TTT logran un escalado de tiempo lineal.

¿Qué problema del mundo real es especialmente adecuado para abordar el TTT?

TTT ayuda a los modelos congelados a afrontar cuando las condiciones de prueba (iluminación, sensores, dominios) difieren de lo que vieron en el entrenamiento.