Entrenamiento óptimo en computación de Chinchilla
Chinchilla es un hallazgo de DeepMind de 2022 de que la mayoría de los modelos de lenguajes grandes estaban muy poco capacitados: para un presupuesto de computación fijo, se deben escalar los parámetros y los datos de manera aproximadamente equitativa, no solo construir un modelo más grande.
Descripción general
It reshaped how the industry balances model size against training data.
Buceo profundo
El artículo Chinchilla de DeepMind revisó el escalado y entrenó más de 400 modelos para encontrar el equilibrio óptimo de computación. La regla general del titular: el tamaño del modelo y los tokens de entrenamiento deberían crecer al mismo tiempo, aproximadamente 20 tokens de entrenamiento por parámetro. Para demostrarlo, entrenaron a Chinchilla, un modelo de 70 mil millones de parámetros en 1,4 billones de tokens, utilizando el mismo cálculo que el Gopher de 280 mil millones de parámetros entrenado en muchos menos tokens. Chinchilla, a pesar de ser cuatro veces más pequeña, superó a Gopher, GPT-3 y otros gigantes en casi todos los puntos de referencia. La lección anuló la conclusión anterior de OpenAI que favorecía el tamaño sobre los datos, mostrando que muchos modelos emblemáticos estaban dejando el rendimiento sobre la mesa por ser demasiado grandes y carecer de datos.
Información técnica
Pérdida de ajuste de Chinchilla como L(N,D) = E + A·N^(-α) + B·D^(-β), con α y β cerca de 0,34, lo que significa que los parámetros y los datos contribuyen casi simétricamente. La optimización de esto bajo una restricción de cálculo fija (calcular ≈ 6·N·D para transformadores) produce el resultado de igual escala. Un modelo más pequeño y rico en datos también es más barato de ejecutar en inferencia, por lo que su ventaja aumenta en la implementación, no solo en el entrenamiento.
Impacto Estratégico
Decisiones más claras
Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.
Costo y presupuesto
Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.
Equipo y flujo de trabajo
Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.
El futuro de la formación informática óptima de Chinchilla
Los modelos modernos como Llama 3 superan deliberadamente la proporción de 20 tokens por parámetro de Chinchilla, entrenando modelos pequeños con billones de tokens para abaratar la inferencia, aceptando un cálculo de entrenamiento subóptimo. A medida que escasean los buenos datos, aumenta el interés por las épocas repetidas, los datos sintéticos y el filtrado de calidad. Chinchilla sigue siendo el punto de referencia, pero lo óptimo depende cada vez más del coste de inferencia de por vida, no sólo del presupuesto único de formación.
Implementación en el mundo real
Elegir entrenar un modelo de 7 mil millones de parámetros con 2 billones de tokens en lugar de un modelo de 30 mil millones con muy pocos datos para el mismo presupuesto.
Estimar que un modelo de 10 mil millones de parámetros necesita aproximadamente 200 mil millones de tokens para alcanzar el punto óptimo de computación.
Justificar un modelo implementado más pequeño para reducir los costos de inferencia por consulta y al mismo tiempo igualar la calidad de un rival más grande.
Auditar un modelo existente y concluir que no estaba suficientemente entrenado, luego planificar una ejecución de entrenamiento más larga en lugar de un aumento de parámetros.
Riesgos y barandillas
Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.
Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.
Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.
Hoja de ruta de implementación
Comience con una definición en lenguaje sencillo del resultado que necesita.
Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.
Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.
Documente dónde ayuda Chinchilla Compute-Optimal Training y dónde son mejores los métodos más simples.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Entrenamiento en el momento del examen
Preguntas frecuentes
What is Chinchilla Compute-Optimal Training?
Chinchilla es un hallazgo de DeepMind de 2022 de que la mayoría de los modelos de lenguajes grandes estaban muy poco capacitados: para un presupuesto de computación fijo, se deben escalar los parámetros y los datos de manera aproximadamente equitativa, no solo construir un modelo más grande. Reformó la forma en que la industria equilibra el tamaño del modelo con los datos de entrenamiento.
¿Cuál es la famosa regla general de Chinchilla para un entrenamiento óptimo en computación?
DeepMind encontró que los parámetros y tokens deberían escalarse juntos a aproximadamente 20 tokens por parámetro para un presupuesto informático determinado.
¿Cómo se compara la Chinchilla con parámetros 70B con la Gopher con parámetros 280B?
Entrenada con muchos más tokens con el mismo cálculo, Chinchilla venció al Gopher, mucho más grande, en la mayoría de los puntos de referencia.
¿Qué problema clave reveló el artículo de Chinchilla sobre los grandes modelos anteriores?
Modelos como GPT-3 y Gopher eran demasiado grandes en relación con sus datos de entrenamiento, lo que dejaba el rendimiento sin alcanzar.
¿Aproximadamente cuántos tokens sugiere la regla de Chinchilla para un modelo de 10 mil millones de parámetros?
Con 20 tokens por parámetro, 10 mil millones de parámetros implican alrededor de 200 mil millones de tokens de entrenamiento.
Además de la eficiencia del entrenamiento, ¿por qué es atractivo para la implementación un modelo más pequeño y rico en datos?
Menos parámetros significan un menor cálculo por consulta, por lo que los ahorros se acumulan cada vez que se utiliza el modelo.