GUIDA AI FONDAMENTALI

Formazione ottimale per il calcolo di Chinchilla

Chinchilla è una scoperta di DeepMind del 2022 secondo cui la maggior parte dei modelli linguistici di grandi dimensioni erano gravemente sottoaddestrati: per un budget di calcolo fisso dovresti ridimensionare parametri e dati in modo più o meno uguale, non solo costruire un modello più grande.

2 minuti di letturaUltimo aggiornamento

Panoramica

Ha rimodellato il modo in cui il settore bilancia la dimensione del modello con i dati di addestramento.

Immersione profonda

Il documento Chinchilla di DeepMind ha rivisitato il ridimensionamento e ha addestrato oltre 400 modelli per trovare l'equilibrio ottimale per il calcolo. La regola pratica principale: le dimensioni del modello e i token di formazione dovrebbero crescere di pari passo, circa 20 token di formazione per parametro. Per dimostrarlo, hanno addestrato Chinchilla, un modello da 70 miliardi di parametri su 1,4 trilioni di token, utilizzando lo stesso calcolo del Gopher da 280 miliardi di parametri addestrato su molti meno token. Chinchilla, pur essendo quattro volte più piccolo, ha sovraperformato Gopher, GPT-3 e altri giganti su quasi tutti i benchmark. La lezione ha ribaltato la conclusione precedente di OpenAI secondo cui si privilegiavano le dimensioni rispetto ai dati, mostrando che molti modelli di punta lasciavano sul tavolo le prestazioni perché troppo grandi e affamati di dati.

Approfondimento tecnico

Perdita di adattamento del cincillà come L(N,D) = E + A·N^(-α) + B·D^(-β), con α e β entrambi vicini a 0,34, il che significa che parametri e dati contribuiscono in modo quasi simmetrico. Ottimizzandolo con un vincolo di calcolo fisso (calcolo ≈ 6·N·D per i trasformatori) si ottiene il risultato di uguale scala. Un modello più piccolo e ricco di dati è anche più economico da eseguire durante l'inferenza, quindi il suo vantaggio si estende alla distribuzione, non solo alla formazione.

Impatto strategico

Decisioni più chiare

Ti aiuta a separare le chiare affermazioni tecniche dal linguaggio di marketing.

Costo e budget

Puoi porre domande sull'implementazione migliore prima di spendere denaro o tempo.

Team e flusso di lavoro

I team con una comprensione condivisa prendono decisioni migliori su prodotti, politiche e apprendimento.

Il futuro della formazione computazionale ottimale di Chinchilla

Modelli moderni come Llama 3 si spingono deliberatamente ben oltre il rapporto di 20 token per parametro di Chinchilla, addestrando piccoli modelli su trilioni di token per rendere l'inferenza economica, accettando un calcolo di training non ottimale. Man mano che i dati validi scarseggiano, cresce l’interesse per le epoche ripetute, i dati sintetici e il filtraggio della qualità. Chinchilla rimane il punto di riferimento, ma l’ottimale dipende sempre più dal costo di inferenza dell’intera vita, non solo dal budget di formazione una tantum.

Implementazione nel mondo reale

Scegliere di addestrare un modello da 7 miliardi di parametri su 2 trilioni di token anziché un modello da 30 miliardi su dati troppo pochi per lo stesso budget.

Si stima che un modello da 10 miliardi di parametri richieda circa 200 miliardi di token per raggiungere il punto ottimale di calcolo.

Giustificare un modello distribuito più piccolo per ridurre i costi di inferenza per query eguagliando la qualità di un rivale più grande.

Controllare un modello esistente e concludere che non era adeguatamente addestrato, quindi pianificare un ciclo di addestramento più lungo invece di un aumento dei parametri.

Rischi e guardrail

Team diversi possono utilizzare lo stesso termine in modo diverso, quindi definisci l'ambito in anticipo.

I benchmark possono sembrare solidi mentre le prestazioni nel mondo reale non sono uniformi.

Ignorare la qualità dei dati e i piani di valutazione spesso crea risultati fragili.

Tabella di marcia per l'implementazione

1

Inizia con una definizione in linguaggio semplice del risultato di cui hai bisogno.

2

Scegli una metrica di successo e una condizione di fallimento prima del test.

3

Esegui un piccolo progetto pilota con dati rappresentativi, non un set demo raffinato.

4

Documenta dove il Chinchilla Compute-Optimal Training aiuta e dove i metodi più semplici sono migliori.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Formazione in fase di prova

Domande frequenti

Cos'è l'addestramento ottimale per il calcolo della cincillà?

Chinchilla è una scoperta di DeepMind del 2022 secondo cui la maggior parte dei modelli linguistici di grandi dimensioni erano gravemente sottoaddestrati: per un budget di calcolo fisso dovresti ridimensionare parametri e dati in modo più o meno uguale, non solo costruire un modello più grande. Ha rimodellato il modo in cui il settore bilancia le dimensioni del modello con i dati di addestramento.

Qual è la famosa regola empirica di Chinchilla per l'addestramento ottimale a livello di calcolo?

DeepMind ha scoperto che parametri e token dovrebbero scalare insieme a circa 20 token per parametro per un determinato budget di calcolo.

Come si confronta il Chinchilla con parametri 70B con il Gopher con parametri 280B?

Addestrato su molti più token con lo stesso calcolo, Chinchilla ha battuto il Gopher molto più grande nella maggior parte dei benchmark.

Quale problema chiave ha rivelato lo studio di Chinchilla sui precedenti modelli di grandi dimensioni?

Modelli come GPT-3 e Gopher erano troppo grandi rispetto ai dati di addestramento, lasciando le prestazioni irrealizzate.

Quanti token suggerisce approssimativamente la regola Chinchilla per un modello da 10 miliardi di parametri?

Con 20 token per parametro, 10 miliardi di parametri implicano circa 200 miliardi di token di addestramento.

Oltre all’efficienza della formazione, perché un modello più piccolo e ricco di dati è interessante da implementare?

Meno parametri significano un calcolo per query inferiore, quindi il risparmio aumenta ogni volta che viene utilizzato il modello.