GUIDA ALL'AI linguistica

Leggi sulla scalatura del cincillà

Le leggi di ridimensionamento Chinchilla, di DeepMind nel 2022, hanno mostrato che la maggior parte dei modelli linguistici di grandi dimensioni erano gravemente sottoaddestrati: per un budget di calcolo fisso, dovresti ridimensionare le dimensioni del modello e i dati di addestramento più o meno in egual proporzione.

2 minuti di letturaUltimo aggiornamento

Panoramica

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Immersione profonda

Prima di Chinchilla, la tendenza era quella di costruire modelli sempre più grandi (come il GPT-3 con parametro 175B) addestrandosi su quantità di dati relativamente modeste. DeepMind ha addestrato oltre 400 modelli di diverse dimensioni e budget di dati, quindi ha adattato le curve che prevedono la perdita in funzione di parametri e token con un budget di calcolo fisso (FLOP). La loro scoperta: i parametri e i token di addestramento dovrebbero scalare insieme, all'incirca con un rapporto 1 a 1, il che implica circa 20 token di dati di addestramento per parametro. Per dimostrarlo, hanno addestrato Chinchilla, un modello con parametri 70B su 1,4 trilioni di token, che ha sovraperformato il molto più grande Gopher con parametri 280B nonostante abbia utilizzato lo stesso calcolo, perché è stato addestrato su molti più dati.

Approfondimento tecnico

Le leggi derivano dall'adattamento di una funzione di perdita parametrica L(N, D) dove N sono i parametri e D sono i token, inclusi i termini di perdita irriducibile, dimensione del modello e dimensione dei dati. Minimizzare la perdita soggetta a un vincolo di calcolo (il calcolo è approssimativamente proporzionale a N volte D) produce il risultato che N e D ottimali crescono entrambi come potenza di calcolo con esponenti simili, quindi il rapporto ottimale di calcolo rimane vicino a 20 token per parametro.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro delle leggi sullo scaling del cincillà

Chinchilla ha spostato il campo dalla ricerca del conteggio dei parametri all’alimentazione dei modelli con dati di qualità molto più elevata, e i modelli moderni spesso si addestrano ben oltre il punto “ottimale di calcolo” per rendere l’inferenza più economica. Man mano che il testo web di alta qualità scarseggia, l’attenzione si sta rivolgendo alla data curation, ai dati sintetici, a più epoche e ai dati multimodali per continuare a crescere. La lezione fondamentale rimane: dati e parametri devono essere bilanciati e l’obiettivo non è più solo la dimensione grezza.

Implementazione nel mondo reale

Il Chinchilla con parametri 70B di DeepMind batte il Gopher 280B nei benchmark utilizzando lo stesso calcolo, addestrandosi su molti più dati

Guidare i team a preventivare circa 20 token di formazione per parametro quando si pianifica un modello da zero

Giustificando modelli più piccoli e ricchi di dati come LLaMA che sono più economici da eseguire in fase di inferenza

Stimare se un modello pianificato è "sotto-allenato" e trarrebbe maggiori benefici da dati aggiuntivi rispetto a parametri aggiuntivi

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Leggi di scala per le reti neurali

Domande frequenti

What is Chinchilla Scaling Laws?

Le leggi di ridimensionamento Chinchilla, di DeepMind nel 2022, hanno mostrato che la maggior parte dei modelli linguistici di grandi dimensioni erano gravemente sottoaddestrati: per un budget di calcolo fisso, dovresti ridimensionare le dimensioni del modello e i dati di addestramento più o meno in egual proporzione. È importante perché ha ridefinito il significato di dimensione "ottimale" del modello e ha rimodellato il modo in cui i laboratori spendono l'elaborazione.

Qual è stata la scoperta centrale delle leggi di scala del cincillà?

Chinchilla ha dimostrato che per un budget di elaborazione fisso, i parametri e i token di addestramento dovrebbero crescere insieme, all’incirca in un rapporto 1 a 1.

Quanti token di addestramento per parametro hanno suggerito approssimativamente Chinchilla come ottimale dal punto di vista del calcolo?

Il rapporto ottimale di calcolo corrisponde a circa 20 token di addestramento per ogni parametro del modello.

Quale modello ha sovraperformato Chinchilla nonostante fosse molto più piccolo?

Il Chinchilla con parametri 70B ha battuto il Gopher con parametri 280B di DeepMind utilizzando lo stesso calcolo, perché si è addestrato su molti più dati.

Cosa implicava all'epoca Chinchilla riguardo a modelli come GPT-3?

Molti modelli di grandi dimensioni di quell’epoca erano poco addestrati, il che significa che avrebbero funzionato meglio con molti più dati per il conteggio dei parametri.

All'incirca, come è stato approssimato il calcolo nell'analisi di Chinchilla?

Il calcolo dell'addestramento (FLOP) è approssimativamente proporzionale al numero di parametri moltiplicato per il numero di token di addestramento.