GUIDA ALL'AI linguistica

Sintonizzazione delle istruzioni

L'ottimizzazione delle istruzioni è la fase di training che trasforma un predittore di testo grezzo in un modello che segue effettivamente istruzioni come "riassumi questo" o "scrivi una risposta cortese". È ciò che rende un modello base utile e orientabile.

2 minuti di letturaUltimo aggiornamento

Immersione profonda

Un modello linguistico di base viene addestrato solo per prevedere il token successivo nel testo web, quindi se digiti una domanda potrebbe semplicemente continuare con altre domande invece di rispondere. L'ottimizzazione delle istruzioni risolve questo problema. È una forma di messa a punto supervisionata: il modello è addestrato su molte coppie di (istruzioni, risposta ideale) che coprono migliaia di attività: traduzione, riepilogo, classificazione, domande e risposte, codifica e altro ancora. Vedendo ripetutamente lo stesso schema di istruzioni e poi risposte utili, il modello apprende il comportamento generale di "fai ciò che l'utente chiede" e questo si generalizza a istruzioni mai viste durante l'addestramento. L'approccio è stato stabilito intorno al 2021 da lavori come FLAN, T0 e Natural instructions ed è stato fondamentale per InstructGPT di OpenAI, che ha perfezionato GPT-3 su una serie curata di istruzioni. È la base su cui sono costruiti la maggior parte degli assistenti di chat.

Approfondimento tecnico

Meccanicamente, l'ottimizzazione delle istruzioni è un apprendimento supervisionato standard: minimizza la differenza tra i token previsti del modello e la risposta di riferimento, con gradienti che aggiornano i pesi. È distinto dall’RLHF (apprendimento per rinforzo dal feedback umano), che viene dopo e ottimizza le preferenze umane utilizzando un modello di ricompensa. La solita ricetta è stratificata: pre-addestramento, quindi sintonizzazione delle istruzioni (SFT) per insegnare a seguire il compito, quindi facoltativamente RLHF per affinare il tono, la disponibilità e la sicurezza. La diversità dei dati conta più del semplice volume: un’ampia copertura delle attività guida la generalizzazione.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro dell'ottimizzazione delle istruzioni

Il campo si sta spostando da giganteschi set di dati scritti a mano verso dati di qualità superiore, in parte sintetici – a volte solo poche migliaia di esempi scelti con cura – dopo aver scoperto che la qualità dei dati può battere la quantità. Aspettatevi una maggiore ottimizzazione delle istruzioni specifiche per dominio (medico, legale, codifica), set di istruzioni multilingue e multimodali e pipeline automatizzate che generano e filtrano i dati delle istruzioni. L'ottimizzazione delle istruzioni rimarrà il ponte essenziale tra un modello grezzo preaddestrato e un assistente utilizzabile, sempre più combinato con l'ottimizzazione delle preferenze per l'allineamento.

Implementazione nel mondo reale

Trasformare un modello base in stile GPT in un assistente di chat che risponde alle domande invece di farle eco

FLAN-T5, ottimizzato per numerose attività in modo da poter seguire istruzioni su cui non è mai stato addestrato esplicitamente

InstructGPT, dove GPT-3 è stato ottimizzato con istruzioni mirate per produrre risposte molto più utili

Costruire un assistente aziendale interno mettendo a punto le coppie di istruzioni-risposte scritte dai team di supporto e legali

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Instruction Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Sintonizzazione del prefisso

Domande frequenti

What is Instruction Tuning?

L'ottimizzazione delle istruzioni è la fase di training che trasforma un predittore di testo grezzo in un modello che segue effettivamente istruzioni come "riassumi questo" o "scrivi una risposta cortese". È ciò che rende un modello base utile e orientabile.

In che modo l'ottimizzazione delle istruzioni differisce da RLHF?

L'ottimizzazione delle istruzioni viene supervisionata tramite l'apprendimento delle risposte target. RLHF viene dopo e ottimizza il modello rispetto alle preferenze umane apprese.

Quale proprietà dei dati di ottimizzazione delle istruzioni guida maggiormente la capacità di un modello di seguire istruzioni nuove e invisibili?

Coprendo un'ampia varietà di compiti si insegna il comportamento generale nel seguire le istruzioni, che si generalizza in istruzioni mai viste durante l'addestramento.

Qual è l'ordine tipico delle fasi formative per un moderno assistente di chat?

I modelli vengono prima addestrati sul testo grezzo, quindi ottimizzati con le istruzioni per seguire i compiti e spesso perfezionati con RLHF per tono e sicurezza.