GUIDA ALL'AI linguistica

Modellazione del linguaggio

La modellazione del linguaggio è il compito apparentemente semplice di prevedere quale parola o segno verrà dopo, dato il testo fino a quel momento.

2 minuti di letturaUltimo aggiornamento

Panoramica

This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.

Immersione profonda

Fondamentalmente, un modello linguistico assegna probabilità a sequenze di testo. Dato il suggerimento "La capitale della Francia è", stima la probabilità di ogni possibile token successivo e "Parigi" dovrebbe ottenere un punteggio elevato. I primi modelli linguistici erano n-grammi statistici che contavano semplicemente la frequenza con cui apparivano le sequenze di parole, ma avevano difficoltà con contesti lunghi e frasi invisibili. I modelli del linguaggio neurale hanno sostituito il conteggio con rappresentazioni apprese e l’architettura del trasformatore del 2017 ha consentito ai modelli di gestire in modo efficiente lunghe porzioni di testo. I moderni modelli linguistici di grandi dimensioni come la famiglia GPT vengono addestrati su enormi corpora di testo con un obiettivo: prevedere il token successivo. Sorprendentemente, farlo bene costringe il modello ad assorbire grammatica, fatti, schemi di ragionamento e stile, perché per prevedere accuratamente il testo è necessario comprenderlo. La generazione funziona prevedendo ripetutamente il token successivo e reimmettendolo.

Approfondimento tecnico

La maggior parte dei modelli linguistici moderni sono autoregressivi: fattorizzano la probabilità di una frase in un prodotto delle probabilità del token successivo, prevedendo un token alla volta da sinistra a destra. L'addestramento riduce al minimo la perdita di entropia incrociata, il che premia l'assegnazione di un'elevata probabilità al token successivo effettivo nel testo di addestramento. Questo è auto-supervisionato, le etichette sono libere dal testo stesso, quindi non è necessaria alcuna annotazione umana. Al momento della generazione, strategie di campionamento come temperatura, top-k e top-p (nucleo) controllano il compromesso tra output prevedibile e creativo.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro della modellazione linguistica

La previsione del prossimo token si è rivelata sorprendentemente potente e le leggi di scala mostrano che modelli più grandi e più dati continuano a migliorare la capacità, anche se i progressi stanno rallentando e i dati di alta qualità stanno diventando scarsi. La frontiera si sta spostando verso il ragionamento, finestre di contesto più lunghe e metodi post-formazione come l’apprendimento per rinforzo dal feedback umano che modella il comportamento dopo la costruzione del modello di base. Aspettatevi una continua fusione della modellazione del linguaggio con strumenti, recupero e input multimodali, mentre l’obiettivo fondamentale di prevedere il token successivo rimane il fondamento su cui è costruito tutto il resto.

Implementazione nel mondo reale

Completamento automatico sulla tastiera del telefono o tramite e-mail suggerendo la parola successiva durante la digitazione

Un chatbot come ChatGPT genera una risposta fluida prevedendo ripetutamente il token successivo

Editor di codice come GitHub Copilot che prevedono la riga di codice successiva dal contesto circostante

Sistemi di riconoscimento vocale che utilizzano un modello linguistico per scegliere la trascrizione più plausibile tra opzioni dal suono simile

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Modellazione del linguaggio mascherato

Domande frequenti

What is Language Modeling?

La modellazione del linguaggio è il compito apparentemente semplice di prevedere quale parola o segno verrà dopo, dato il testo fino a quel momento. Questo singolo obiettivo, ampliato in modo massiccio, è ciò che produce i potenti chatbot e gli assistenti alla scrittura di oggi.

Qual è il compito principale svolto da un modello linguistico?

Un modello linguistico stima la probabilità di ciò che verrà dopo in una sequenza e la generazione funziona prevedendo e aggiungendo ripetutamente il token successivo.

Qual è stato un limite fondamentale dei primi modelli linguistici n-gram?

I modelli N-gram si basavano sul conteggio di brevi sequenze di parole, quindi gestivano male il contesto a lungo raggio e fallivano con frasi che non avevano mai visto.

Perché la formazione sul modello linguistico è chiamata "autosuperata"?

Il token successivo corretto è già presente nel testo, quindi il modello crea i propri target senza annotazione manuale.

Cosa significa "autoregressivo" per un modello linguistico?

I modelli autoregressivi generano testo token per token, condizionando ogni nuova previsione su tutto ciò che è stato generato fino a quel momento.

Quale funzione di perdita viene tipicamente utilizzata per addestrare un modello linguistico?

L'addestramento riduce al minimo l'entropia incrociata, premiando il modello per aver assegnato un'elevata probabilità al token successivo effettivo osservato nel testo di addestramento.