GUIDA ALL'AI linguistica

Temperatura e campionamento

La temperatura e il campionamento sono i quadranti che controllano quanto sia "casuale" o "sicura" la formulazione di un modello linguistico.

2 minuti di letturaUltimo aggiornamento

Panoramica

They decide whether you get the same predictable answer every time or fresh, varied phrasing.

Immersione profonda

Ad ogni passaggio, un modello linguistico non produce direttamente una parola: produce un punteggio (un "logit") per ogni token nel suo vocabolario, che softmax trasforma in una distribuzione di probabilità. Il campionamento è il modo in cui viene scelto il token successivo da quella distribuzione. La temperatura rimodella la distribuzione prima della scelta: la bassa temperatura fa prevalere le scelte migliori, quindi l’output è mirato e ripetibile; l'alta temperatura lo appiattisce, lasciando scivolare dentro gettoni improbabili per più varietà (e più errori). Due filtri popolari restringono innanzitutto il pool. Top-k mantiene solo i k gettoni con la probabilità più alta. Top-p, o campionamento del nucleo, mantiene l'insieme più piccolo di token la cui somma delle probabilità è p (diciamo 0,9), quindi il pool cresce quando il modello è incerto e si riduce quando è sicuro. Insieme, queste impostazioni compromettono l'affidabilità con la creatività.

Approfondimento tecnico

La temperatura funziona dividendo ogni logit per T prima di softmax: la probabilità è proporzionale a exp(logit / T). T inferiore a 1 accentua i divari in modo che il token in alto domini; T superiore a 1 riduce i divari e appiattisce la distribuzione. A T vicino a 0 il modello diventa effettivamente avido, prendendo sempre il singolo gettone più probabile. Top-k limita il conteggio dei candidati a un numero fisso, mentre top-p imposta un limite di probabilità cumulativa, quindi il conteggio dei candidati si adatta alla sicurezza del modello in quella fase.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro della temperatura e del campionamento

Questi controlli sono stabili e ben compresi, quindi l'azione è in impostazioni predefinite più intelligenti e varianti più recenti. Aspettatevi schemi più adattivi come min-p (che ridimensiona il limite alla probabilità del token superiore) e una temperatura dinamica che cambia a metà generazione. Gli strumenti selezioneranno sempre più automaticamente le impostazioni per attività (basse per codice ed estrazione, più alte per il brainstorming) in modo che gli utenti non effettuino la regolazione manuale. L’idea centrale persiste: il campionamento è la semplice, potente manopola tra precisione deterministica e varietà creativa.

Implementazione nel mondo reale

Impostazione della temperatura vicino a 0 per la generazione del codice o l'estrazione dei dati, dove si desidera ogni volta la stessa risposta corretta

Aumentare la temperatura a circa 0,8-1,0 per fare brainstorming su nomi, slogan o idee per storie per ottenere varie opzioni

Utilizzando top-p intorno a 0,9 in modo che il modello campioni solo dalle parole più plausibili ed eviti token bizzarri

Applicazione di top-k per limitare i candidati ed evitare che parole rare e fuori tema appaiano in una risposta rivolta al cliente

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Temperature and Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Campionamento del nucleo e Top-k

Domande frequenti

What is Temperature and Sampling?

La temperatura e il campionamento sono i quadranti che controllano quanto sia "casuale" o "sicura" la formulazione di un modello linguistico. Decidono se ottieni sempre la stessa risposta prevedibile o un fraseggio fresco e vario.

Cosa comporta l'aumento della temperatura sull'output di un modello?

Una temperatura più elevata appiattisce la distribuzione di probabilità, quindi i token meno probabili vengono raccolti più spesso, producendo risultati più vari (e più rischiosi).

In che modo il campionamento top-p (nucleo) differisce dal campionamento top-k?

Top-p adatta il set di candidati in base alla probabilità cumulativa, mentre top-k mantiene sempre un numero fisso di token principali.

Meccanicamente, cosa fa effettivamente la temperatura ai logit?

La temperatura divide ogni logit per T prima del softmax; T inferiore a 1 rende più accentuata la distribuzione, T superiore a 1 la appiattisce.

Per generare codice o estrarre dati strutturati, quale impostazione è solitamente la migliore?

Le attività che richiedono correttezza e ripetibilità utilizzano temperature molto basse, quindi il modello seleziona in modo affidabile i token corretti più probabili.

Cosa succede ad una temperatura effettivamente pari a 0?

A una temperatura prossima allo zero, la distribuzione è così netta che viene sempre scelto il token con la più alta probabilità: la decodifica avida.