GUIDA ALL'AI linguistica

Finestre di contesto

Una finestra di contesto è la quantità massima di testo, misurata in token, che un modello può leggere e tenere a mente contemporaneamente.

2 minuti di letturaUltimo aggiornamento

Panoramica

Stabilisce un limite rigido su quanto della tua conversazione, dei tuoi documenti o delle istruzioni il modello può effettivamente utilizzare.

Immersione profonda

I modelli non leggono direttamente caratteri o parole; leggono token, dove un token è un pezzo di testo che rappresenta circa tre quarti di una parola in inglese. La finestra di contesto conta il prompt più la risposta del modello. Il primo GPT-3 gestiva circa 2.000 token; entro il 2025-2026 i modelli di frontiera si sono espansi notevolmente: Gemini di Google raggiunge da uno a due milioni di token, diversi Claude e i modelli GPT offrono 128.000 fino a un milione, sufficienti per interi libri o basi di codice. Ma più grande non è automaticamente migliore. Poiché l'attenzione confronta ogni token con ogni altro, il costo di elaborazione e memoria aumenta rapidamente con la lunghezza. I modelli mostrano anche un effetto "perso nel mezzo", richiamando le informazioni all'inizio e alla fine di un lungo input in modo più affidabile rispetto al materiale sepolto al centro.

Approfondimento tecnico

Everything in a single request — system instructions, prior chat turns, pasted documents, and the answer being generated — must fit inside the token budget. Quando trabocca, i contenuti più vecchi vengono eliminati o devono essere riepilogati, motivo per cui le chat lunghe sembrano "dimenticare". Finestre più grandi sono costose perché l'attenzione verso se stessi si ridimensiona all'incirca con il quadrato del conteggio dei token e perché il modello memorizza nella cache i vettori chiave/valore per ogni token, consumando memoria. Questo è il motivo per cui i fornitori valutano in base ai token e perché il recupero è spesso più economico che inserire tutto nel contesto.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro delle finestre di contesto

Le finestre di contesto continueranno a crescere, ma l’enfasi si sta spostando dalla dimensione grezza all’uso efficace. Tecniche come una migliore formazione a lungo contesto, l'ottimizzazione dell'attenzione e la compressione della cache chiave/valore mirano a ridurre il problema "perso nel mezzo" e la curva dei costi. La generazione aumentata di recupero rimarrà un complemento pratico, recuperando solo i blocchi rilevanti invece di pagare per elaborare milioni di token ogni chiamata. Aspettatevi che "con quale affidabilità il modello possa utilizzare la sua finestra" abbia più importanza del numero massimo del titolo.

Implementazione nel mondo reale

Incollare un intero contratto o documento di ricerca in modo che il modello possa rispondere a domande al riguardo senza perdere le sezioni precedenti.

Sessioni di codifica lunghe in cui l'assistente deve tenere in vista molti file e modifiche precedenti contemporaneamente.

Bot dell'assistenza clienti che devono ricordare l'intero andirivieni di una conversazione per rimanere coerenti.

Analizzare registri o trascrizioni di grandi dimensioni in cui i dettagli chiave potrebbero essere distanti tra loro e rischiare di essere "persi nel mezzo".

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Context Windows quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Ridimensionamento della finestra di contesto YaRN

Domande frequenti

Cos'è Context Windows?

Una finestra di contesto è la quantità massima di testo, misurata in token, che un modello può leggere e tenere a mente contemporaneamente. Stabilisce un limite rigido alla quantità di conversazioni, documenti o istruzioni che il modello può effettivamente utilizzare.

Cosa misura la finestra di contesto di un modello?

La finestra di contesto è il budget del token per una singola richiesta: la quantità di testo che il modello può leggere e rispondere contemporaneamente.

Cos'è un token in questo contesto?

I modelli elaborano il testo come token, ovvero blocchi di sottoparole; in inglese un token corrisponde in media a circa tre quarti di una parola.

Quali elementi contano nella finestra di contesto in una singola richiesta?

L'intera richiesta condivide un budget: le istruzioni, la cronologia delle conversazioni, qualsiasi contenuto incollato e l'output del modello consumano tutti token.

Perché una finestra di contesto più ampia non è automaticamente migliore?

Il costo dell'attenzione cresce all'incirca con il quadrato del conteggio dei token e l'effetto "perso nel mezzo" significa che i dettagli a metà documento possono essere richiamati in modo meno affidabile.

Perché viene spesso utilizzata la generazione aumentata di recupero (RAG) invece di inserire tutto nella finestra di contesto?

RAG recupera solo le parti rilevanti di una base di conoscenza, evitando il costo di inserire enormi quantità di testo nel modello a ogni richiesta.