Taal AI-GIDS

Contextvensters

Een contextvenster is de maximale hoeveelheid tekst (gemeten in tokens) die een model in één keer kan lezen en onthouden.

2 min readLaatst bijgewerkt

Overzicht

It sets a hard limit on how much of your conversation, documents, or instructions the model can actually use.

Diepe duik

Modellen lezen karakters of woorden niet rechtstreeks; ze lezen tokens, waarbij een token een stuk tekst is van ongeveer driekwart woord in het Engels. Het contextvenster telt de prompt plus het eigen antwoord van het model. De vroege GPT-3 verwerkte ongeveer 2.000 tokens; tegen 2025-2026 zijn grensmodellen dramatisch uitgebreid: Google's Gemini bereikt één tot twee miljoen tokens, verschillende Claude en GPT-modellen bieden 128K tot een miljoen, genoeg voor hele boeken of codebases. Maar groter is niet automatisch beter. Omdat aandacht elk token met elk ander vergelijkt, stijgen de reken- en geheugenkosten sterk met de lengte. Modellen laten ook een 'lost in the middle'-effect zien, waarbij informatie aan het begin en einde van een lange invoer betrouwbaarder wordt opgeroepen dan materiaal dat in het midden is begraven.

Technisch inzicht

Everything in a single request — system instructions, prior chat turns, pasted documents, and the answer being generated — must fit inside the token budget. Als het overloopt, wordt de oudste inhoud verwijderd of moet deze worden samengevat, waardoor lange chats lijken te 'vergeten'. Grotere vensters zijn kostbaar omdat de zelfaandacht ruwweg wordt geschaald met het kwadraat van het tokenaantal, en omdat het model sleutel/waardevectoren voor elk token in de cache opslaat, waardoor geheugen wordt verbruikt. Dit is de reden waarom providers tokens prijzen en waarom het ophalen vaak goedkoper is dan alles in de juiste context plaatsen.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van contextvensters

Contextvensters zullen blijven groeien, maar de nadruk verschuift van ruwe grootte naar effectief gebruik. Technieken zoals betere lange-contexttraining, aandachtsoptimalisaties en sleutel/waarde-cachecompressie zijn bedoeld om het 'lost in the middle'-probleem en de kostencurve te verminderen. Ophaal-verbeterde generatie zal een praktische aanvulling blijven, waarbij alleen relevante brokken worden opgehaald in plaats van te betalen om bij elke oproep miljoenen tokens te verwerken. Verwacht dat 'hoe betrouwbaar kan het model zijn venster gebruiken' belangrijker zal zijn dan het maximale aantal in de kop.

Implementatie in de echte wereld

Een volledig contract of onderzoekspaper plakken, zodat het model vragen daarover kan beantwoorden zonder eerdere secties te verliezen.

Lange codeersessies waarbij de assistent veel bestanden en eerdere wijzigingen tegelijk in beeld moet houden.

Klantenondersteuningsbots die het volledige heen-en-weer-gesprek moeten onthouden om consistent te blijven.

Het analyseren van grote logboeken of transcripties waarbij de belangrijkste details ver uit elkaar liggen en het risico lopen 'verloren te gaan in het midden'.

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Context Windows quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Schalen van YaRN-contextvenster

Frequently asked questions

What is Context Windows?

Een contextvenster is de maximale hoeveelheid tekst (gemeten in tokens) die een model in één keer kan lezen en onthouden. Het stelt een harde limiet aan hoeveel van uw gesprekken, documenten of instructies het model daadwerkelijk kan gebruiken.

Wat meet het contextvenster van een model?

Het contextvenster is het tokenbudget voor één verzoek: hoeveel tekst het model in één keer kan lezen en reageren.

Wat is een token in deze context?

Modellen verwerken tekst als tokens, dit zijn stukjes subwoord; in het Engels is een token gemiddeld ongeveer driekwart van een woord.

Welke items tellen mee voor het contextvenster in één verzoek?

Het hele verzoek deelt één budget: instructies, gespreksgeschiedenis, eventuele geplakte inhoud en de eigen uitvoer van het model verbruiken allemaal tokens.

Waarom is een groter contextvenster niet automatisch beter?

De aandachtskosten stijgen ruwweg met het kwadraat van het aantal tokens, en het 'lost in the middle'-effect betekent dat details in het midden van het document minder betrouwbaar kunnen worden opgeroepen.

Waarom wordt Retrieval-Augmented Generation (RAG) vaak gebruikt in plaats van alles in het contextvenster te plaatsen?

RAG haalt alleen de relevante delen van een kennisbank op, waardoor de kosten worden vermeden die gepaard gaan met het invoeren van grote hoeveelheden tekst bij elk verzoek in het model.