Sprach-KI-GUIDE

Kontextfenster

Ein Kontextfenster ist die maximale Textmenge – gemessen in Token –, die ein Modell gleichzeitig lesen und im Gedächtnis behalten kann.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It sets a hard limit on how much of your conversation, documents, or instructions the model can actually use.

Tiefer Einblick

Modelle lesen Zeichen oder Wörter nicht direkt; Sie lesen Tokens, wobei ein Token ein Textstück ist, das etwa drei Viertel eines englischen Wortes ausmacht. Das Kontextfenster zählt die Eingabeaufforderung plus die eigene Antwort des Modells. Das frühe GPT-3 verarbeitete etwa 2.000 Token; bis 2025–2026 haben sich die Grenzmodelle dramatisch ausgeweitet – Gemini von Google erreicht ein bis zwei Millionen Token, mehrere Claude- und GPT-Modelle bieten 128.000 bis zu einer Million, genug für ganze Bücher oder Codebasen. Aber größer ist nicht automatisch besser. Da Aufmerksamkeit jedes Token mit jedem anderen vergleicht, steigen die Rechen- und Speicherkosten mit der Länge stark an. Modelle zeigen auch einen „Lost-in-the-Middle“-Effekt, bei dem Informationen am Anfang und Ende einer langen Eingabe zuverlässiger abgerufen werden als in der Mitte vergrabenes Material.

Technischer Einblick

Everything in a single request — system instructions, prior chat turns, pasted documents, and the answer being generated — must fit inside the token budget. Bei einem Überlauf werden die ältesten Inhalte verworfen oder müssen zusammengefasst werden, weshalb lange Chats scheinbar „vergessen“. Größere Fenster sind kostspielig, da die Selbstaufmerksamkeit ungefähr mit dem Quadrat der Token-Anzahl skaliert und weil das Modell Schlüssel/Wert-Vektoren für jedes Token zwischenspeichert, was Speicher verbraucht. Aus diesem Grund berechnen Anbieter ihre Preise nach Token und der Abruf ist oft günstiger, als alles in einen Kontext zu stopfen.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft von Kontextfenstern

Kontextfenster werden weiter wachsen, aber der Schwerpunkt verlagert sich von der bloßen Größe hin zur effektiven Nutzung. Techniken wie besseres Long-Context-Training, Aufmerksamkeitsoptimierungen und Schlüssel-/Wert-Cache-Komprimierung zielen darauf ab, das „Lost-in-the-Middle“-Problem und die Kostenkurve zu reduzieren. Die durch Abruf erweiterte Generierung bleibt eine praktische Ergänzung und ruft nur relevante Blöcke ab, anstatt für die Verarbeitung von Millionen von Token bei jedem Aufruf zu bezahlen. Erwarten Sie, dass die Frage „Wie zuverlässig kann das Modell sein Fenster nutzen“ wichtiger ist als die maximale Zahl in der Schlagzeile.

Reale Umsetzung

Einfügen eines gesamten Vertrags oder einer Forschungsarbeit, damit das Modell Fragen dazu beantworten kann, ohne frühere Abschnitte zu verlieren.

Lange Codierungssitzungen, bei denen der Assistent viele Dateien und frühere Änderungen gleichzeitig im Blick behalten muss.

Kundensupport-Bots, die sich den gesamten Verlauf eines Gesprächs merken müssen, um konsistent zu bleiben.

Analysieren großer Protokolle oder Transkripte, bei denen wichtige Details möglicherweise weit voneinander entfernt liegen und Gefahr laufen, „in der Mitte verloren“ zu gehen.

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Context Windows quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Skalierung des YaRN-Kontextfensters

Häufig gestellte Fragen

What is Context Windows?

Ein Kontextfenster ist die maximale Textmenge – gemessen in Token –, die ein Modell gleichzeitig lesen und im Gedächtnis behalten kann. Es legt eine feste Grenze dafür fest, wie viel von Ihrem Gespräch, Ihren Dokumenten oder Anweisungen das Modell tatsächlich verwenden kann.

Was misst das Kontextfenster eines Modells?

Das Kontextfenster ist das Token-Budget für eine einzelne Anfrage – wie viel Text das Modell gleichzeitig lesen und darauf antworten kann.

Was ist in diesem Zusammenhang ein Token?

Modelle verarbeiten Text als Token, bei denen es sich um Unterwortblöcke handelt. Im Englischen umfasst ein Token durchschnittlich etwa drei Viertel eines Wortes.

Welche Elemente zählen für das Kontextfenster in einer einzelnen Anfrage?

Die gesamte Anfrage teilt sich ein Budget: Anweisungen, Konversationsverlauf, alle eingefügten Inhalte und die eigene Ausgabe des Modells verbrauchen alle Token.

Warum ist ein größeres Kontextfenster nicht automatisch besser?

Die Aufmerksamkeitskosten steigen ungefähr mit dem Quadrat der Token-Anzahl, und der „Lost-in-Middle“-Effekt führt dazu, dass Details in der Mitte des Dokuments weniger zuverlässig abgerufen werden können.

Warum wird oft Retrieval-Augmented Generation (RAG) verwendet, anstatt alles in das Kontextfenster zu stellen?

RAG ruft nur die relevanten Teile einer Wissensdatenbank ab und vermeidet so die Kosten für die Eingabe riesiger Textmengen in das Modell bei jeder Anfrage.