Lernen im Kontext
Unter kontextbezogenem Lernen versteht man die überraschende Fähigkeit großer Sprachmodelle, eine neue Aufgabe aus wenigen in der Eingabeaufforderung platzierten Beispielen ohne Umschulung zu übernehmen.
Übersicht
It is the reason you can 'teach' a model on the fly just by showing it what you want.
Tiefer Einblick
Um einem neuronalen Netzwerk eine neue Aufgabe beizubringen, bedeutet es normalerweise, seine Gewichte durch Training zu aktualisieren. Anders ist das Lernen im Kontext: Sie schreiben ein paar Beispiele direkt in die Eingabeaufforderung (den „Kontext“), und das Modell leitet das Muster ab und wendet es auf eine neue Eingabe an. Im Inneren des Modells ändert sich nichts; Die Beispiele steuern lediglich die Vorhersage des nächsten Tokens. Sie hören „Zero-Shot“ (nur Anleitung), „One-Shot“ (ein Beispiel) und „Few-Shot“ (mehrere Beispiele). Dieses Verhalten wurde 2020 von GPT-3 populär gemacht und erwies sich als eine aufkommende Fähigkeit: Winzige Modelle können es nicht, aber jenseits einer Skala von etwa 100 Milliarden Parametern steigt die Genauigkeit bei Eingabeaufforderungen mit wenigen Schüssen stark an. Das Modell hat während des Vortrainings effektiv gelernt, Muster zu erkennen und fortzusetzen, sodass es diese Fähigkeit zum Zeitpunkt der Inferenz wiederverwenden kann.
Technischer Einblick
Untersuchungen zur Interpretierbarkeit führten einen Großteil dieser Fähigkeit auf „Induktionsköpfe“ zurück – Aufmerksamkeitsschaltkreise, die während des Trainings entstehen und einen unscharfen Präfixabgleich durchführen: Sie scannen zurück, wo ein ähnliches Token auftauchte, und kopieren dann, was darauf folgte. Wenn Ihre Eingabeaufforderung also „Apfel -> Obst, Karotte -> Gemüse“ anzeigt, gleicht das Modell die Struktur ab und sagt die richtige Bezeichnung für den nächsten Artikel voraus. Entscheidend ist, dass bei der Inferenz keine Farbverläufe fließen und keine Gewichtungen aktualisiert werden. Die Beispiele formen einfach die Aktivierungen um, die die Wahrscheinlichkeitsverteilung des nächsten Tokens versorgen.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft des kontextbezogenen Lernens
Die Erweiterung der Kontextfenster (jetzt Hunderttausende von Token) treibt das Lernen im Kontext in Richtung „Many-Shot“-Systeme, bei denen Dutzende oder Hunderte von Beispielen ohne Schulungskosten mit der Feinabstimmung für einige Aufgaben konkurrieren können. Erwarten Sie eine engere Integration mit Retrieval, sodass relevante Beispiele automatisch abgerufen werden, und eine bessere Theorie, wenn das Lernen im Kontext fehlschlägt oder abgelenkt wird. Es bleibt die schnelle und kostengünstige Möglichkeit, ein Modell anzupassen und die Feinabstimmung für stabile Aufgaben mit hohem Volumen zu ergänzen – nicht zu ersetzen.
Reale Umsetzung
Geben Sie einem Chatbot drei Beispiel-Support-Tickets und deren Kategorien und lassen Sie ihn dann ein neues Ticket auf die gleiche Weise klassifizieren
Zeigt ein Modell mit zwei Vorher/Nachher-Paaren unordentlichen Textes, der in sauberes JSON umformatiert wurde, sodass der Rest konvertiert wird
Fügen Sie ein paar Beispielproduktbeschreibungen im Stil Ihrer Marke ein, damit die neuen Beschreibungen zum Stil passen
Die Demonstration einer kniffligen mathematischen Wortaufgabe funktionierte Schritt für Schritt, sodass das Modell ähnliche Probleme mit demselben Argumentationsformat löst
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the In-Context Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Kontextfenster
Häufig gestellte Fragen
What is In-Context Learning?
Unter kontextbezogenem Lernen versteht man die überraschende Fähigkeit großer Sprachmodelle, eine neue Aufgabe aus wenigen in der Eingabeaufforderung platzierten Beispielen ohne Umschulung zu übernehmen. Aus diesem Grund können Sie einem Modell „beibringen“, indem Sie ihm einfach zeigen, was Sie wollen.
Was ändert sich im Modell beim In-Context-Lernen grundlegend?
Das Lernen im Kontext erfolgt ausschließlich durch Schlussfolgerungen. Die Beispiele in der Eingabeaufforderung prägen die Aktivierungen und Vorhersagen des nächsten Tokens des Modells, es werden jedoch keine Gewichtungen aktualisiert.
Warum wird kontextbezogenes Lernen als „emergente“ Fähigkeit beschrieben?
Die Fähigkeit ist bei kleinen Modellen schwach oder fehlt und steigt steil an, sobald Modelle einen sehr großen Maßstab erreichen, weshalb sie als „emergent“ bezeichnet wird.
Welcher interne Mechanismus ist am stärksten mit dem kontextbezogenen Lernen bei Transformern verbunden?
In der Arbeit zur Interpretierbarkeit wurden Induktionsköpfe – Aufmerksamkeitsschaltkreise, die herausfinden, wo ein ähnliches Zeichen auftauchte, und kopieren, was als nächstes kam – als zentraler Treiber des kontextbezogenen Lernens identifiziert.