Sprach-KI-GUIDE

Lernen im Kontext

Unter kontextbezogenem Lernen versteht man die überraschende Fähigkeit großer Sprachmodelle, eine neue Aufgabe aus wenigen in der Eingabeaufforderung platzierten Beispielen ohne Umschulung zu übernehmen.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It is the reason you can 'teach' a model on the fly just by showing it what you want.

Tiefer Einblick

Um einem neuronalen Netzwerk eine neue Aufgabe beizubringen, bedeutet es normalerweise, seine Gewichte durch Training zu aktualisieren. Anders ist das Lernen im Kontext: Sie schreiben ein paar Beispiele direkt in die Eingabeaufforderung (den „Kontext“), und das Modell leitet das Muster ab und wendet es auf eine neue Eingabe an. Im Inneren des Modells ändert sich nichts; Die Beispiele steuern lediglich die Vorhersage des nächsten Tokens. Sie hören „Zero-Shot“ (nur Anleitung), „One-Shot“ (ein Beispiel) und „Few-Shot“ (mehrere Beispiele). Dieses Verhalten wurde 2020 von GPT-3 populär gemacht und erwies sich als eine aufkommende Fähigkeit: Winzige Modelle können es nicht, aber jenseits einer Skala von etwa 100 Milliarden Parametern steigt die Genauigkeit bei Eingabeaufforderungen mit wenigen Schüssen stark an. Das Modell hat während des Vortrainings effektiv gelernt, Muster zu erkennen und fortzusetzen, sodass es diese Fähigkeit zum Zeitpunkt der Inferenz wiederverwenden kann.

Technischer Einblick

Untersuchungen zur Interpretierbarkeit führten einen Großteil dieser Fähigkeit auf „Induktionsköpfe“ zurück – Aufmerksamkeitsschaltkreise, die während des Trainings entstehen und einen unscharfen Präfixabgleich durchführen: Sie scannen zurück, wo ein ähnliches Token auftauchte, und kopieren dann, was darauf folgte. Wenn Ihre Eingabeaufforderung also „Apfel -> Obst, Karotte -> Gemüse“ anzeigt, gleicht das Modell die Struktur ab und sagt die richtige Bezeichnung für den nächsten Artikel voraus. Entscheidend ist, dass bei der Inferenz keine Farbverläufe fließen und keine Gewichtungen aktualisiert werden. Die Beispiele formen einfach die Aktivierungen um, die die Wahrscheinlichkeitsverteilung des nächsten Tokens versorgen.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft des kontextbezogenen Lernens

Die Erweiterung der Kontextfenster (jetzt Hunderttausende von Token) treibt das Lernen im Kontext in Richtung „Many-Shot“-Systeme, bei denen Dutzende oder Hunderte von Beispielen ohne Schulungskosten mit der Feinabstimmung für einige Aufgaben konkurrieren können. Erwarten Sie eine engere Integration mit Retrieval, sodass relevante Beispiele automatisch abgerufen werden, und eine bessere Theorie, wenn das Lernen im Kontext fehlschlägt oder abgelenkt wird. Es bleibt die schnelle und kostengünstige Möglichkeit, ein Modell anzupassen und die Feinabstimmung für stabile Aufgaben mit hohem Volumen zu ergänzen – nicht zu ersetzen.

Reale Umsetzung

Geben Sie einem Chatbot drei Beispiel-Support-Tickets und deren Kategorien und lassen Sie ihn dann ein neues Ticket auf die gleiche Weise klassifizieren

Zeigt ein Modell mit zwei Vorher/Nachher-Paaren unordentlichen Textes, der in sauberes JSON umformatiert wurde, sodass der Rest konvertiert wird

Fügen Sie ein paar Beispielproduktbeschreibungen im Stil Ihrer Marke ein, damit die neuen Beschreibungen zum Stil passen

Die Demonstration einer kniffligen mathematischen Wortaufgabe funktionierte Schritt für Schritt, sodass das Modell ähnliche Probleme mit demselben Argumentationsformat löst

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the In-Context Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is In-Context Learning?

Unter kontextbezogenem Lernen versteht man die überraschende Fähigkeit großer Sprachmodelle, eine neue Aufgabe aus wenigen in der Eingabeaufforderung platzierten Beispielen ohne Umschulung zu übernehmen. Aus diesem Grund können Sie einem Modell „beibringen“, indem Sie ihm einfach zeigen, was Sie wollen.

Was ändert sich im Modell beim In-Context-Lernen grundlegend?

Das Lernen im Kontext erfolgt ausschließlich durch Schlussfolgerungen. Die Beispiele in der Eingabeaufforderung prägen die Aktivierungen und Vorhersagen des nächsten Tokens des Modells, es werden jedoch keine Gewichtungen aktualisiert.

Warum wird kontextbezogenes Lernen als „emergente“ Fähigkeit beschrieben?

Die Fähigkeit ist bei kleinen Modellen schwach oder fehlt und steigt steil an, sobald Modelle einen sehr großen Maßstab erreichen, weshalb sie als „emergent“ bezeichnet wird.

Welcher interne Mechanismus ist am stärksten mit dem kontextbezogenen Lernen bei Transformern verbunden?

In der Arbeit zur Interpretierbarkeit wurden Induktionsköpfe – Aufmerksamkeitsschaltkreise, die herausfinden, wo ein ähnliches Zeichen auftauchte, und kopieren, was als nächstes kam – als zentraler Treiber des kontextbezogenen Lernens identifiziert.