Als nächstesNächster Leitfaden
Positionsinterpolation zur Kontexterweiterung
Sprach-KI
Technischer Leitfaden
YaRN (Yet another RoPE extensioN) ist eine effiziente Technik, um das nutzbare Kontextfenster eines Modells weit über das hinaus zu erweitern, worauf es trainiert wurde.
Es skaliert Rotationspositionseinbettungen geschickt neu, sodass ein Modell, das beispielsweise auf 4K-Tokens trainiert wurde, 32K oder mehr mit minimaler Feinabstimmung verarbeiten kann.
Die meisten modernen LLMs kodieren Token-Positionen mit RoPE (Rotary Position Embeddings), die Abfrage- und Schlüsselvektoren um Winkel drehen, die an die Position gebunden sind. Wenn Sie Sequenzen füttern, die länger als die Trainingslänge sind, gelangen diese Rotationen in unbekannte Bereiche und das Modell bricht zusammen. YaRN, das 2023 von Bowen Peng und Mitarbeitern eingeführt wurde, behebt dieses Problem durch NTK-fähige Interpolation pro Frequenz: Es lässt Hochfrequenzdimensionen (die lokale Beziehungen im Nahbereich erfassen) weitgehend unberührt, während Niederfrequenzdimensionen (die die Position im Fernbereich verfolgen) interpoliert werden. YaRN fügt der Aufmerksamkeit außerdem eine Temperaturanpassung hinzu, um den Entropieänderungen entgegenzuwirken, die aus längeren Kontexten resultieren. Das Ergebnis ist eine starke Langkontextleistung nach der Feinabstimmung nur eines winzigen Bruchteils der Daten und Schritte, die für naive Ansätze erforderlich sind.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Kontexterweiterung ist mittlerweile gängige Praxis: Offene Modelle liefern routinemäßig YaRN-erweiterte Varianten aus, die 128.000 Token oder mehr erreichen. Die Forschung geht in Richtung Methoden, die den Kontext ohne oder nahezu ohne Feinabstimmung erweitern, RoPE-Neuskalierung mit Aufmerksamkeitsmuster-Tricks kombinieren und die Qualität über das gesamte Fenster und nicht nur an den Enden aufrechterhalten. Erwarten Sie eine engere Integration dieser Techniken in die Vorschulung, sodass der Kontext nativ ist und nicht nachgerüstet wird.
Erweiterung eines offenen 4K-Kontextmodells auf 32K oder 128K für die Beantwortung langer Dokumentfragen mit kurzer Feinabstimmung
Ermöglicht abrufgestützten Systemen die Aufnahme vieler verketteter Passagen ohne Kürzung
Unterstützt Code-Assistenten, die eine ganze große Repository-Datei oder mehrere Dateien in einer Eingabeaufforderung benötigen
Anpassung eines Basismodells für lange Gespräche mit mehreren Runden, bei denen sich große Chatverläufe ansammeln
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
YaRN (Yet another RoPE extensioN) ist eine effiziente Technik, um das nutzbare Kontextfenster eines Modells weit über das hinaus zu erweitern, worauf es trainiert wurde. Es skaliert Rotationspositionseinbettungen geschickt neu, sodass ein Modell, das beispielsweise auf 4K-Tokens trainiert wurde, 32K oder mehr mit minimaler Feinabstimmung verarbeiten kann.
YaRN, dessen Name Yet another RoPE extension bedeutet, skaliert die rotierenden Positionseinbettungen neu, die in den meisten modernen LLMs verwendet werden.
Positionen jenseits des Trainings erzeugen Rotationswinkel, die das Modell nie gesehen hat, sodass sich das Aufmerksamkeitsverhalten stark verschlechtert.
YaRN verwendet eine NTK-by-parts-Rampe, die langwellige Niederfrequenz-Dämpfungen interpoliert und kurzreichweitige Hochfrequenz-Dämpfungen größtenteils intakt lässt.
YaRN fügt Aufmerksamkeitsprotokollen eine Temperaturskalierung hinzu, um Entropieverschiebungen entgegenzuwirken, die mit zunehmendem Kontext auftreten.
YaRN erreicht eine starke Langkontextqualität nach der Feinabstimmung eines kleinen Teils der datennaiven Methoden, die erforderlich sind.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Positionsinterpolation zur Kontexterweiterung
Sprach-KI