Als nächstesNächster Leitfaden
Positionsinterpolation zur Kontexterweiterung
Sprach-KI
Technischer Leitfaden
Positionsinterpolation (PI) ist eine einfache, einflussreiche Technik, die das Kontextfenster eines Transformers erweitert, indem neue Positionsindizes in den Bereich gequetscht werden, den das Modell bereits kennt.
Anstatt auf unsichtbare Positionen zu extrapolieren, interpoliert es innerhalb trainierter Positionen und erfordert nur eine kurze Feinabstimmung.
Positional Interpolation wurde 2023 von Meta-Forschern (Chen et al.) eingeführt und behebt die Tatsache, dass Modelle mit RoPE katastrophal versagen, wenn sie auf Positionen außerhalb des Trainings extrapoliert werden. Die Erkenntnis widerspricht der Intuition: Anstatt das Modell mit größeren Positionswerten zu beauftragen, die es noch nie gesehen hat, dividiert PI eingehende Positionsindizes durch einen Skalierungsfaktor, sodass eine Ziellänge von beispielsweise 8 KB wieder dem ursprünglichen 2 KB-Bereich zugeordnet wird. Da das Modell in diesem Bereich trainiert wurde, bleiben die Rotationen in der Verteilung. Nach nur 1.000 Feinabstimmungsschritten konnte ein auf diese Weise erweitertes LLaMA-Modell bis zu 32.000 Kontext verarbeiten. Die Arbeit zeigte, dass die Extrapolation die Aufmerksamkeitswerte auf enorme Werte steigern kann, während die Interpolation sie begrenzt und stabil hält, weshalb die Interpolation wesentlich besser funktioniert als die Extrapolation.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Die Positionsinterpolation wurde zur Grundlage für eine Reihe von Folgemaßnahmen, darunter NTK-fähige Skalierung und YaRN, die selektiver interpolieren, um lokale Details zu bewahren. Der Trend geht hin zu Methoden, die kaum oder gar keiner Feinabstimmung bedürfen, und dahingehend, die Handhabung langer Kontexte in die Vorschulung zu integrieren. PI bleibt eine wertvolle Basislinie und wird häufig mit neueren frequenzbewussten Schemata kombiniert, um Kontextfenster von über 128.000 effizient zu erreichen.
Erweiterung eines 2K-Kontext-LLaMA-Modells zur Verarbeitung von 8K-32K-Tokens mit etwa 1.000 Feinabstimmungsschritten
Anpassung eines bestehenden Chat-Modells für die Zusammenfassung langer Dokumente ohne Umschulung von Grund auf
Dient als konzeptionelle Grundlage, auf der NTK-fähige Skalierung und YaRN verbessert werden
Ermöglicht die Analyse von Langkontextcode oder Rechtsdokumenten für Modelle, die ursprünglich mit kurzen Fenstern trainiert wurden
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Positionsinterpolation (PI) ist eine einfache, einflussreiche Technik, die das Kontextfenster eines Transformers erweitert, indem neue Positionsindizes in den Bereich gequetscht werden, den das Modell bereits kennt. Anstatt auf unsichtbare Positionen zu extrapolieren, interpoliert es innerhalb trainierter Positionen und erfordert nur eine kurze Feinabstimmung.
PI dividiert Positionsindizes durch einen Skalierungsfaktor, sodass längere Sequenzen wieder dem trainierten Positionsbereich zugeordnet werden und die Rotationen in der Verteilung bleiben.
Das PI-Papier zeigte, dass unsichtbare große Positionen zu Aufmerksamkeitswerten führen können, die um Größenordnungen höher sind als beim Training, was Softmax destabilisiert.
Das Papier berichtete, dass rund 1.000 Feinabstimmungsschritte ausreichten, um den Kontext auf bis zu 32.000 Token zu erweitern.
PI skaliert die Position m in m/s neu und komprimiert den neuen größeren Bereich in den ursprünglich trainierten Bereich.
PI hat die Interpolation als sicheren Ansatz etabliert; NTK-fähige Skalierung und YaRN verfeinerten es durch selektivere Interpolation von Frequenzen.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Positionsinterpolation zur Kontexterweiterung
Sprach-KI