Achtung bei gruppierter Abfrage
Grouped-Query Attention (GQA) ist eine Möglichkeit, den bei der Textgenerierung benötigten Speicher zu verkleinern, indem mehrere Abfrageköpfe dieselben Schlüssel- und Wertköpfe verwenden.
Übersicht
It makes large models much faster to serve with almost no quality loss.
Tiefer Einblick
In einer standardmäßigen Aufmerksamkeitsschicht mit mehreren Köpfen hat jeder Kopf seine eigenen Abfragen, Schlüssel und Werte. Während der Generierung werden die Schlüssel und Werte für alle vorherigen Token zwischengespeichert (der „KV-Cache“), sodass das Modell sie nicht neu berechnet. Bei vielen Köpfen und langen Kontexten wird dieser Cache enorm und dominiert die Speicherbandbreite zur Inferenzzeit. GQA, eingeführt von Google-Forschern im Jahr 2023, gruppiert die Abfrageköpfe und gibt jeder Gruppe einen einzigen gemeinsamen Satz von Schlüssel- und Wertköpfen. Wenn Sie 32 Abfrageköpfe, aber nur 8 KV-Gruppen haben, schrumpft der KV-Cache etwa um das Vierfache. Dies liegt zwischen vollständiger Multi-Head-Aufmerksamkeit (jeder Kopf separat) und Multi-Abfrage-Aufmerksamkeit (ein gemeinsamer KV für alle Köpfe) und erfasst den größten Teil der Geschwindigkeit von MQA, während die Qualität nahe an der vollen Aufmerksamkeit bleibt. Llama 2 70B und viele spätere Modelle übernahmen es.
Technischer Einblick
Die Aufmerksamkeitsqualität hängt stark davon ab, dass es viele unterschiedliche Abfragerichtungen gibt, sie toleriert jedoch die gemeinsame Nutzung von Schlüsseln und Werten. GQA nutzt diese Asymmetrie aus: Es behält alle Abfrageköpfe bei, repliziert aber jeden gemeinsam genutzten KV-Kopf über die Abfragen in seiner Gruppe hinweg. Die Einsparungen ergeben sich daraus, dass der KV-Cache der Hauptverbraucher der Speicherbandbreite ist. Weniger KV-Köpfe bedeuten weniger zu lesende Daten pro generiertem Token. Modelle werden oft kurzzeitig „uptrainiert“, um einen vorhandenen Mehrkopf-Prüfpunkt in einen GQA-Prüfpunkt umzuwandeln.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft der Aufmerksamkeit bei gruppierten Abfragen
GQA ist heute ein Standardstandard bei Open-Weight-Modellen, da es einen geringen Qualitätsaufwand gegen große Portionsgewinne eintauscht. Erwarten Sie, dass es zunehmend mit anderen Effizienztricks wie FlashAttention, KV-Cache-Quantisierung und neueren Schemata wie Multi-Head-Latent-Attention kombiniert wird, die den Cache noch weiter komprimieren. Da die Kontextfenster größer werden, wird die Steuerung der KV-Cache-Größe weiterhin ein zentrales Designproblem bleiben, und die gemeinsame Nutzung von Heads im GQA-Stil wird ein wichtiger Hebel bleiben.
Reale Umsetzung
Llama 2 70B und Llama 3 verwenden GQA, um lange Kontexte mit einem kleineren KV-Cache zu bedienen
Reduzierung des GPU-Speichers, damit ein großes Chat-Modell auf weniger oder günstigere Beschleuniger passt
Beschleunigung der Token-für-Token-Generierung in Produktions-APIs, bei denen die KV-Cache-Bandbreite den Engpass darstellt
Ermöglicht größere Stapelgrößen, um viele Benutzer gleichzeitig zu bedienen, ohne den Speicher zu erschöpfen
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Aufmerksamkeit bei mehreren Abfragen
Häufig gestellte Fragen
What is Grouped-Query Attention?
Grouped-Query Attention (GQA) ist eine Möglichkeit, den bei der Textgenerierung benötigten Speicher zu verkleinern, indem mehrere Abfrageköpfe dieselben Schlüssel- und Wertköpfe verwenden. Dadurch können große Modelle viel schneller und nahezu ohne Qualitätsverlust bereitgestellt werden.
Was wird in Grouped-Query Attention von einer Gruppe von Abfrageköpfen gemeinsam genutzt?
GQA behält separate Abfrageköpfe bei, lässt jedoch zu, dass jede Gruppe einen Satz von Schlüssel- und Wertköpfen gemeinsam nutzt, wodurch der KV-Cache verkleinert wird.
GQA lässt sich am besten als Mittelweg zwischen welchen beiden Extremen beschreiben?
Multi-Head gibt jedem Kopf seinen eigenen KV; Multi-Abfrage teilt einen KV für alle Köpfe; GQA liegt dazwischen und einige KV-Gruppen.
Welchen Teil der Schlussfolgerung macht GQA in erster Linie billiger?
Die Einsparungen zeigen sich zum Zeitpunkt der Generierung, wo das Lesen des KV-Cache die Hauptkosten für die Speicherbandbreite darstellt.
Wenn ein Modell 32 Abfrageköpfe und 8 KV-Gruppen hat, wird der KV-Cache ungefähr um welchen Faktor reduziert?
32 Abfrageköpfe geteilt durch 8 gemeinsam genutzte KV-Gruppen führen zu einer etwa vierfachen Reduzierung der zwischengespeicherten Schlüssel und Werte.
Warum kann GQA trotz gemeinsamer KV-Köpfe den Großteil der Modellqualität bewahren?
Aufmerksamkeit toleriert die gemeinsame Nutzung von Schlüsseln und Werten weitaus besser als den Verlust eindeutiger Abfragerichtungen, sodass GQA die Qualität hoch hält.