Sprach-KI-GUIDE

Achtung bei gruppierter Abfrage

Grouped-Query Attention (GQA) ist eine Möglichkeit, den bei der Textgenerierung benötigten Speicher zu verkleinern, indem mehrere Abfrageköpfe dieselben Schlüssel- und Wertköpfe verwenden.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It makes large models much faster to serve with almost no quality loss.

Tiefer Einblick

In einer standardmäßigen Aufmerksamkeitsschicht mit mehreren Köpfen hat jeder Kopf seine eigenen Abfragen, Schlüssel und Werte. Während der Generierung werden die Schlüssel und Werte für alle vorherigen Token zwischengespeichert (der „KV-Cache“), sodass das Modell sie nicht neu berechnet. Bei vielen Köpfen und langen Kontexten wird dieser Cache enorm und dominiert die Speicherbandbreite zur Inferenzzeit. GQA, eingeführt von Google-Forschern im Jahr 2023, gruppiert die Abfrageköpfe und gibt jeder Gruppe einen einzigen gemeinsamen Satz von Schlüssel- und Wertköpfen. Wenn Sie 32 Abfrageköpfe, aber nur 8 KV-Gruppen haben, schrumpft der KV-Cache etwa um das Vierfache. Dies liegt zwischen vollständiger Multi-Head-Aufmerksamkeit (jeder Kopf separat) und Multi-Abfrage-Aufmerksamkeit (ein gemeinsamer KV für alle Köpfe) und erfasst den größten Teil der Geschwindigkeit von MQA, während die Qualität nahe an der vollen Aufmerksamkeit bleibt. Llama 2 70B und viele spätere Modelle übernahmen es.

Technischer Einblick

Die Aufmerksamkeitsqualität hängt stark davon ab, dass es viele unterschiedliche Abfragerichtungen gibt, sie toleriert jedoch die gemeinsame Nutzung von Schlüsseln und Werten. GQA nutzt diese Asymmetrie aus: Es behält alle Abfrageköpfe bei, repliziert aber jeden gemeinsam genutzten KV-Kopf über die Abfragen in seiner Gruppe hinweg. Die Einsparungen ergeben sich daraus, dass der KV-Cache der Hauptverbraucher der Speicherbandbreite ist. Weniger KV-Köpfe bedeuten weniger zu lesende Daten pro generiertem Token. Modelle werden oft kurzzeitig „uptrainiert“, um einen vorhandenen Mehrkopf-Prüfpunkt in einen GQA-Prüfpunkt umzuwandeln.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft der Aufmerksamkeit bei gruppierten Abfragen

GQA ist heute ein Standardstandard bei Open-Weight-Modellen, da es einen geringen Qualitätsaufwand gegen große Portionsgewinne eintauscht. Erwarten Sie, dass es zunehmend mit anderen Effizienztricks wie FlashAttention, KV-Cache-Quantisierung und neueren Schemata wie Multi-Head-Latent-Attention kombiniert wird, die den Cache noch weiter komprimieren. Da die Kontextfenster größer werden, wird die Steuerung der KV-Cache-Größe weiterhin ein zentrales Designproblem bleiben, und die gemeinsame Nutzung von Heads im GQA-Stil wird ein wichtiger Hebel bleiben.

Reale Umsetzung

Llama 2 70B und Llama 3 verwenden GQA, um lange Kontexte mit einem kleineren KV-Cache zu bedienen

Reduzierung des GPU-Speichers, damit ein großes Chat-Modell auf weniger oder günstigere Beschleuniger passt

Beschleunigung der Token-für-Token-Generierung in Produktions-APIs, bei denen die KV-Cache-Bandbreite den Engpass darstellt

Ermöglicht größere Stapelgrößen, um viele Benutzer gleichzeitig zu bedienen, ohne den Speicher zu erschöpfen

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Aufmerksamkeit bei mehreren Abfragen

Häufig gestellte Fragen

What is Grouped-Query Attention?

Grouped-Query Attention (GQA) ist eine Möglichkeit, den bei der Textgenerierung benötigten Speicher zu verkleinern, indem mehrere Abfrageköpfe dieselben Schlüssel- und Wertköpfe verwenden. Dadurch können große Modelle viel schneller und nahezu ohne Qualitätsverlust bereitgestellt werden.

Was wird in Grouped-Query Attention von einer Gruppe von Abfrageköpfen gemeinsam genutzt?

GQA behält separate Abfrageköpfe bei, lässt jedoch zu, dass jede Gruppe einen Satz von Schlüssel- und Wertköpfen gemeinsam nutzt, wodurch der KV-Cache verkleinert wird.

GQA lässt sich am besten als Mittelweg zwischen welchen beiden Extremen beschreiben?

Multi-Head gibt jedem Kopf seinen eigenen KV; Multi-Abfrage teilt einen KV für alle Köpfe; GQA liegt dazwischen und einige KV-Gruppen.

Welchen Teil der Schlussfolgerung macht GQA in erster Linie billiger?

Die Einsparungen zeigen sich zum Zeitpunkt der Generierung, wo das Lesen des KV-Cache die Hauptkosten für die Speicherbandbreite darstellt.

Wenn ein Modell 32 Abfrageköpfe und 8 KV-Gruppen hat, wird der KV-Cache ungefähr um welchen Faktor reduziert?

32 Abfrageköpfe geteilt durch 8 gemeinsam genutzte KV-Gruppen führen zu einer etwa vierfachen Reduzierung der zwischengespeicherten Schlüssel und Werte.

Warum kann GQA trotz gemeinsamer KV-Köpfe den Großteil der Modellqualität bewahren?

Aufmerksamkeit toleriert die gemeinsame Nutzung von Schlüsseln und Werten weitaus besser als den Verlust eindeutiger Abfragerichtungen, sodass GQA die Qualität hoch hält.