Als nächstesNächster Leitfaden
Aktivierungssteuerung und Repräsentationstechnik
Technisch
Technischer Leitfaden
SmoothQuant ist eine Technik, die es ermöglicht, große Sprachmodelle sowohl für Gewichtungen als auch für Aktivierungen ohne erneutes Training auf 8-Bit-Ganzzahlen zu komprimieren.
Das ist wichtig, weil Aktivierungen in großen Modellen extreme Ausreißer enthalten, die normalerweise die Mathematik mit geringer Präzision ruinieren, und SmoothQuant sie zähmt.
Wenn Sie ein Modell von 16-Bit-Floats auf 8-Bit-Ganzzahlen verkleinern, lassen sich Gewichte leicht komprimieren, aber Aktivierungen sind problematisch: Bestimmte Kanäle übertragen Werte, die 10 bis 100 Mal größer sind als die anderen, und wenn sie in ein grobes Ganzzahlraster gezwungen werden, wird die Genauigkeit zerstört. SmoothQuant, eingeführt von Xiao et al. stellt im Jahr 2022 fest, dass Gewichte glatt und leicht zu quantifizieren sind, während Aktivierungen spitzenmäßig sind. Es migriert also die Schwierigkeit mathematisch: Es teilt die Aktivierungskanäle durch eine Skala pro Kanal auf und multipliziert die entsprechenden Gewichte mit derselben Skala. Die beiden Operationen werden abgebrochen und die Modellausgabe bleibt unverändert, aber jetzt liegen beide Tensoren in freundlichen Bereichen. Das Ergebnis ist eine W8A8-Inferenz (8-Bit-Gewichte und -Aktivierungen) mit einem Genauigkeitsverlust von nahezu Null und einer ungefähr zweifachen Geschwindigkeitssteigerung und Speichereinsparung.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
SmoothQuant stellte fest, dass Aktivierungsausreißer migrierbar und nicht unvermeidbar sind, und diese Idee untermauert nun die Produktions-INT8- und FP8-Bereitstellung. Erwarten Sie, dass die Glättung mit feinkörnigeren Schemata wie Quantisierung pro Gruppe, erlernter Skalierung und 4-Bit-Aktivierungsforschung (z. B. ausreißerbewusste Methoden) kombiniert wird. Mit zunehmender Reife der FP8-Hardware (Hopper, Blackwell) wird der Ausgleich im Glättungsstil weiterhin in die Compiler- und Inferenz-Engine-Pipelines integriert, sodass die Quantisierung nahezu kostenlos bleibt.
Bereitstellung eines 70B-Parameter-LLM bei W8A8 auf weniger GPUs durch Halbierung der Speicher- und Matrixmultiplikationskosten
Aktivieren der INT8-Inferenz auf NVIDIA Hopper/Blackwell-Tensorkernen, die die 8-Bit-Ganzzahlberechnung nativ beschleunigen
Bereitstellung von Chat-Modellen auf kostenbeschränkten Cloud-Endpunkten, bei denen die Verdoppelung des Durchsatzes die Kosten pro Token direkt senkt
Komprimierende Transformator-Encoder für Sprache oder Übersetzung auf dem Gerät, bei denen 8-Bit-Kernel schneller und kühler laufen
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
SmoothQuant ist eine Technik, die es ermöglicht, große Sprachmodelle sowohl für Gewichtungen als auch für Aktivierungen ohne erneutes Training auf 8-Bit-Ganzzahlen zu komprimieren. Dies ist wichtig, da Aktivierungen in großen Modellen extreme Ausreißer enthalten, die normalerweise eine Berechnung mit geringer Genauigkeit zunichte machen, und SmoothQuant sie zähmt.
SmoothQuant zielt auf die großen Ausreißerwerte ab, die in bestimmten Aktivierungskanälen auftreten und andernfalls die Genauigkeit beeinträchtigen, wenn Aktivierungen auf 8 Bit quantisiert werden.
Es unterteilt die Aktivierungskanäle durch eine Skala pro Kanal und multipliziert die passenden Gewichte mit dieser Skala, sodass das Produkt unverändert bleibt, aber beide Tensoren leichter zu quantisieren sind.
W8A8 bezeichnet eine 8-Bit-Quantisierung sowohl für Gewichte (W) als auch für Aktivierungen (A), die das Regime SmoothQuant mit minimalem Genauigkeitsverlust ermöglicht.
Die Glättungsskalen werden vorab in die Gewichte der vorherigen Schicht oder einen verschmolzenen Vorgang gefaltet, sodass bei der Schlussfolgerung keine zusätzliche Berechnung erfolgt.
Alpha (normalerweise 0,5) gleicht den Glättungsfaktor aus und entscheidet, wie viel der Quantisierungsschwierigkeit von den Aktivierungen auf die Gewichte verlagert wird.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Aktivierungssteuerung und Repräsentationstechnik
Technisch