Als nächstesNächster Leitfaden
Continued Pretraining vs Fine-Tuning
Technisch
Technischer Leitfaden
GPUs und TPUs sind die beiden dominierenden Chiptypen für das Training und die Ausführung von KI.
GPUs are flexible all-rounders dominated by NVIDIA; TPUs are Google's custom chips built specifically to crunch the math behind neural networks.
Eine GPU (Graphics Processing Unit) wurde ursprünglich zum Rendern von Videospielgrafiken entwickelt, aber ihre Tausenden paralleler Kerne erwiesen sich als perfekt für die Matrixmathematik im Deep Learning. NVIDIA-GPUs (wie die A100 und H100) wurden in Kombination mit dem CUDA-Software-Ökosystem zum Branchenstandard. Eine TPU (Tensor Processing Unit) ist der ASIC von Google – ein anwendungsspezifischer Chip, der von Grund auf für Tensoroperationen entwickelt wurde. TPUs verwenden ein „systolisches Array“, das Daten durch ein Raster von Multiplikations-Akkumulations-Einheiten mit minimalem Speicherverkehr streamt, was sie für große Matrixmultiplikationen äußerst effizient macht. Der praktische Kompromiss: GPUs sind vielseitig, weit verbreitet und werden von einem riesigen Software-Ökosystem unterstützt; TPUs können eine bessere Leistung pro Watt und bessere Kosten für spezifische groß angelegte Schulungen bieten, sind jedoch meist an die Google Cloud und den TensorFlow/JAX-Stack gebunden.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Der Trend zu kundenspezifischem Silizium beschleunigt sich. Über die TPUs von Google hinaus entwickeln Amazon (Trainium/Inferentia), Microsoft (Maia) und viele Startups KI-spezifische Chips, um die Abhängigkeit von NVIDIA zu verringern und die Kosten zu senken. Erwarten Sie mehr Spezialisierung – separate, für das Training optimierte Chips im Vergleich zu Inferenz mit geringer Latenz – und eine zunehmende Betonung der Leistung pro Watt, da Energie zur verbindlichen Einschränkung wird. NVIDIAs CUDA-Graben behält vorerst die Dominanz der GPUs bei, aber die langfristige Richtung ist eine vielfältigere Hardware-Landschaft.
Trainieren eines großen Sprachmodells auf einem Google Cloud TPU-„Pod“ aus Tausenden miteinander verbundenen Chips
Forscher verwenden NVIDIA H100-GPUs mit CUDA, um mit neuen Modellarchitekturen zu experimentieren
Ein Startup, das GPUs aufgrund ihrer Flexibilität und breiten Framework-Unterstützung stundenweise von einem Cloud-Anbieter mietet
Google führt Inferenz für Suchen und Übersetzen effizient auf TPUs in großem Maßstab aus
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
GPUs und TPUs sind die beiden dominierenden Chiptypen für das Training und die Ausführung von KI. GPUs sind flexible Allrounder, die von NVIDIA dominiert werden; TPUs sind die maßgeschneiderten Chips von Google, die speziell für die Berechnung der Mathematik hinter neuronalen Netzen entwickelt wurden.
GPUs wurden zum Rendern von Grafiken entwickelt, ihr massiv paralleles Design erwies sich jedoch als ideal für die Matrixmathematik im Deep Learning.
Die Tensor Processing Unit ist ein benutzerdefinierter Chip (ASIC), der von Google speziell für Arbeitslasten neuronaler Netzwerke entwickelt wurde.
TPUs verwenden ein systolisches Array, bei dem Daten durch ein Gitter aus mehrfach akkumulierten Zellen fließen, Ergebnisse direkt zwischen ihnen weitergeleitet werden und der Speicherverkehr reduziert wird.
Das Verschieben von Daten in den Speicher und aus dem Speicher ist häufig der limitierende Faktor. Das systolische Array minimiert dies, indem es Zwischenergebnisse direkt zwischen den Zellen weiterleitet.
GPUs sind vielseitig, weit verbreitet und werden durch das ausgereifte CUDA-Ökosystem und eine breite Framework-Unterstützung unterstützt, was sie zum Branchenstandard macht.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Continued Pretraining vs Fine-Tuning
Technisch