Zurück zu den Neuigkeiten
InnovationAI Understanding Briefing

Das IBM-Team berichtet, dass KI-geschriebene Adapter Tausende von Hugging-Face-Modellen zu Spyre bringen

Ein IBM Spyre-Team sagt, Codierungsagenten hätten bei der Erstellung von 13 Laufzeitadaptern geholfen, die 7.960 der 10.000 am häufigsten heruntergeladenen Hugging Face-Einbettungsmodelle in seinem Zielsatz abdeckten, wobei 6.804 End-to-End-Tests auf Spyre bestanden hätten. Das Team sagt, dass menschliches Debuggen weiterhin unerlässlich sei.

5 min readRead the primary source
Source-page capture accompanying IBM team reports AI-written adapters bring thousands of Hugging Face models to Spyre
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
pytorch.org
Quelllink
pytorch.orghttps://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

Speicher (Agentenspeicher)
Gespeicherter Kontext, den ein KI-Agent schritt- oder sitzungsübergreifend verwendet, um die Kontinuität zu verbessern.
Einbettungsmodell
Ein Modell, das auf die Konvertierung von Daten in Vektoren spezialisiert ist, die für die semantische Suche, das Clustering und den Abruf verwendet werden.
Einbetten
Eine numerische Vektordarstellung, die die semantische Bedeutung von Text, Bildern oder anderen Daten erfasst.
Testen Sie sich selbstKI-Modelle erklärt Quiz

Was ist passiert?

Das IBM Spyre-Team beschreibt ein System, in dem Codierungsagenten dabei helfen, Standardmodelle von Hugging Face Transformers an den KI-Beschleuniger Spyre von IBM anzupassen. Der Ansatz verwendet Laufzeit-Patches, die nicht unterstützte Vorgänge neu schreiben oder Daten umformen, sodass der vorhandene Torch-Spyre-Compiler die Modelle verarbeiten kann, ohne ihre beabsichtigte mathematische Berechnung zu ändern.

In einem von PyTorch veröffentlichten Beitrag vom 20. August 2026 sagt das IBM Spyre-Team, dass es KI-Codierungsagenten verwendet habe, um beim Aufbau von HF-Adaptern zu helfen, einer Laufzeitschicht zwischen Standardimplementierungen von Hugging Face Transformers und dem Torch-Spyre-Backend für IBMs Spyre-Beschleuniger. Die erklärte Prämisse ist, dass der zugrunde liegende Compiler bereits gewöhnliche Tensoroperationen wie Matrixmultiplikation, elementweise Operationen und Reduktionen verarbeitet, während einige Modelloperationen oder Tensorlayouts noch keinen zuverlässigen Absenkungspfad haben. Ein Adapter ändert die Form der dem Gerät präsentierten Berechnung. In dem Beitrag heißt es, dass die Absicht darin besteht, die Mathematik des Modells beizubehalten, anstatt handoptimierte Kernel hinzuzufügen oder das Verhalten des Modells zu ändern.

Der Beitrag beschreibt zwei Arten von Anpassungen. In einem Beispiel ersetzt das Team Torch.pow(x, 3) in der von der gelu_new-Aktivierung verwendeten Tanh-Näherung durch x*x*x, da letzteres erfolgreich auf Spyre abgesenkt wird. In einem anderen Fall füllt es die Vokabulardimension eines Modells auf, sodass die endgültige Ausgabematrixmultiplikation gleichmäßig auf die Kerne des Beschleunigers aufgeteilt werden kann und seinen Speicherbeschränkungen entspricht. Die hinzugefügten Vokabeleinträge werden als ungenutzte Auffüllung bezeichnet. Die Quelle stellt diese Änderungen als gerätespezifische Umschreibungen dar, behält jedoch die Standardform für die CPU-Ausführung bei, um dort bitweise identisches Verhalten beizubehalten. Es wird darauf hingewiesen, dass die numerische Äquivalenz bei Spyre schwieriger zu beurteilen ist, da die erwartete Hardwaredrift einem Absenkfehler ähneln kann.

Die gemeldete Skala ist das zentrale Ergebnis des Beitrags. In einer Tabelle von Mitte April bis Ende Juni 2026 gibt das Team an, dass 13 verschiedene Adapter 7.960 der 10.000 am häufigsten heruntergeladenen Hugging Face-Einbettungsmodelle in seinem Zielsatz abdeckten. Davon haben 6.804 einen End-to-End-Test auf Spyre bestanden. Der Unterschied weist darauf hin, dass die Verwendung eines Adapters keine Garantie für eine erfolgreiche Ausführung darstellt. Das Team führt die Beschleunigung der Abdeckung auf die Wiederverwendung der Architektur zurück: Ein Adapter kann viele Modelle unterstützen, die aus verwandten Designs erstellt wurden. Es heißt, dass Agenten durch das Lesen und Querverweisen der Transformers- und Torch-Spyre-Codebasen geholfen haben, während die Leute weiterhin für die Reproduktion von Fehlern, die Lokalisierung gerätespezifischer Fehler, die Bewertung des End-to-End-Verhaltens und die Aktualisierung der den Agenten gegebenen Verfahren verantwortlich blieben.

Quellenangaben: pytorch.org ↗

Warum es wichtig ist

Das gemeldete Ergebnis legt nahe, dass KI-gestützte Softwarearbeit die Zeit verkürzen könnte, die für die Unterstützung neuer Modellarchitekturen auf neuer Hardware erforderlich ist. Es zeigt auch, wie reale Modelle Compiler- und Laufzeitfehler aufdecken können, die bei isolierten Bedienertests möglicherweise übersehen werden. Die Quelle bietet jedoch keine unabhängige Validierung oder einen Leistungsvergleich.

Die Modellunterstützung wird häufig durch die Softwareschicht eingeschränkt, die eine Architektur mit der Hardware verbindet. In dem Beitrag heißt es, dass ein neues Modell auf ein nicht unterstütztes Modul, eine verschmolzene Aufmerksamkeitsform, einen numerischen Bereich oder eine Tensorform stoßen kann, selbst wenn der umgebende Stapel ausgereift ist. Bei neueren Beschleunigern ist das Problem umfassender, da eine neue Hardwareplattform und ihr Compiler ein gesamtes Modellökosystem gleichzeitig unterstützen müssen. Wenn der gemeldete Workflow dauerhaft ist, könnten Adapter es Entwicklern ermöglichen, nützliche Modelle auszuführen, während der permanente Compiler und die Laufzeitpfade noch entwickelt werden. Dies könnte die Zeitspanne zwischen der Ankunft eines Modells und seiner Verfügbarkeit auf mehr als einer Hardwareplattform verkürzen.

Die Quelle präsentiert Adapter auch als Testmechanismus und nicht nur als Kompatibilitätsproblemumgehung. Der Betrieb vollständiger Modelle mit trainierten Gewichten kann fehlende Absenkpfade, gerätespezifische numerische Fehler sowie Ausrichtungs- oder Polsterfehler aufdecken, die bei Tests auf Bedienerebene möglicherweise nicht aufgedeckt werden. Das Team sagt, dass die Compiler-Fusion das Verhalten von Operationen im Kontext verändert und dass echte Modellaktivierungen Wertemuster enthalten können, die zufällige Testtensoren nicht reproduzieren. Dies ist ein praktischer Punkt für die Plattformzuverlässigkeit: Ein Modell, das erst nach der Fusion mehrerer Vorgänge ausfällt, kann eine Schwachstelle im Compiler oder in der Laufzeit erkennen, die in isolierten Tests unsichtbar bleiben würde.

Die umfassendere Behauptung sollte als Bericht des IBM Spyre-Teams und nicht als unabhängig festgestelltes Branchenergebnis betrachtet werden. Die Quelle bietet keinen Vergleich mit der manuellen Adapterentwicklung, der Erfolgsquote der Agenten, dem erforderlichen Arbeitsaufwand oder den Testprotokollen hinter den Abdeckungszahlen. Außerdem werden Abdeckung und Bestandsstatus gemeldet, nicht Geschwindigkeit, Kosten, Stromverbrauch, Ausgabequalität oder Produktionszuverlässigkeit. Das Konto unterstützt daher eine konkrete technische Demonstration, es wird jedoch nicht nachgewiesen, dass KI-geschriebene Adapter routinemäßig gleichwertige Ergebnisse über alle Hardwareanbieter, Compiler oder Modellfamilien hinweg liefern.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiver Konzeptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Was Sie als nächstes sehen sollten

Die entscheidenden Fragen sind, ob die Adapter und die unterstützende Software öffentlich verfügbar sind, wie die gemeldeten Tests durchgeführt wurden und ob die Methode über Spyre hinaus funktioniert. Zukünftige Nachweise sollten Latenz-, Durchsatz-, Speicher-, Energie-, numerische Genauigkeits-, Zuverlässigkeits- und Wartungsdaten sowie Tests durch Parteien außerhalb des IBM-Teams umfassen.

Das erste Problem ist die Reproduzierbarkeit. Der Beitrag nennt HF-Adapter und Torch-Spyre, aber die bereitgestellte Quelle gibt weder deren Release-Status, Repository-Inhalte, Versionsnummern, Hardware-Konfiguration, Compiler-Einstellungen oder die genaue Identität des 10.000-Modelle-Zielsatzes an. Unabhängige Entwickler müssen feststellen, ob die Adapter überprüft und erneut ausgeführt werden können, ob dieselben Modelle auch spätere Softwareversionen weitergeben und wie viel manueller Eingriff für jeden erfolgreichen Adapter erforderlich ist. Diese Details würden zeigen, ob es sich bei dem gemeldeten Arbeitsablauf um eine übertragbare technische Methode oder eine streng verwaltete Demonstration handelt.

Auch Leistung und Modelltreue sind ungeklärt. Eine erfolgreiche Kompilierung führt nicht zu einer brauchbaren Inferenzleistung. Bei Folgetests sollten Latenz, Durchsatz, Speichernutzung, Energieverbrauch, Kompilierungszeit, Fehlerraten und numerische Toleranzen anhand einer vertrauenswürdigen CPU- oder GPU-Referenz ermittelt werden. Die Quelle gibt an, dass der ursprüngliche und der angepasste Code im Allgemeinen voraussichtlich bitweise auf der CPU oder GPU identisch sind, sie liefert jedoch keine aggregierten Fehlermessungen auf Spyre oder Beweise dafür, dass die gemeldeten Modelle die Genauigkeit auf Aufgabenebene bewahren. Es wird auch nicht gesagt, ob jedes abgedeckte Einbettungsmodell mit repräsentativen Produktions-Workloads oder nur mit einer definierten End-to-End-Prüfung getestet wurde.

Abschließend muss noch die Haltbarkeit der Adapterschicht nachgewiesen werden. Das Team sagt, dass einzelne Adapter möglicherweise entfernt werden, wenn der zugrunde liegende Stack verbessert wird, während andere aufgrund dauerhafter Hardwareunterschiede möglicherweise bestehen bleiben. Zukünftige Modellarchitekturen, Compileränderungen und neue numerische Randfälle könnten eine kontinuierliche Wartung erfordern. Beweise von anderen Beschleunigern, unabhängigen Teams und Modellfamilien außerhalb des gemeldeten Einbettungssatzes würden die Behauptung des Beitrags überprüfen, dass dieselbe Schleife weitgehend verallgemeinert wird. Die menschliche Aufsicht bleibt wichtig, wenn es Agenten erlaubt ist, den Bereitstellungscode zu ändern, da die Quelle selbst besagt, dass Agenten aus einer Zwischendiskrepanz, die den endgültigen Modellfehler nicht erklärt, auf eine plausible Ursache schließen können.

Verwandte Leitfäden und Quizze

KI-Modelle erklärtTransformatorenKI-AgentenKI-TrainingTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?