Retour aux Actualités
IndustrieBriefing AI Understanding

The Register rapporte que les fournisseurs d'IA se diversifient au-delà des GPU Nvidia pour l'inférence

Le Register rapporte que Cerebras, Google, Marvell et Waymo recherchent des siliciums spécialisés pour améliorer la vitesse d'inférence, la consommation d'énergie ou la latence de l'IA, bien que les divulgations sous-jacentes et les déploiements commerciaux ne soient pas confirmés ici de manière indépendante.

6 min readRead the original reporting
Source-provided image accompanying The Register reports AI vendors are diversifying beyond Nvidia GPUs for inference
Rapports attribuésSource enregistrée
Éditeur
theregister.com
Lien source
theregister.comhttps://www.theregister.com/ai-and-ml/2026/08/24/ai-vendors-are-turning-to-custom-hardware-as-microsoft-winds-back-the-clock-on-windows/5291293
Type de source
Reportage d'un média – pas d'un document de première partie.

Ce que nous n'avons pas pu confirmer indépendamment: Cette affirmation est attribuée au point de vente nommé. Nous ne l'avons pas vérifié par rapport à un document de première partie. (theregister.com)

ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

Inférence
Phase d'exécution au cours de laquelle un modèle entraîné génère des prédictions ou des sorties.
Mémoire (mémoire de l'agent)
Contexte stocké qu'un agent IA utilise au fil des étapes ou des sessions pour améliorer la continuité.
Précision
La proportion de résultats positifs prédits qui sont réellement corrects.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

Le Register rapporte une évolution croissante vers du matériel d’IA personnalisé et alternatif. Son compte couvre le système de rack modulaire CS-4 de Cerebras, le rôle croissant de Marvell dans la conception d'accélérateurs personnalisés, l'utilisation continue par Google de TPU spécialisés et le développement par Waymo d'un accélérateur d'apprentissage automatique pour les véhicules autonomes. Le rapport décrit également que Microsoft restaure plusieurs fonctionnalités de personnalisation de Windows et de surveillance de l'IA, mais il s'agit d'un thread secondaire distinct.

Le rapport du 24 août du Register se concentre sur ce que ses éditeurs décrivent comme une avancée au-delà du rôle dominant de Nvidia dans les centres de données d’IA. Les fournisseurs répartissent de plus en plus les charges de travail entre différents types de silicium au lieu de s'appuyer sur un seul type d'accélérateur. Il présente l'inférence, ou la génération de résultats à partir de modèles formés, comme le principal point de pression : les fournisseurs veulent des taux de jetons élevés pour les assistants de codage et autres services interactifs tout en contrôlant les coûts d'énergie et de matériel liés au traitement des demandes. L’article du Register est une transcription et une analyse de podcast, il doit donc être lu comme un rapport de ce média plutôt que comme une documentation vérifiée de manière indépendante de chaque affirmation technique.

Le Register rapporte que Cerebras passe de grands systèmes monolithiques à sa conception à l'échelle du rack CS-4. Les systèmes Cerebras antérieurs plaçaient une grande puce à l'échelle d'une tranche, gourmande en énergie, dans un châssis autonome refroidi par liquide. La nouvelle approche place trois puces dans un agencement de rack modulaire, permettant de remplacer les composants informatiques sans remplacer l'équipement d'alimentation électrique associé. The Register indique que la conception double la vitesse d'horloge, la bande passante mémoire et la vitesse d'entrée-sortie, tout en plaçant trois fois plus de silicium dans un rack. Il indique également que Cerebras a des partenariats avec AWS et AMD, et que la génération rapide de jetons a suscité l'intérêt pour les assistants de codage et autres services d'inférence.

Le rapport décrit un écosystème de silicium personnalisé plus large autour des hyperscalers : Google utilise ses propres unités de traitement tensoriel depuis environ 2015 et s'appuie sur Broadcom pour certaines parties de la conception d'accélérateurs personnalisés, tandis que Marvell devient un concurrent dans les travaux de XPU et de connectivité personnalisés après avoir constitué un portefeuille de propriété intellectuelle par le biais d'acquisitions. L'article présente cela comme un moyen pour les entreprises cloud de comparer leurs fournisseurs ou de réduire leur dépendance à l'égard d'un seul partenaire de conception, mais ne documente pas un nouveau contrat spécifique Google-Marvell ; les affirmations concernant les futures stratégies des clients et la pression sur les prix sont des commentaires et non des développements établis. Waymo a dévoilé un accélérateur d'apprentissage automatique personnalisé destiné aux véhicules, car le volume du capteur et la faible latence sont importants lorsqu'un obstacle apparaît. Le Register indique que Waymo s'est fortement appuyé sur des réseaux de portes programmables sur site et pourrait rechercher une plus grande densité de calcul et un développement plus facile d'un circuit intégré spécifique à une application, mais ne fournit aucune spécification, résultat de test, calendrier de production ou dossier de sécurité. Par ailleurs, Microsoft teste les barres de tâches mobiles de Windows 11, des menus contextuels plus personnalisables et la visibilité du gestionnaire de tâches sur les charges de travail des unités de traitement neuronal.

Détails de la source: theregister.com ↗

Pourquoi c'est important

Ce changement pourrait rendre l’infrastructure d’IA moins dépendante d’une classe de GPU Nvidia et mettre davantage l’accent sur le matériel conçu pour des charges de travail d’inférence particulières. Des temps de réponse plus rapides, des coûts d'exploitation réduits, une meilleure efficacité énergétique et une intégration plus étroite avec les capteurs sont les objectifs pratiques décrits par The Register. Le rapport n’établit pas qu’une alternative ait largement dépassé Nvidia dans les déploiements réels.

L’importance pratique est que les performances de l’IA ne sont pas déterminées uniquement par le modèle. Les rapports du Register montrent que les fournisseurs optimisent le matériel sous inférence pour des contraintes particulières : vitesse de génération de jetons pour les outils interactifs, alimentation et refroidissement pour les racks des centres de données et latence pour le contrôle des véhicules. Si ces conceptions fonctionnent à grande échelle, les entreprises pourraient choisir différents accélérateurs pour la formation, l’inférence à volume élevé, les requêtes premium à faible latence et les charges de travail de pointe. Cela rendrait le marché des infrastructures d’IA plus spécialisé et pourrait offrir aux clients davantage d’alternatives aux systèmes GPU à usage général.

La refonte du rack signalée par Cerebras met en évidence un problème opérationnel qui peut passer inaperçu dans les principales allégations de performances. Le Register indique que les systèmes antérieurs consommaient environ 15 kilowatts pour la puce et regroupaient le calcul et l'équipement d'alimentation électrique dans un grand châssis. Un rack modulaire pourrait rendre les réparations et les mises à niveau moins perturbatrices, même si le silicium reste particulièrement gourmand en énergie. Pour les opérateurs de centres de données, la facilité d'entretien, le câblage, le refroidissement et la possibilité de remplacer un composant défaillant peuvent avoir autant d'importance que le débit maximal. La source ne vérifie pas de manière indépendante les chiffres de puissance ou de performances déclarés, de sorte que ces avantages restent des allégations nécessitant un examen technique.

Une base de fournisseurs plus large pourrait affecter le pouvoir de négociation et les décisions d’investissement. Le Register suggère que les sociétés cloud font souvent appel à des sociétés de propriété intellectuelle extérieures pour des parties moins distinctives des puces personnalisées, tout en concentrant l'ingénierie interne sur les fonctionnalités pertinentes pour leurs services. La concurrence entre Broadcom et Marvell pourrait offrir aux hyperscalers une autre voie de conception, mais le silicium personnalisé crée également des obligations en matière de logiciels et de support. Une puce efficace pour une charge de travail peut être difficile à programmer, difficile à se procurer ou mal adaptée à une autre. Le rapport ne propose aucune comparaison des coûts avec les systèmes Nvidia et aucune preuve que les clients changent de système à grande échelle. L'exemple de Waymo connecte le matériel d'IA personnalisé à un déploiement sensible à la sécurité plutôt qu'à l'économie du centre de données : une faible latence est importante lorsqu'un véhicule répond aux entrées d'un capteur, et l'intervention humaine à distance n'est pas un substitut idéal à un traitement immédiat à bord. Cela ne démontre pas une sécurité améliorée ; il n’y a pas d’évaluation indépendante, de comparaison des taux d’échec ou d’évaluation réglementaire. La conclusion la plus étroite est que les véhicules autonomes fournissent une raison de concevoir du silicium autour du traitement des capteurs et du temps de réponse, tandis que l'impact sur le public dépend de la validation dans des conditions de fonctionnement réelles.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Que regarder ensuite

Les tests clés sont la documentation technique publique, les tests de référence indépendants et les preuves d'une utilisation à grande échelle par les clients. Regardez si la nouvelle conception de rack de Cerebras, les accélérateurs personnalisés soutenus par Marvell et le silicium pour véhicules de Waymo atteignent la production, et si leurs avantages l'emportent sur les coûts de logiciels, de chaîne d'approvisionnement et de maintenance. Les modifications apportées à Windows par Microsoft doivent également être jugées en fonction de leur disponibilité publique et si elles améliorent le contrôle des utilisateurs plutôt que de simplement ajouter davantage de surveillance du système.

Tout d’abord, recherchez le matériel technique principal de Cerebras, Waymo, Google, Marvell ou de leurs clients. Les preuves utiles incluraient des documents d'architecture, des mesures de puissance, un support logiciel, l'état de production et des tests de charge de travail clairement définis. Le rapport du Registre fournit une carte digne d’intérêt des entreprises impliquées, mais n’établit pas la disponibilité, les prix, le volume de clients ou les performances indépendantes. Ces détails manquants déterminent si les développements sont des mouvements industriels ou principalement des plans d’ingénierie.

Deuxièmement, comparez ce qui est comparable. Les chiffres de jetons par seconde peuvent varier en fonction de la taille du modèle, du lot, de la précision, de la longueur du contexte et du nombre d'utilisateurs simultanés. Un accélérateur personnalisé peut être excellent pour un modèle d'inférence étroit et moins utile pour les charges de travail générales. Surveillez les tests indépendants mesurant le débit, la latence de réponse, l'énergie par jeton généré, l'utilisation, la fiabilité et le coût total de possession par rapport aux systèmes GPU contemporains. Sans ce contexte, les allégations d’une IA plus rapide ou moins chère restent difficiles à évaluer. Troisièmement, suivez les relations commerciales : The Register rapporte les partenariats de Cerebras avec AWS et AMD et décrit Marvell comme entrant dans un domaine auparavant dominé par Broadcom et les équipes internes d'hyperscaler. La prochaine preuve importante sera de savoir si ces relations produisent des services généralement accessibles, des déploiements nommés ou des commandes répétées. L’attente du rapport selon laquelle les services AWS ou AMD pourraient utiliser le matériel Cerebras est un commentaire prospectif, et non un déploiement confirmé, et ne doit pas être traité comme tel.

Enfin, surveillez séparément la mise en œuvre du véhicule de Waymo et les modifications logicielles de Microsoft. Pour Waymo, les questions importantes sont de savoir si l'accélérateur est installé dans des véhicules de production, comment il gère les charges de travail des capteurs, quels systèmes de repli existent et quelle validation de sécurité a été effectuée. Pour Windows, The Register indique que le mouvement de la barre des tâches se fait dans le canal Release Preview et qu'une visibilité améliorée du processus NPU est en cours de développement, mais le timing public et le comportement final peuvent changer. Aucun des deux fils de discussion ne doit être présenté comme complet jusqu'à ce que les entreprises publient une disponibilité stable et que les utilisateurs indépendants puissent évaluer les résultats.

Guides et quiz associés

Modèles d'IA expliquésTransformateursAvenir de l'IAChatGPT et LLMTestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi du financement de l'IA
Vous avez trouvé cela utile ?