Cosa è successo
Il Registro segnala un movimento sempre più ampio verso hardware AI personalizzato e alternativo. Il suo account copre il sistema rack modulare CS-4 di Cerebras, il ruolo crescente di Marvell nella progettazione di acceleratori personalizzati, l’uso continuo di TPU specializzati da parte di Google e lo sviluppo di Waymo di un acceleratore di apprendimento automatico per veicoli autonomi. Il rapporto descrive anche il ripristino da parte di Microsoft di diverse funzionalità di personalizzazione di Windows e di monitoraggio dell'intelligenza artificiale, ma si tratta di un thread secondario separato.
Il rapporto del 24 agosto del Register è incentrato su ciò che i suoi redattori descrivono come un passo oltre il ruolo dominante di Nvidia nei data center AI. I fornitori dividono sempre più i carichi di lavoro tra diversi tipi di silicio invece di fare affidamento su un unico tipo di acceleratore. Presenta l'inferenza, o la generazione di output da modelli addestrati, come il principale punto di pressione: i fornitori desiderano tariffe elevate per i token per gli assistenti di codifica e altri servizi interattivi, controllando al tempo stesso i costi energetici e hardware per soddisfare le richieste. L'articolo del Register è una trascrizione e un'analisi del podcast, quindi dovrebbe essere letto come un resoconto di quel punto vendita piuttosto che come una documentazione verificata in modo indipendente di ogni affermazione tecnica.
Il Register riporta che Cerebras si sta spostando da sistemi grandi e monolitici verso il suo design su scala rack CS-4. I precedenti sistemi Cerebras collocavano un chip grande e assetato di energia su scala wafer in uno chassis autonomo raffreddato a liquido. Il nuovo approccio colloca tre chip in una disposizione rack modulare, consentendo la sostituzione dei componenti di elaborazione senza sostituire le apparecchiature di erogazione di energia associate. Il Register afferma che il progetto raddoppia la velocità di clock, la larghezza di banda della memoria e la velocità di input-output, collocando al contempo una quantità di silicio tre volte superiore in un rack. Si afferma inoltre che Cerebras ha collaborazioni con AWS e AMD e che la generazione rapida di token ha attirato l'interesse per gli assistenti di codifica e altri servizi di inferenza.
Il rapporto descrive un ecosistema di silicio personalizzato più ampio attorno agli hyperscaler: Google ha utilizzato le proprie unità di elaborazione tensore dal 2015 circa e si è affidato a Broadcom per porzioni di progettazione di acceleratori personalizzati, mentre Marvell sta diventando un concorrente nell'XPU personalizzato e nel lavoro di connettività dopo aver costruito un portafoglio di proprietà intellettuale attraverso acquisizioni. L'articolo lo inquadra come un modo per le aziende cloud di confrontare i fornitori o ridurre la dipendenza da un unico partner di progettazione, ma non documenta un nuovo contratto Google-Marvell specifico; le affermazioni sulle future strategie dei clienti e sulla pressione sui prezzi sono commenti, non sviluppi consolidati. Waymo ha rivelato un acceleratore di apprendimento automatico personalizzato destinato ai veicoli perché il volume del sensore e la bassa latenza sono importanti quando appare un ostacolo. Il Registro afferma che Waymo ha fatto molto affidamento su gate array programmabili sul campo e potrebbe cercare una maggiore densità di calcolo e uno sviluppo più semplice di un circuito integrato specifico per l'applicazione, ma non fornisce specifiche, risultati dei test, tempi di produzione o record di sicurezza. Separatamente, Microsoft sta testando le barre delle applicazioni mobili di Windows 11, menu contestuali più personalizzabili e la visibilità del Task Manager nei carichi di lavoro delle unità di elaborazione neurale.
Dettagli della fonte: theregister.com ↗
Perché è importante
Il cambiamento potrebbe rendere l’infrastruttura AI meno dipendente da una classe di GPU Nvidia e porre maggiormente l’accento sull’hardware progettato per particolari carichi di lavoro di inferenza. Tempi di risposta più rapidi, costi operativi inferiori, migliore efficienza energetica e una più stretta integrazione con i sensori sono gli obiettivi pratici descritti da The Register. Il rapporto non stabilisce che alcuna alternativa abbia ampiamente superato Nvidia nelle implementazioni nel mondo reale.
Il significato pratico è che le prestazioni dell’IA non sono determinate solo dal modello. Il report del Register mostra che i fornitori ottimizzano l’hardware rispettando vincoli particolari: velocità di generazione di token per strumenti interattivi, alimentazione e raffreddamento per rack di data center e latenza per il controllo dei veicoli. Se questi progetti funzionassero su larga scala, le aziende potrebbero scegliere diversi acceleratori per formazione, inferenza ad alto volume, richieste premium a bassa latenza e carichi di lavoro edge. Ciò renderebbe il mercato delle infrastrutture AI più specializzato e potrebbe offrire ai clienti più alternative ai sistemi GPU generici.
La riprogettazione del rack segnalata da Cerebras evidenzia un problema operativo che può essere trascurato nelle dichiarazioni sulle prestazioni dei titoli. Il Register afferma che i sistemi precedenti consumavano circa 15 kilowatt per il chip e raggruppavano l'elaborazione con apparecchiature di erogazione dell'energia in un grande chassis. Un rack modulare potrebbe rendere le riparazioni e gli aggiornamenti meno distruttivi, anche se il silicio rimane insolitamente assetato di energia. Per gli operatori dei data center, la funzionalità, il cablaggio, il raffreddamento e la capacità di sostituire un componente guasto possono avere la stessa importanza del picco di throughput. La fonte non verifica in modo indipendente i dati relativi alla potenza o alle prestazioni riportati, pertanto tali vantaggi rimangono affermazioni che richiedono una revisione tecnica.
Una base di fornitori più ampia potrebbe influenzare il potere contrattuale e le decisioni di investimento. Il Registro suggerisce che le società cloud spesso utilizzano società esterne di proprietà intellettuale per parti meno distintive di chip personalizzati, concentrando al contempo l’ingegneria interna su funzionalità rilevanti per i loro servizi. La concorrenza tra Broadcom e Marvell potrebbe offrire agli hyperscaler un altro percorso di progettazione, ma il silicio personalizzato crea anche obblighi in termini di software e supporto. Un chip efficiente per un carico di lavoro può essere difficile da programmare, difficile da procurarsi o poco adatto a un altro. Il rapporto non offre alcun confronto dei costi con i sistemi Nvidia e nessuna prova che i clienti stiano cambiando su larga scala. L’esempio di Waymo collega l’hardware AI personalizzato a un’implementazione sensibile alla sicurezza piuttosto che solo all’economia del data center: la bassa latenza è importante quando un veicolo risponde all’input del sensore e l’intervento umano remoto non è un sostituto ideale per l’elaborazione immediata a bordo. Ciò non dimostra un miglioramento della sicurezza; non esiste una valutazione indipendente, un confronto del tasso di fallimento o una valutazione normativa. La conclusione più ristretta è che i veicoli autonomi forniscono una ragione per progettare il silicio in base all’elaborazione dei sensori e ai tempi di risposta, mentre l’impatto pubblico dipende dalla convalida in condizioni operative reali.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Cosa guardare dopo
I test chiave sono la documentazione tecnica pubblica, parametri di riferimento indipendenti e prove di utilizzo su larga scala da parte dei clienti. Scopri se il nuovo design dei rack di Cerebras, gli acceleratori personalizzati supportati da Marvell e il silicio per veicoli di Waymo raggiungono la produzione e se i loro vantaggi superano i costi di software, catena di fornitura e manutenzione. Le modifiche di Microsoft a Windows dovrebbero essere giudicate anche in base alla disponibilità pubblica e se migliorano il controllo dell’utente piuttosto che semplicemente aggiungono più monitoraggio del sistema.
Innanzitutto, cerca materiale tecnico primario di Cerebras, Waymo, Google, Marvell o dei loro clienti. Prove utili includerebbero documenti di architettura, misurazioni di potenza, supporto software, stato di produzione e test del carico di lavoro chiaramente definiti. Il rapporto del Register fornisce una mappa degna di nota delle aziende coinvolte, ma non stabilisce la disponibilità, i prezzi, il volume dei clienti o le prestazioni indipendenti. Questi dettagli mancanti determinano se gli sviluppi sono mosse del settore o principalmente piani di ingegneria.
In secondo luogo, confronta il simile con il simile. Le cifre relative ai token al secondo possono variare in base alle dimensioni del modello, al batching, alla precisione, alla lunghezza del contesto e al numero di utenti simultanei. Un acceleratore personalizzato può essere eccellente per un modello di inferenza ristretto e meno utile per carichi di lavoro generali. Guarda i test indipendenti che misurano il throughput, la latenza di risposta, l'energia per token generato, l'utilizzo, l'affidabilità e il costo totale di proprietà rispetto ai sistemi GPU contemporanei. Senza questo contesto, le affermazioni su un’IA più veloce o più economica rimangono difficili da valutare. Terzo, segui le relazioni commerciali: The Register riporta le partnership di Cerebras con AWS e AMD e descrive Marvell come entrata in un campo precedentemente dominato da Broadcom e dai team hyperscaler interni. Un’importante prova successiva sarà se tali relazioni producono servizi generalmente accessibili, implementazioni denominate o ordini ripetuti. L'aspettativa del rapporto secondo cui i servizi AWS o AMD potrebbero utilizzare l'hardware Cerebras è un commento lungimirante, non un'implementazione confermata e non dovrebbe essere trattata come tale.
Infine, monitora separatamente l'implementazione del veicolo Waymo e le modifiche del software Microsoft. Per Waymo, le domande significative sono se l’acceleratore è installato nei veicoli di produzione, come gestisce i carichi di lavoro dei sensori, quali sistemi di fallback esistono e quale convalida di sicurezza è stata completata. Per Windows, The Register afferma che il movimento della barra delle applicazioni avviene nel canale di anteprima di rilascio e che è in fase di sviluppo una visibilità migliorata del processo NPU, ma i tempi pubblici e il comportamento finale possono cambiare. Nessuno dei due thread dovrebbe essere presentato come completo finché le aziende non pubblicheranno una disponibilità stabile e gli utenti indipendenti non potranno valutare i risultati.