發生了什麼事
根據《Register》報道,客製化和替代人工智慧硬體的發展趨勢正在擴大。其帳戶涵蓋了 Cerebras 的模組化 CS-4 機架系統、Marvell 在定制加速器設計中日益增長的作用、Google 對專用 TPU 的持續使用,以及 Waymo 為自動駕駛汽車開發的機器學習加速器。該報告還描述了 Microsoft 恢復了多個 Windows 自訂和 AI 監控功能,但這是一個單獨的輔助線程。
The Register 8 月 24 日的報告重點闡述了其編輯所描述的超越 Nvidia 在人工智慧資料中心主導地位的舉措。供應商越來越多地將工作負載分配給不同類型的晶片,而不是依賴單一加速器類型。它將推理或從經過訓練的模型產生輸出作為主要壓力點:提供者希望編碼助理和其他互動式服務具有高代率,同時控制服務請求的電力和硬體成本。 The Register 的文章是播客文字記錄和分析,因此應將其視為來自該管道的報告,而不是每項技術聲明的獨立驗證文件。
根據 The Register 報導,Cerebras 正從大型整體系統轉向 CS-4 機架規模設計。早期的 Cerebras 系統將大型、耗電的晶圓級晶片放置在獨立的液冷機箱中。新方法將三個晶片放置在模組化機架中,允許更換計算組件而無需更換相關的供電設備。 The Register 表示,該設計將時脈速度、記憶體頻寬和輸入輸出速度提高了一倍,同時在機架中放置的矽數量是原來的三倍。它還表示 Cerebras 與 AWS 和 AMD 建立了合作夥伴關係,快速代幣生成吸引了編碼助理和其他推理服務的興趣。
該報告描述了圍繞超大規模處理器的更廣泛的定制晶片生態系統:Google 自 2015 年左右以來一直在使用自己的張量處理單元,並依賴 Broadcom 進行部分定制加速器設計,而 Marvell 在通過收購建立知識產權組合後,正在成為定制 XPU 和連接工作的競爭對手。該文章將其視為雲端公司比較供應商或減少對單一設計合作夥伴的依賴的一種方式,但沒有記錄具體的新 Google-Marvell 合約;關於未來客戶策略和定價壓力的斷言只是評論,而不是既定的發展。 Waymo 公開了一輛用於車輛的客製化機器學習加速器,因為當障礙物出現時,感測器體積和低延遲很重要。 The Register 表示,Waymo 嚴重依賴現場可程式閘陣列,並可能尋求更高的運算密度和更容易開發專用積體電路,但沒有提供規格、測試結果、生產時間表或安全記錄。另外,Microsoft 正在測試可移動的 Windows 11 工作列、更可自訂的上下文功能表以及工作管理員對神經處理單元工作負載的可見性。
為什麼這很重要
這項轉變可以使人工智慧基礎設施減少對一類 Nvidia GPU 的依賴,並更加重視為特定推理工作負載設計的硬體。 The Register 描述的實際目標是更快的回應時間、更低的營運成本、更好的電源效率以及與感測器更緊密的整合。該報告並未證實任何替代方案在實際部署中已廣泛超越 Nvidia。
現實意義在於,AI性能不僅僅由模型決定。 The Register 的報告顯示,供應商根據特定約束的推理來優化硬體:互動式工具的令牌產生速度、資料中心機架的電源和冷卻以及車輛控制的延遲。如果這些設計能夠大規模發揮作用,公司可以選擇不同的加速器來進行訓練、大容量推理、優質低延遲請求和邊緣工作負載。這將使人工智慧基礎設施市場更加專業化,並為客戶提供通用 GPU 系統以外的更多選擇。
Cerebras 報告的機架重新設計凸顯了一個在標題效能聲明中可能被忽略的操作問題。 The Register 稱,早期系統的晶片功耗約為 15 千瓦,並將計算與大型機箱中的供電設備捆綁在一起。即使矽仍然異常耗電,模組化機架也可以減少維修和升級的破壞性。對於資料中心營運商來說,可維護性、佈線、冷卻以及更換故障組件的能力可能與峰值吞吐量一樣重要。消息來源沒有獨立驗證報告的功率或性能數據,因此這些好處仍然需要技術審查。
更廣泛的供應商基礎可能會影響議價能力和投資決策。 《Register》指出,雲端公司經常使用外部智慧財產權公司來生產客製化晶片中不太有特色的部分,同時將內部工程集中在與其服務相關的功能上。 Broadcom 和 Marvell 之間的競爭可能會給超大規模廠商提供另一種設計路線,但客製化晶片也會產生軟體和支援義務。對於一種工作負載有效的晶片可能難以編程、難以採購或不太適合另一種工作負載。該報告沒有提供與 Nvidia 系統的成本比較,也沒有證據顯示客戶正在大規模轉換。 Waymo 的範例將客製化 AI 硬體連接到安全敏感的部署,而不僅僅是資料中心的經濟性:當車輛回應感測器輸入時,低延遲很重要,而遠端人工幹預並不是即時車載處理的理想替代品。這並不表示安全性有所提高;沒有獨立的評估、故障率比較或監管評估。較窄的結論是,自動駕駛汽車提供了圍繞感測器處理和響應時間設計晶片的理由,而公共影響取決於實際操作條件下的驗證。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
接下來看什麼
關鍵測試是公共技術文件、獨立基準和大規模客戶使用的證據。關注 Cerebras 的新機架設計、Marvell 支援的客製化加速器和 Waymo 的車輛晶片是否能夠投入生產,以及它們的好處是否超過軟體、供應鏈和維護成本。 Microsoft的Windows變更也應該根據公開可用性以及它們是否改善了使用者控製而不是僅僅添加更多系統監控來判斷。
首先,從 Cerebras、Waymo、Google、Marvell 或其客戶那裡尋找主要技術材料。有用的證據包括架構文件、功率測量、軟體支援、生產狀態和明確定義的工作負載測試。 《登記冊》的報告提供了一份具有新聞價值的相關公司地圖,但沒有確定可用性、定價、客戶量或獨立績效。這些缺失的細節決定了這些發展是行業舉措還是主要是工程計劃。
其次,同類比較。每秒令牌數可能會因模型大小、批次、精確度、上下文長度和同時使用者數量而異。自訂加速器可能非常適合一種狹窄的推理模式,但對於一般工作負載則不太有用。專注於針對當代 GPU 系統測量吞吐量、反應延遲、每個生成代幣的能量、利用率、可靠性和總擁有成本的獨立測試。如果沒有這樣的背景,人工智慧更快或更便宜的說法仍然難以評估。第三,遵循商業關係:The Register 報導了 Cerebras 與 AWS 和 AMD 的合作關係,並將 Marvell 描述為進入以前由 Broadcom 和內部超大規模團隊主導的領域。下一個重要的證據將是這些關係是否產生普遍可存取的服務、命名部署或重複訂單。該報告對 AWS 或 AMD 服務可能使用 Cerebras 硬體的預期是前瞻性評論,而不是確認的推出,不應被視為一項。
最後,分別監控Waymo的車輛實施和Microsoft的軟體變更。對於 Waymo 來說,有意義的問題是加速器是否安裝在量產車輛中、它如何處理感測器工作負載、存在哪些後備系統以及已完成哪些安全驗證。 The Register 表示,對於 Windows,工作列移動已在發布預覽通道中,增強的 NPU 進程可見性正在開發中,但公共時間和最終行為可能會發生變化。在公司發布穩定的可用性並且獨立用戶可以評估結果之前,這兩個線程都不應被視為完整。