发生了什么
据《Register》报道,定制和替代人工智能硬件的发展趋势正在扩大。其账户涵盖了 Cerebras 的模块化 CS-4 机架系统、Marvell 在定制加速器设计中日益增长的作用、Google 对专用 TPU 的持续使用,以及 Waymo 为自动驾驶汽车开发的机器学习加速器。该报告还描述了 Microsoft 恢复了多个 Windows 自定义和 AI 监控功能,但这是一个单独的辅助线程。
The Register 8 月 24 日的报告重点阐述了其编辑所描述的超越 Nvidia 在人工智能数据中心主导地位的举措。供应商越来越多地将工作负载分配给不同类型的芯片,而不是依赖单一加速器类型。它将推理或从经过训练的模型生成输出作为主要压力点:提供商希望编码助手和其他交互式服务具有高令牌率,同时控制服务请求的电力和硬件成本。 The Register 的文章是播客文字记录和分析,因此应将其视为来自该渠道的报告,而不是每项技术声明的独立验证文档。
据 The Register 报道,Cerebras 正在从大型整体系统转向 CS-4 机架规模设计。早期的 Cerebras 系统将大型、耗电的晶圆级芯片放置在独立的液冷机箱中。新方法将三个芯片放置在模块化机架中,允许更换计算组件而无需更换相关的供电设备。 The Register 表示,该设计将时钟速度、内存带宽和输入输出速度提高了一倍,同时在机架中放置的硅数量是原来的三倍。它还表示 Cerebras 与 AWS 和 AMD 建立了合作伙伴关系,快速代币生成吸引了编码助手和其他推理服务的兴趣。
该报告描述了围绕超大规模处理器的更广泛的定制芯片生态系统:Google 自 2015 年左右以来一直在使用自己的张量处理单元,并依赖 Broadcom 进行部分定制加速器设计,而 Marvell 在通过收购建立知识产权组合后,正在成为定制 XPU 和连接工作的竞争对手。该文章将其视为云公司比较供应商或减少对单一设计合作伙伴的依赖的一种方式,但没有记录具体的新 Google-Marvell 合同;关于未来客户策略和定价压力的断言只是评论,而不是既定的发展。 Waymo 公开了一款用于车辆的定制机器学习加速器,因为当障碍物出现时,传感器体积和低延迟很重要。 The Register 表示,Waymo 严重依赖现场可编程门阵列,并可能寻求更高的计算密度和更容易开发专用集成电路,但没有提供规格、测试结果、生产时间表或安全记录。另外,Microsoft 正在测试可移动的 Windows 11 任务栏、更可定制的上下文菜单以及任务管理器对神经处理单元工作负载的可见性。
为什么这很重要
这一转变可以使人工智能基础设施减少对一类 Nvidia GPU 的依赖,并更加重视为特定推理工作负载设计的硬件。 The Register 描述的实际目标是更快的响应时间、更低的运营成本、更好的电源效率以及与传感器更紧密的集成。该报告并未证实任何替代方案在实际部署中已广泛超越 Nvidia。
现实意义在于,AI性能不仅仅由模型决定。 The Register 的报告显示,供应商根据特定约束的推理来优化硬件:交互式工具的令牌生成速度、数据中心机架的电源和冷却以及车辆控制的延迟。如果这些设计能够大规模发挥作用,公司可以选择不同的加速器来进行训练、大容量推理、优质低延迟请求和边缘工作负载。这将使人工智能基础设施市场更加专业化,并为客户提供通用 GPU 系统之外的更多选择。
Cerebras 报道的机架重新设计凸显了一个在标题性能声明中可能被忽略的操作问题。 The Register 称,早期系统的芯片功耗约为 15 千瓦,并将计算与大型机箱中的供电设备捆绑在一起。即使硅仍然异常耗电,模块化机架也可以减少维修和升级的破坏性。对于数据中心运营商来说,可维护性、布线、冷却以及更换故障组件的能力可能与峰值吞吐量一样重要。消息来源没有独立验证报告的功率或性能数据,因此这些好处仍然需要技术审查。
更广泛的供应商基础可能会影响议价能力和投资决策。 《Register》指出,云公司经常使用外部知识产权公司来生产定制芯片中不太有特色的部分,同时将内部工程集中在与其服务相关的功能上。 Broadcom 和 Marvell 之间的竞争可能会给超大规模厂商提供另一种设计路线,但定制芯片也会产生软件和支持义务。对于一种工作负载有效的芯片可能难以编程、难以采购或不太适合另一种工作负载。该报告没有提供与 Nvidia 系统的成本比较,也没有证据表明客户正在大规模转换。 Waymo 的示例将定制 AI 硬件连接到安全敏感的部署,而不仅仅是数据中心的经济性:当车辆响应传感器输入时,低延迟很重要,而远程人工干预并不是即时车载处理的理想替代品。这并不表明安全性有所提高;没有独立的评估、故障率比较或监管评估。较窄的结论是,自动驾驶汽车提供了围绕传感器处理和响应时间设计芯片的理由,而公共影响取决于实际操作条件下的验证。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
接下来看什么
关键测试是公共技术文档、独立基准和大规模客户使用的证据。关注 Cerebras 的新机架设计、Marvell 支持的定制加速器和 Waymo 的车辆芯片是否能够投入生产,以及它们的好处是否超过软件、供应链和维护成本。 Microsoft的Windows更改还应该根据公开可用性以及它们是否改进了用户控制而不是仅仅添加更多系统监控来判断。
首先,从 Cerebras、Waymo、Google、Marvell 或其客户那里寻找主要技术材料。有用的证据包括架构文档、功率测量、软件支持、生产状态和明确定义的工作负载测试。 《登记册》的报告提供了一份具有新闻价值的相关公司地图,但没有确定可用性、定价、客户量或独立绩效。这些缺失的细节决定了这些发展是行业举措还是主要是工程计划。
其次,同类比较。每秒令牌数可能会因模型大小、批处理、精度、上下文长度和同时用户数量而异。自定义加速器可能非常适合一种狭窄的推理模式,但对于一般工作负载则不太有用。关注针对当代 GPU 系统测量吞吐量、响应延迟、每个生成令牌的能量、利用率、可靠性和总拥有成本的独立测试。如果没有这样的背景,人工智能更快或更便宜的说法仍然难以评估。第三,遵循商业关系:The Register 报道了 Cerebras 与 AWS 和 AMD 的合作关系,并将 Marvell 描述为进入以前由 Broadcom 和内部超大规模团队主导的领域。下一个重要的证据将是这些关系是否产生普遍可访问的服务、命名部署或重复订单。该报告对 AWS 或 AMD 服务可能使用 Cerebras 硬件的预期是前瞻性评论,而不是确认的推出,不应被视为一项。
最后,分别监控Waymo的车辆实施和Microsoft的软件变更。对于 Waymo 来说,有意义的问题是加速器是否安装在量产车辆中、它如何处理传感器工作负载、存在哪些后备系统以及已完成哪些安全验证。 The Register 表示,对于 Windows,任务栏移动已在发布预览通道中,增强的 NPU 进程可见性正在开发中,但公共时间和最终行为可能会发生变化。在公司发布稳定的可用性并且独立用户可以评估结果之前,这两个线程都不应被视为完整。