Chuyện gì đã xảy ra
Register báo cáo một động thái mở rộng hướng tới phần cứng AI tùy chỉnh và thay thế. Tài khoản của nó bao gồm hệ thống giá CS-4 mô-đun của Cerebras, vai trò ngày càng tăng của Marvell trong thiết kế máy gia tốc tùy chỉnh, việc Google tiếp tục sử dụng TPU chuyên dụng và việc Waymo phát triển máy gia tốc học máy cho xe tự hành. Báo cáo cũng mô tả Microsoft khôi phục một số tính năng tùy chỉnh Windows và giám sát AI, nhưng đó là một luồng phụ riêng biệt.
Báo cáo ngày 24 tháng 8 của Register tập trung vào những gì các biên tập viên của nó mô tả là một bước tiến vượt ra ngoài vai trò thống trị của Nvidia trong các trung tâm dữ liệu AI. Các nhà cung cấp đang ngày càng phân chia khối lượng công việc giữa các loại silicon khác nhau thay vì dựa vào một loại máy gia tốc duy nhất. Nó trình bày suy luận hoặc tạo ra kết quả đầu ra từ các mô hình được đào tạo, làm điểm áp lực chính: nhà cung cấp muốn tỷ lệ mã thông báo cao cho trợ lý mã hóa và các dịch vụ tương tác khác trong khi kiểm soát chi phí điện năng và phần cứng của việc cung cấp các yêu cầu. Bài viết của Register là bản ghi và phân tích podcast, vì vậy, bài viết này phải được đọc dưới dạng báo cáo từ cơ quan đó thay vì tài liệu được xác minh độc lập về mọi khiếu nại kỹ thuật.
Register báo cáo rằng Cerebras đang chuyển từ các hệ thống nguyên khối lớn sang thiết kế quy mô giá đỡ CS-4. Các hệ thống Cerebras trước đó đã đặt một con chip quy mô wafer lớn, ngốn điện trong một khung làm mát bằng chất lỏng khép kín. Phương pháp mới đặt ba con chip trong một giá đỡ mô-đun, cho phép thay thế các thành phần điện toán mà không cần thay thế thiết bị cung cấp điện liên quan. Register cho biết thiết kế này tăng gấp đôi tốc độ xung nhịp, băng thông bộ nhớ và tốc độ đầu vào-đầu ra, đồng thời đặt lượng silicon vào giá đỡ nhiều gấp ba lần. Nó cũng cho biết Cerebras có quan hệ đối tác với AWS và AMD, đồng thời việc tạo mã thông báo nhanh chóng đã thu hút sự quan tâm của các trợ lý mã hóa và các dịch vụ suy luận khác.
Báo cáo mô tả một hệ sinh thái silicon tùy chỉnh rộng hơn xung quanh các siêu quy mô: Google đã sử dụng Bộ xử lý Tensor của riêng mình kể từ khoảng năm 2015 và dựa vào Broadcom cho các phần của thiết kế máy gia tốc tùy chỉnh, trong khi Marvell đang trở thành đối thủ cạnh tranh trong XPU tùy chỉnh và công việc kết nối sau khi xây dựng danh mục sở hữu trí tuệ thông qua việc mua lại. Bài viết coi đây là một cách để các công ty đám mây so sánh các nhà cung cấp hoặc giảm sự phụ thuộc vào một đối tác thiết kế duy nhất, nhưng không ghi lại hợp đồng Google- Marvell mới cụ thể; những khẳng định về chiến lược khách hàng trong tương lai và áp lực về giá chỉ là những bình luận chứ không phải những diễn biến đã được xác lập. Waymo đã tiết lộ một bộ tăng tốc học máy tùy chỉnh dành cho ô tô vì âm lượng cảm biến và độ trễ thấp là vấn đề quan trọng khi xuất hiện chướng ngại vật. Cơ quan đăng ký cho biết Waymo đã phụ thuộc rất nhiều vào mảng cổng có thể lập trình tại hiện trường và có thể tìm kiếm mật độ tính toán lớn hơn cũng như phát triển mạch tích hợp dành riêng cho ứng dụng dễ dàng hơn nhưng không cung cấp thông số kỹ thuật, kết quả thử nghiệm, thời gian sản xuất hoặc hồ sơ an toàn. Riêng biệt, Microsoft đang thử nghiệm các thanh tác vụ Windows 11 có thể di chuyển, các menu ngữ cảnh có thể tùy chỉnh nhiều hơn và khả năng hiển thị của Trình quản lý tác vụ đối với khối lượng công việc của đơn vị xử lý thần kinh.
Chi tiết nguồn: theregister.com ↗
Tại sao nó quan trọng
Sự thay đổi này có thể làm cho cơ sở hạ tầng AI ít phụ thuộc hơn vào một loại GPU Nvidia và tập trung hơn vào phần cứng được thiết kế cho khối lượng công việc suy luận cụ thể. Thời gian phản hồi nhanh hơn, chi phí vận hành thấp hơn, hiệu quả sử dụng điện năng tốt hơn và tích hợp chặt chẽ hơn với các cảm biến là những mục tiêu thực tế được The Register mô tả. Báo cáo không xác định rằng bất kỳ giải pháp thay thế nào đã vượt qua Nvidia trong việc triển khai trong thế giới thực.
Ý nghĩa thực tế là hiệu suất AI không chỉ được xác định bởi mô hình. Báo cáo của Cơ quan đăng ký cho thấy các nhà cung cấp đang tối ưu hóa phần cứng theo khả năng suy luận đối với các hạn chế cụ thể: tốc độ tạo mã thông báo cho các công cụ tương tác, cấp nguồn và làm mát cho giá đỡ trung tâm dữ liệu và độ trễ để điều khiển phương tiện. Nếu những thiết kế đó hoạt động trên quy mô lớn, các công ty có thể chọn các công cụ tăng tốc khác nhau cho hoạt động đào tạo, suy luận khối lượng lớn, yêu cầu cao cấp có độ trễ thấp và khối lượng công việc biên. Điều đó sẽ làm cho thị trường cơ sở hạ tầng AI trở nên chuyên biệt hơn và có thể mang đến cho khách hàng nhiều lựa chọn thay thế hơn cho các hệ thống GPU đa năng.
Thiết kế lại giá đỡ được báo cáo của Cerebras nêu bật một vấn đề vận hành có thể bị bỏ qua trong các tuyên bố về hiệu suất tiêu đề. Register cho biết các hệ thống trước đó tiêu thụ khoảng 15 kilowatt cho chip và tính toán đi kèm với thiết bị cung cấp điện trong một khung máy lớn. Giá đỡ mô-đun có thể giúp việc sửa chữa và nâng cấp ít bị gián đoạn hơn, ngay cả khi silicon vẫn ngốn điện một cách bất thường. Đối với các nhà khai thác trung tâm dữ liệu, khả năng bảo trì, hệ thống cáp, khả năng làm mát và khả năng thay thế một thành phần bị lỗi có thể quan trọng ngang với thông lượng cao nhất. Nguồn không xác minh độc lập các số liệu về công suất hoặc hiệu suất được báo cáo, vì vậy những lợi ích đó vẫn là những tuyên bố cần được xem xét kỹ thuật.
Cơ sở nhà cung cấp rộng hơn có thể ảnh hưởng đến khả năng thương lượng và quyết định đầu tư. Register gợi ý rằng các công ty đám mây thường sử dụng các công ty sở hữu trí tuệ bên ngoài cho các bộ phận chip tùy chỉnh ít đặc biệt hơn trong khi tập trung kỹ thuật nội bộ vào các tính năng liên quan đến dịch vụ của họ. Sự cạnh tranh giữa Broadcom và Marvell có thể mang lại cho các nhà sản xuất siêu quy mô một lộ trình thiết kế khác, nhưng silicon tùy chỉnh cũng tạo ra các nghĩa vụ hỗ trợ và phần mềm. Một con chip hiệu quả cho một khối lượng công việc có thể khó lập trình, khó mua hoặc kém phù hợp với khối lượng công việc khác. Báo cáo không đưa ra so sánh chi phí với các hệ thống Nvidia và không có bằng chứng nào cho thấy khách hàng đang chuyển đổi trên quy mô rộng. Ví dụ của Waymo kết nối phần cứng AI tùy chỉnh với việc triển khai nhạy cảm về an toàn thay vì chỉ kinh tế trung tâm dữ liệu: độ trễ thấp quan trọng khi phương tiện phản hồi với đầu vào cảm biến và sự can thiệp từ xa của con người không phải là giải pháp thay thế lý tưởng cho việc xử lý ngay lập tức trên tàu. Điều đó không chứng tỏ sự an toàn được cải thiện; không có đánh giá độc lập, so sánh tỷ lệ thất bại hoặc đánh giá theo quy định. Kết luận hẹp hơn là các phương tiện tự hành đưa ra lý do để thiết kế silicon xoay quanh thời gian phản hồi và xử lý cảm biến, trong khi tác động của công chúng phụ thuộc vào việc xác nhận trong điều kiện vận hành thực tế.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các thử nghiệm chính là tài liệu kỹ thuật công khai, điểm chuẩn độc lập và bằng chứng về việc sử dụng quy mô lớn của khách hàng. Xem liệu thiết kế giá đỡ mới của Cerebras, bộ tăng tốc tùy chỉnh do Marvell hậu thuẫn và silicon cho xe của Waymo có được đưa vào sản xuất hay không và liệu lợi ích của chúng có lớn hơn chi phí phần mềm, chuỗi cung ứng và bảo trì hay không. Những thay đổi trên Windows của Microsoft cũng phải được đánh giá dựa trên tính khả dụng công khai và liệu chúng có cải thiện khả năng kiểm soát của người dùng thay vì chỉ bổ sung thêm tính năng giám sát hệ thống hay không.
Trước tiên, hãy tìm tài liệu kỹ thuật chính từ Cerebras, Waymo, Google, Marvell hoặc khách hàng của họ. Bằng chứng hữu ích sẽ bao gồm các tài liệu về kiến trúc, đo lường công suất, hỗ trợ phần mềm, trạng thái sản xuất và các bài kiểm tra khối lượng công việc được xác định rõ ràng. Báo cáo của Cơ quan Đăng ký cung cấp một bản đồ đáng chú ý về các công ty có liên quan nhưng không xác định tính khả dụng, giá cả, số lượng khách hàng hoặc hiệu suất độc lập. Những chi tiết còn thiếu đó xác định liệu những phát triển này là những bước chuyển trong ngành hay chủ yếu là các kế hoạch kỹ thuật.
Thứ hai, so sánh thích với thích. Số liệu mã thông báo mỗi giây có thể thay đổi tùy theo kích thước mô hình, lô, độ chính xác, độ dài ngữ cảnh và số lượng người dùng đồng thời. Trình tăng tốc tùy chỉnh có thể rất phù hợp cho một mẫu suy luận hẹp và ít hữu ích hơn cho khối lượng công việc chung. Theo dõi các thử nghiệm độc lập đo lường thông lượng, độ trễ phản hồi, năng lượng trên mỗi mã thông báo được tạo, mức sử dụng, độ tin cậy và tổng chi phí sở hữu đối với các hệ thống GPU hiện đại. Nếu không có bối cảnh đó, những tuyên bố về AI nhanh hơn hoặc rẻ hơn vẫn khó đánh giá. Thứ ba, theo dõi các mối quan hệ thương mại: Sổ đăng ký báo cáo mối quan hệ hợp tác của Cerebra với AWS và AMD, đồng thời mô tả Marvell đang tham gia vào một lĩnh vực trước đây do Broadcom và các nhóm siêu quy mô nội bộ thống trị. Bằng chứng quan trọng tiếp theo sẽ là liệu các mối quan hệ đó có tạo ra các dịch vụ có thể truy cập chung, triển khai có tên hay đơn đặt hàng lặp lại hay không. Kỳ vọng của báo cáo rằng các dịch vụ AWS hoặc AMD có thể sử dụng phần cứng Cerebras là bình luận hướng tới tương lai, không phải là một đợt triển khai đã được xác nhận và không nên được coi là một.
Cuối cùng, giám sát việc triển khai phương tiện của Waymo và các thay đổi phần mềm của Microsoft một cách riêng biệt. Đối với Waymo, các câu hỏi quan trọng là liệu máy gia tốc có được lắp đặt trên xe sản xuất hay không, cách nó xử lý khối lượng công việc của cảm biến, hệ thống dự phòng nào tồn tại và xác nhận an toàn nào đã được hoàn thành. Đối với Windows, The Register cho biết chuyển động của thanh tác vụ nằm trong kênh Xem trước bản phát hành và khả năng hiển thị quy trình NPU nâng cao đang được phát triển, nhưng thời gian công khai và hành vi cuối cùng có thể thay đổi. Cả hai chủ đề đều không được trình bày dưới dạng hoàn chỉnh cho đến khi các công ty xuất bản tính khả dụng ổn định và người dùng độc lập có thể đánh giá kết quả.