Chuyện gì đã xảy ra
Cerebras cho biết CS-4 là hệ thống đầu tiên được xây dựng trên nền tảng quy mô giá đỡ Nexus, kết hợp ba động cơ quy mô wafer trong ba lô điện toán mô-đun với nguồn điện, làm mát và I/O chuyên dụng. Công ty cũng đã xem trước CS-5, mục tiêu cho năm 2027 và CS-6, nhằm kết hợp tính toán quy mô wafer và SRAM với DRAM xếp chồng ba chiều.
Blog ngày 25 tháng 8 của Cerebras cho biết công ty đã trình bày thêm chi tiết về kiến trúc CS-4 tại hội nghị Hot Chips ở Palo Alto sau khi giới thiệu hệ thống này tại Supernova 2026 vào tuần trước. Nguồn mô tả CS-4 là sản phẩm đầu tiên được xây dựng trên Nexus, một nền tảng quy mô giá đỡ có thể tái sử dụng. Nexus đặt ba động cơ quy mô wafer trong ba lô điện toán mô-đun được gắn ở phía sau giá đỡ, với phần phía trước chứa cơ sở hạ tầng nguồn dùng chung. Cerebras cho biết thiết kế mô-đun cho phép các thành phần nguồn, làm mát và I/O được cải tiến một cách độc lập và nhằm hỗ trợ các thế hệ hệ thống trong tương lai.
Công ty cho biết mỗi ba lô máy tính chứa một động cơ quy mô wafer, hệ thống điều hòa nước riêng và I/O chuyên dụng. Thiết kế làm mát bao gồm giám sát lưu lượng và nhiệt độ, điều chỉnh lưu lượng đến các tấm lạnh, van ngắt kết nối nhanh khô và cảm biến rò rỉ và ngưng tụ có thể đặt ba lô ở trạng thái an toàn và cắt điện cho các mô-đun cung cấp của nó. Cerebras cho biết một chiếc ba lô có thể được thay thế mà không làm cạn kiệt cơ sở hạ tầng nước dùng chung hoặc làm ảnh hưởng đến cơ sở hạ tầng mạng của giá đỡ. Đây là những tuyên bố về thiết kế từ nhà cung cấp; nguồn không cung cấp dữ liệu về độ tin cậy của hiện trường, số lượng triển khai hoặc hồ sơ bảo trì.
Cerebras cũng mô tả một thiết kế cung cấp năng lượng đặt các bộ chuyển đổi AC/DC cách tấm wafer khoảng 0,5 mm, so với khoảng 50 mm từ silicon trong các hệ thống GPU thông thường được công ty mô tả. Blog cho biết sự sắp xếp này tránh bảng mạch in ở đường truyền điện cuối cùng và cho phép tăng gần gấp đôi công suất ở cùng mức điện áp với ít tổn thất điện trở bổ sung. Giá đỡ có thể sử dụng tới 30 mô-đun cấp điện làm mát bằng không khí chuyên dụng cho mỗi ba lô, với nhiều cấu hình dự phòng và có tới sáu nguồn cấp điện AC có dây cứng đi vào từ trên xuống.
Về lộ trình, Cerebras cho biết CS-5 được nhắm mục tiêu vào năm 2027 và được thiết kế để tạo ra tới 10.000 mã thông báo đầu ra mỗi giây cho mỗi người dùng trên các mô hình bao gồm Gemma 4 31B và gpt-oss-120b. Đối với các mô hình lớn hơn, bao gồm các ví dụ của nguồn về Kimi và GPT-5.6 Sol, công ty nhắm mục tiêu lên tới 5.000 mã thông báo đầu ra mỗi giây cho mỗi người dùng và 3 triệu mã thông báo mỗi giây trên mỗi megawatt. CS-6 được mô tả là một dự án tích hợp 3D dài hạn sử dụng SRAM quy mô wafer và tính toán cùng với DRAM xếp chồng. Nguồn tin cho biết công việc phát triển ý tưởng đó bắt đầu vào năm 2024 nhưng không đưa ra ngày phát hành.
Tại sao nó quan trọng
Thông báo mô tả một giải pháp thay thế cho các hệ thống nhiều GPU để suy luận AI, đặc biệt là các khối lượng công việc yêu cầu nhiều lệnh gọi mô hình tuần tự hoặc hoạt động ở quy mô lô nhỏ. Nếu Cerebras có thể mang lại các lợi ích về tốc độ, hiệu quả và triển khai đã nêu, thì kiến trúc này có thể ảnh hưởng đến cách thiết kế các hệ thống suy luận AI lớn, mặc dù nguồn không thiết lập độc lập các kết quả đó.
Lập luận kỹ thuật trọng tâm là khả năng suy luận của AI có thể bị giới hạn bởi sự giao tiếp giữa các phần tử máy tính chứ không chỉ bởi khả năng số học. Cerebras cho biết các hệ thống thông thường phân chia công việc trên nhiều GPU được kết nối thông qua các liên kết và bộ chuyển mạch bên ngoài, tạo ra chi phí tuần tự hóa, đồng bộ hóa và điều phối phần mềm. Giải pháp thay thế của nó giúp duy trì liên lạc giữa các lõi trên tấm bán dẫn. Công ty lập luận rằng điều này làm giảm độ trễ, mức tiêu thụ điện năng, chi phí phần cứng và các điểm hỏng hóc tiềm ẩn, đặc biệt ở quy mô lô nhỏ. Những lợi ích đó là những mục tiêu kỹ thuật hợp lý, nhưng blog không cung cấp thử nghiệm độc lập để xác định quy mô của chúng.
Cerebras báo cáo rằng WSE-3T của nó có tổng băng thông vải trên wafer là 53,5 petabyte mỗi giây và so sánh con số đó với 260 terabyte mỗi giây của băng thông NVLink cấp giá mà nó gán cho giá NVIDIA Rubin NVL72. Những so sánh như vậy mô tả các kiến trúc hệ thống khác nhau và không được coi là thước đo hoàn chỉnh về hiệu suất ứng dụng. Nguồn không cung cấp điểm chuẩn phù hợp, quy trình kiểm tra, giá cả, tổng công suất hệ thống, phép đo chất lượng mô hình hoặc kết quả từ những người đánh giá độc lập.
Kiến trúc được đề xuất đặc biệt phù hợp với khối lượng công việc tổng đài vì những hệ thống đó có thể thực hiện nhiều lệnh gọi mô hình tuần tự. Cerebras cho biết việc tạo nhanh hơn ở mỗi bước có thể giảm tổng thời gian hoàn thành nhiệm vụ. Nó cũng lập luận rằng việc duy trì tensor khối lượng lớn và giao tiếp chuyên gia trong một tấm wafer sẽ trở nên có giá trị hơn khi các mô hình phát triển, việc định tuyến hỗn hợp các chuyên gia mở rộng, các cửa sổ ngữ cảnh kéo dài và kích thước lô thu hẹp lại. Tác động thực tế sẽ phụ thuộc vào cách các mô hình được phân vùng, lượng dữ liệu phải di chuyển giữa các hệ thống và liệu các công cụ phần mềm có thể sử dụng phần cứng một cách hiệu quả hay không.
Lộ trình cho thấy Cerebras đang cạnh tranh về thiết kế hệ thống cũng như thông số kỹ thuật của bộ xử lý. Nexus nhằm mục đích giúp công ty nâng cao khả năng tính toán, bộ nhớ, nguồn, làm mát và I/O như một nền tảng phối hợp, trong khi CS-6 nhằm mục đích tăng dung lượng bộ nhớ mà không làm mất vị trí dữ liệu ở quy mô wafer. Nhiều bộ nhớ hơn gần máy tính có thể làm giảm cơ sở hạ tầng cần thiết để chạy các mô hình rất lớn, như Cerebras tuyên bố. Tuy nhiên, nguồn tin không tiết lộ đối tác sản xuất, chi phí hệ thống dự kiến, năng lực sản xuất, cam kết với khách hàng hoặc bằng chứng cho thấy thiết kế 3D được đề xuất đã sẵn sàng để triển khai thương mại.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các câu hỏi chính là liệu hiệu suất CS-4 có duy trì được trên các khối lượng công việc, cấu hình và mô hình độc lập hay không; khi nào CS-5 sẽ có sẵn; và liệu thiết kế bộ nhớ 3D của CS-6 có thể được sản xuất và triển khai ở quy mô đã nêu hay không. Giá cả, tính sẵn có của khách hàng, mức sử dụng năng lượng trong thực tế và các so sánh đã được xác minh với các hệ thống cạnh tranh không được cung cấp.
Điểm xác minh đầu tiên là thử nghiệm hiệu suất độc lập của CS-4. Cerebras cho biết các so sánh của họ có thể dựa vào điểm chuẩn của bên thứ ba hoặc thử nghiệm nội bộ và cảnh báo rằng những cải tiến suy luận quan sát được có thể khác nhau tùy theo khối lượng công việc, cấu hình, ngày tháng và kiểu máy. Người đọc nên tìm kiếm các thử nghiệm có thể lặp lại để báo cáo độ trễ, thông lượng, công suất, mức sử dụng và chi phí trong các điều kiện có thể so sánh thay vì dựa vào một con số mã thông báo mỗi giây.
Chi tiết sẵn có và triển khai vẫn chưa rõ ràng. Blog này giải thích cách cài đặt và bảo trì ba lô điện toán, nhưng không cho biết khi nào hệ thống CS-4 sẽ được mua rộng rãi, số lượng đã được vận chuyển, những thay đổi nào đối với trung tâm dữ liệu là bắt buộc hoặc chi phí của hệ thống là bao nhiêu. Cerebras cũng xác định sự phụ thuộc vào công suất trung tâm dữ liệu, vốn, sắp xếp chiến lược và số lượng khách hàng quan trọng hạn chế là rủi ro kinh doanh trong thông tin hướng tới tương lai của mình.
CS-5 yêu cầu sự xem xét kỹ lưỡng đặc biệt vì các mục tiêu về thời gian và tạo mã thông báo đã nêu vào năm 2027 của nó là những dự đoán chứ không phải là kết quả được báo cáo. Nguồn không nêu rõ thiết kế chip cuối cùng, quy trình sản xuất, giá hệ thống hoặc tính khả dụng đã được xác nhận. Nó cũng không chứng minh rằng các mô hình được trích dẫn sẽ chạy với hiệu suất đã nêu trên các độ dài bối cảnh thực tế, mức độ tương tranh hoặc khối lượng công việc sản xuất.
CS-6 vẫn mang đến sự không chắc chắn lớn hơn. Đề xuất kết hợp SRAM quy mô wafer và tính toán với DRAM xếp chồng 3D có thể giải quyết dung lượng bộ nhớ, nhưng nguồn không cung cấp bản trình diễn, mẫu kỹ thuật, lịch trình sản xuất hoặc dữ liệu nhiệt và năng suất. Tiết lộ riêng của Cerebras cho biết kết quả thực tế có thể khác biệt đáng kể so với các tuyên bố hướng tới tương lai và công ty không có nghĩa vụ chung phải cập nhật chúng. Những hạn chế đó sẽ vẫn là trọng tâm của bất kỳ phạm vi bảo hiểm nào sau này.