Chuyện gì đã xảy ra
NVIDIA mô tả một bộ tối ưu hóa JAX và Động cơ biến áp để đào tạo hỗn hợp chuyên gia không bị gián đoạn, bao gồm GEMM được nhóm, các hoạt động kết hợp và điều phối song song chuyên gia hợp nhất, tập thể đa luồng NCCL EP, XLA, lượng tử hóa nhóm MXFP8 và giảm tải kích hoạt máy chủ. Công ty cho biết cơ sở đào tạo DeepSeek-V3 chưa được tối ưu hóa đã đạt 103 TFLOPS trên mỗi GPU, so với 1.068 TFLOPS trên mỗi GPU sau khi tối ưu hóa và thông lượng từ đầu đến cuối được cải thiện khoảng 10 lần. NVIDIA cũng báo cáo hiệu suất mở rộng 97% ở 1.024 GPU. Các thành phần được tối ưu hóa có trong bộ chứa NVIDIA NGC MaxText, kèm theo hướng dẫn kiểm tra và tái tạo cấu hình.
Bài đăng của NVIDIA tập trung vào đào tạo hỗn hợp các chuyên gia không bị gián đoạn, trong đó mọi mã thông báo đều được xử lý bởi chuyên gia đã chọn ngay cả khi việc định tuyến tạo ra tải chuyên gia không đồng đều. Không giống như các phương pháp tiếp cận dựa trên năng lực giúp cắt giảm các chuyên gia tràn hoặc đệm theo kích thước cố định, đào tạo không cần thả yêu cầu hạt nhân và đường dẫn giao tiếp để xử lý số lượng mã thông báo thay đổi. NVIDIA cho biết những hình dạng bất thường này tạo ra các tensor rời rạc và có thể khiến GPU phải chờ gửi đi, giao tiếp giữa tất cả và tính toán chuyên nghiệp.
Những thay đổi được báo cáo hoạt động ở một số lớp. GEMM được nhóm của Transformer Engine xử lý các nhóm chuyên gia có độ dài thay đổi trong một lệnh gọi hạt nhân, đồng thời hợp nhất các hoạt động điều phối và kết hợp cũng như chuyển động địa chỉ phụ trợ NCCL EP của các mã thông báo giữa các GPU. NVIDIA cũng trích dẫn các tập hợp đa luồng XLA, giảm tải kích hoạt máy chủ và lượng tử hóa được nhóm MXFP8 là những yếu tố đóng góp cho kết quả.
Công ty báo cáo rằng cấu hình DeepSeek-V3 671B của họ đã tăng mức cơ bản từ 103 lên 1.068 TFLOPS trên mỗi GPU và tạo ra mức tăng thông lượng từ đầu đến cuối khoảng 10 lần. Nó cũng báo cáo hiệu suất 97% ở 1.024 GPU. Những số liệu này được NVIDIA trình bày dưới dạng quan sát từ ngăn xếp được tối ưu hóa của nó chứ không phải là kết quả được xác minh độc lập.
The implementation is available to try through the NVIDIA NGC MaxText container with Transformer Engine built in. The post specifies ghcr.io/nvidia/jax:maxtext-2026-09-09 or newer and provides configuration guidance for DeepSeek-V3. It cautions that different models require different tuning. Pricing and licensing details are not provided.
Chi tiết nguồn: developer.nvidia.com ↗
Tại sao nó quan trọng
Các mô hình hỗn hợp chuyên gia lớn giúp giảm tính toán bằng cách chỉ kích hoạt các mạng chuyên gia được chọn, nhưng việc định tuyến mã thông báo không đồng đều của chúng tạo ra các tắc nghẽn bộ nhớ và giao tiếp khó khăn. Nếu kết quả của NVIDIA vượt quá cấu hình được báo cáo thì những thay đổi này có thể giúp việc đào tạo các hệ thống MoE rất lớn trở nên hiệu quả hơn mà không cần bỏ mã thông báo định tuyến hoặc đệm mọi chuyên gia vào một công suất cố định. Điều đó chủ yếu quan trọng đối với các tổ chức vận hành cụm GPU NVIDIA lớn, trong đó chi phí liên lạc và tính toán lãng phí có thể ảnh hưởng đáng kể đến thời gian và chi phí đào tạo. Kết quả là tuyên bố của chính NVIDIA; nguồn không cung cấp điểm chuẩn độc lập hoặc so sánh với mọi triển khai thay thế.
MoE training is increasingly important for large AI models because conditional computation can reduce the active computation per token while retaining many parameters. The engineering difficulty shifts toward routing, irregular matrix operations, memory use, and interconnect traffic. Improving those parts could reduce the time and hardware required to train models at production scale.
The practical audience is specialized: researchers and companies already using JAX, MaxText, NVIDIA GPUs, and multi-GPU or multi-node infrastructure. The source does not establish that the same gains apply to smaller systems, non-NVIDIA hardware, dense models, or workloads outside the reported DeepSeek-V3 configuration.
NVIDIA’s figures should be treated as vendor-reported performance claims. The source supplies no independent tests, detailed cost analysis, or full methodology sufficient to determine how much of the improvement comes from each optimization.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Câu hỏi chính là liệu mức tăng được báo cáo có tái hiện trên các kiến trúc MoE, bố cục cụm, kích thước mô hình và thế hệ GPU khác nhau hay không. NVIDIA có kế hoạch bổ sung NVFP4, lượng tử hóa hợp nhất với GEMM và bổ sung tính năng chồng chéo tất cả với tất cả. Người dùng cũng nên xem liệu các tính năng này có trở thành tiêu chuẩn trong quy trình công việc JAX và MaxText hay không và liệu việc tối ưu hóa có yêu cầu điều chỉnh đáng kể theo từng mô hình cụ thể hay không. Nguồn ghi lại đường dẫn truy cập dựa trên vùng chứa nhưng không nêu rõ giá cả, điều khoản cấp phép, cam kết hỗ trợ hoặc tính khả dụng chung ngoài vùng chứa NGC được trích dẫn.
Reproduction across other MoE models and hardware configurations will indicate whether the reported gains are broadly transferable or tightly coupled to DeepSeek-V3 and NVIDIA’s cluster setup.
NVIDIA says future work will add NVFP4, fused with GEMM, and additional all-to-all overlap. Those additions could further affect the performance and memory tradeoffs of the stack.
The source recommends tracking step time, TFLOPS per GPU, model FLOP utilization, grouped GEMM latency, and dispatch/combine latency. Those measurements will help separate compute gains from communication improvements.
The post does not state the container’s price, licensing conditions, support level, or whether all cited components are equally mature for production use.