Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

NVIDIA báo cáo đào tạo MoE không bị gián đoạn nhanh hơn gấp 10 lần trong JAX

NVIDIA cho biết việc tối ưu hóa Công cụ biến áp và JAX của họ đã tăng thông lượng đào tạo DeepSeek-V3 671B lên khoảng 10 lần và đạt hiệu suất 97% trên 1.024 GPU. Đường dẫn được tối ưu hóa được bao gồm trong vùng chứa NVIDIA NGC MaxText ngày 9 tháng 9 năm 2026 hoặc mới hơn.

4 min readRead the primary source
Source-provided image accompanying NVIDIA reports 10x faster dropless MoE training in JAX
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
developer.nvidia.com
Liên kết nguồn
developer.nvidia.comhttps://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Hỗn hợp các chuyên gia (MoE)
Một kiến trúc với các mạng con chuyên biệt, nơi chỉ các chuyên gia được chọn mới chạy trên mỗi đầu vào.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
Lượng tử hóa
Chuyển đổi trọng số mô hình sang các định dạng có độ chính xác thấp hơn như 8 bit hoặc 4 bit.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

NVIDIA mô tả một bộ tối ưu hóa JAX và Động cơ biến áp để đào tạo hỗn hợp chuyên gia không bị gián đoạn, bao gồm GEMM được nhóm, các hoạt động kết hợp và điều phối song song chuyên gia hợp nhất, tập thể đa luồng NCCL EP, XLA, lượng tử hóa nhóm MXFP8 và giảm tải kích hoạt máy chủ. Công ty cho biết cơ sở đào tạo DeepSeek-V3 chưa được tối ưu hóa đã đạt 103 TFLOPS trên mỗi GPU, so với 1.068 TFLOPS trên mỗi GPU sau khi tối ưu hóa và thông lượng từ đầu đến cuối được cải thiện khoảng 10 lần. NVIDIA cũng báo cáo hiệu suất mở rộng 97% ở 1.024 GPU. Các thành phần được tối ưu hóa có trong bộ chứa NVIDIA NGC MaxText, kèm theo hướng dẫn kiểm tra và tái tạo cấu hình.

Bài đăng của NVIDIA tập trung vào đào tạo hỗn hợp các chuyên gia không bị gián đoạn, trong đó mọi mã thông báo đều được xử lý bởi chuyên gia đã chọn ngay cả khi việc định tuyến tạo ra tải chuyên gia không đồng đều. Không giống như các phương pháp tiếp cận dựa trên năng lực giúp cắt giảm các chuyên gia tràn hoặc đệm theo kích thước cố định, đào tạo không cần thả yêu cầu hạt nhân và đường dẫn giao tiếp để xử lý số lượng mã thông báo thay đổi. NVIDIA cho biết những hình dạng bất thường này tạo ra các tensor rời rạc và có thể khiến GPU phải chờ gửi đi, giao tiếp giữa tất cả và tính toán chuyên nghiệp.

Những thay đổi được báo cáo hoạt động ở một số lớp. GEMM được nhóm của Transformer Engine xử lý các nhóm chuyên gia có độ dài thay đổi trong một lệnh gọi hạt nhân, đồng thời hợp nhất các hoạt động điều phối và kết hợp cũng như chuyển động địa chỉ phụ trợ NCCL EP của các mã thông báo giữa các GPU. NVIDIA cũng trích dẫn các tập hợp đa luồng XLA, giảm tải kích hoạt máy chủ và lượng tử hóa được nhóm MXFP8 là những yếu tố đóng góp cho kết quả.

Công ty báo cáo rằng cấu hình DeepSeek-V3 671B của họ đã tăng mức cơ bản từ 103 lên 1.068 TFLOPS trên mỗi GPU và tạo ra mức tăng thông lượng từ đầu đến cuối khoảng 10 lần. Nó cũng báo cáo hiệu suất 97% ở 1.024 GPU. Những số liệu này được NVIDIA trình bày dưới dạng quan sát từ ngăn xếp được tối ưu hóa của nó chứ không phải là kết quả được xác minh độc lập.

The implementation is available to try through the NVIDIA NGC MaxText container with Transformer Engine built in. The post specifies ghcr.io/nvidia/jax:maxtext-2026-09-09 or newer and provides configuration guidance for DeepSeek-V3. It cautions that different models require different tuning. Pricing and licensing details are not provided.

Chi tiết nguồn: developer.nvidia.com ↗

Tại sao nó quan trọng

Các mô hình hỗn hợp chuyên gia lớn giúp giảm tính toán bằng cách chỉ kích hoạt các mạng chuyên gia được chọn, nhưng việc định tuyến mã thông báo không đồng đều của chúng tạo ra các tắc nghẽn bộ nhớ và giao tiếp khó khăn. Nếu kết quả của NVIDIA vượt quá cấu hình được báo cáo thì những thay đổi này có thể giúp việc đào tạo các hệ thống MoE rất lớn trở nên hiệu quả hơn mà không cần bỏ mã thông báo định tuyến hoặc đệm mọi chuyên gia vào một công suất cố định. Điều đó chủ yếu quan trọng đối với các tổ chức vận hành cụm GPU NVIDIA lớn, trong đó chi phí liên lạc và tính toán lãng phí có thể ảnh hưởng đáng kể đến thời gian và chi phí đào tạo. Kết quả là tuyên bố của chính NVIDIA; nguồn không cung cấp điểm chuẩn độc lập hoặc so sánh với mọi triển khai thay thế.

MoE training is increasingly important for large AI models because conditional computation can reduce the active computation per token while retaining many parameters. The engineering difficulty shifts toward routing, irregular matrix operations, memory use, and interconnect traffic. Improving those parts could reduce the time and hardware required to train models at production scale.

The practical audience is specialized: researchers and companies already using JAX, MaxText, NVIDIA GPUs, and multi-GPU or multi-node infrastructure. The source does not establish that the same gains apply to smaller systems, non-NVIDIA hardware, dense models, or workloads outside the reported DeepSeek-V3 configuration.

NVIDIA’s figures should be treated as vendor-reported performance claims. The source supplies no independent tests, detailed cost analysis, or full methodology sufficient to determine how much of the improvement comes from each optimization.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Câu hỏi chính là liệu mức tăng được báo cáo có tái hiện trên các kiến ​​trúc MoE, bố cục cụm, kích thước mô hình và thế hệ GPU khác nhau hay không. NVIDIA có kế hoạch bổ sung NVFP4, lượng tử hóa hợp nhất với GEMM và bổ sung tính năng chồng chéo tất cả với tất cả. Người dùng cũng nên xem liệu các tính năng này có trở thành tiêu chuẩn trong quy trình công việc JAX và MaxText hay không và liệu việc tối ưu hóa có yêu cầu điều chỉnh đáng kể theo từng mô hình cụ thể hay không. Nguồn ghi lại đường dẫn truy cập dựa trên vùng chứa nhưng không nêu rõ giá cả, điều khoản cấp phép, cam kết hỗ trợ hoặc tính khả dụng chung ngoài vùng chứa NGC được trích dẫn.

Reproduction across other MoE models and hardware configurations will indicate whether the reported gains are broadly transferable or tightly coupled to DeepSeek-V3 and NVIDIA’s cluster setup.

NVIDIA says future work will add NVFP4, fused with GEMM, and additional all-to-all overlap. Those additions could further affect the performance and memory tradeoffs of the stack.

The source recommends tracking step time, TFLOPS per GPU, model FLOP utilization, grouped GEMM latency, and dispatch/combine latency. Those measurements will help separate compute gains from communication improvements.

The post does not state the container’s price, licensing conditions, support level, or whether all cited components are equally mature for production use.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIMáy biến ápĐào tạo AITương lai của AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?