Sự song song của chuyên gia trong việc phục vụ MoE
Tính song song của chuyên gia phân chia nhiều 'chuyên gia' chuyển tiếp nguồn cấp dữ liệu của mô hình Hỗn hợp các chuyên gia trên các GPU khác nhau để mỗi thiết bị chỉ giữ một phần tham số.
Tổng quan
It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.
Lặn sâu
Lớp Hỗn hợp các chuyên gia (MoE) thay thế một mạng chuyển tiếp lớn bằng nhiều mạng nhỏ hơn (chuyên gia) cùng với bộ định tuyến chọn các chuyên gia hàng đầu (thường là 1 hoặc 2) cho mỗi mã thông báo. Tính song song của chuyên gia (EP) đặt các chuyên gia khác nhau vào các GPU khác nhau. Khi suy luận, bộ định tuyến quyết định mỗi mã thông báo cần chuyên gia nào, sau đó một bước giao tiếp tổng thể sẽ xáo trộn mã thông báo đến các GPU chứa chuyên gia đã chọn của họ, chạy FFN và xáo trộn kết quả trở lại. Điều này cho phép một mô hình có tổng tham số lớn (thưa thớt) trong khi chỉ kích hoạt một phần nhỏ trên mỗi mã thông báo (FLOP thấp). Các mô hình như Mixtral 8x7B, DeepSeek-V3 và GPT-OSS sử dụng tính năng này. Phần cứng là cân bằng tải giữa các chuyên gia và hai bước nhảy tổng thể tốn kém trên mỗi lớp.
Hiểu biết kỹ thuật
Cơ chế cốt lõi là hai tập thể tổng thể trên mỗi lớp MoE: gửi đi (gửi mã thông báo cho chuyên gia của họ) và kết hợp (thu thập lại kết quả đầu ra). Bởi vì việc định tuyến phụ thuộc vào dữ liệu nên số lượng mã thông báo chạm vào từng chuyên gia sẽ khác nhau, gây ra tình trạng mất cân bằng tải và 'làm chậm'. Các hệ thống cung cấp bổ sung các hệ số công suất, vùng đệm chuyên gia và việc thả hoặc đệm mã thông báo để giữ cho GEMM (nhân ma trận) đồng nhất và thường chồng chéo giao tiếp giữa tất cả với tính toán của chuyên gia để ẩn độ trễ.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của sự song song của chuyên gia đối với việc phục vụ MoE
Mong đợi sự đồng thiết kế chặt chẽ hơn về định tuyến và phần cứng: các hạt nhân kết hợp tính toán-điều phối hợp nhất, các GEMM được nhóm theo nhóm nhiều chuyên gia và nhận biết tất cả các NVLink/InfiniBand. Các kỹ thuật như cân bằng không mất mát phụ trợ và định tuyến giới hạn nút của DeepSeek giúp giảm lưu lượng giữa các nút. Việc phân phát được phân tách sẽ dành riêng các GPU 'chuyên gia' tách biệt với các GPU chú ý và số lượng chuyên gia lớn hơn (hàng trăm) với top-k tốt hơn sẽ đẩy MoE tới mức cực kỳ thưa thớt trong khi vẫn giữ chi phí mỗi mã thông báo không đổi.
Triển khai trong thế giới thực
Phục vụ Mixtral 8x7B trên 2-4 GPU bằng cách bố trí 2-4 trong số 8 chuyên gia của họ trên mỗi thiết bị
DeepSeek-V3 sử dụng định tuyến giới hạn nút để giới hạn số lượng nút mà các chuyên gia của mã thông báo trải rộng, cắt tất cả các nút giữa các nút
Sử dụng chế độ song song chuyên gia vLLM hoặc SGLang để lưu trữ mô hình thưa thớt 200B+ trên một nút 8 GPU
Kết hợp song song chuyên gia với song song tensor trên các lớp chú ý trong quá trình triển khai EP+TP kết hợp
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Expert Parallelism for MoE Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Phân phối trước và giải mã được phân tách
Câu hỏi thường gặp
What is Expert Parallelism for MoE Serving?
Tính song song của chuyên gia phân chia nhiều 'chuyên gia' chuyển tiếp nguồn cấp dữ liệu của mô hình Hỗn hợp các chuyên gia trên các GPU khác nhau để mỗi thiết bị chỉ giữ một phần tham số. Đó là chìa khóa để phục vụ các mô hình MoE nghìn tỷ tham số với giá rẻ, vì chỉ có một số chuyên gia chạy trên mỗi mã thông báo.
Tính song song của chuyên gia phân bổ điều gì trên các GPU?
Tính song song của chuyên gia đặt các chuyên gia khác nhau (mạng con FFN của lớp MoE) trên các GPU khác nhau, do đó mỗi thiết bị chỉ chứa một tập hợp con các chuyên gia.
Mô hình giao tiếp nào là trọng tâm của sự song song của chuyên gia MoE?
Mỗi lớp MoE thường cần một tổng thể để gửi mã thông báo đến các chuyên gia của họ và một tổng thể khác để kết hợp các đầu ra lại.
Tại sao MoE giữ tính toán trên mỗi mã thông báo ở mức thấp mặc dù có tổng thông số rất lớn?
Một bộ định tuyến chỉ kích hoạt các chuyên gia hàng đầu (thường là 1-2) cho mỗi mã thông báo, do đó FLOP vẫn ở mức nhỏ mặc dù mô hình có tổng cộng nhiều chuyên gia.
Vấn đề gì phát sinh do việc định tuyến phụ thuộc vào dữ liệu?
Vì các lựa chọn của bộ định tuyến phụ thuộc vào đầu vào nên một số chuyên gia nhận được nhiều mã thông báo hơn những chuyên gia khác, tạo ra sự mất cân bằng tải và giật lag.
Kỹ thuật phổ biến để giữ cho ma trận chuyên gia nhân với kích thước đồng đều là gì?
Ngăn xếp phân phối đặt công suất cho mỗi chuyên gia (số lượng mã thông báo tối đa) và đệm hoặc thả mã thông báo vượt quá giới hạn đó để GEMM của mỗi chuyên gia có hình dạng có thể dự đoán được.