Tính song song của tenxơ cho các mô hình lớn
Một cách để phân chia phép toán bên trong một lớp mạng thần kinh duy nhất trên nhiều GPU để một mô hình quá lớn đối với một thiết bị vẫn có thể chạy được.
Tổng quan
Điều này quan trọng vì các mô hình tiên tiến có hàng trăm tỷ tham số mà không một GPU nào có thể xử lý hoặc tính toán đủ nhanh một mình.
Lặn sâu
Tính song song của tensor (còn gọi là song song mô hình trong lớp) phân chia các ma trận trọng số riêng lẻ trên các GPU thay vì đặt toàn bộ lớp trên các thiết bị riêng biệt. Trong máy biến áp, phép nhân ma trận lớn—các phép chiếu chú ý và MLP chuyển tiếp nguồn cấp dữ liệu—được phân chia: ví dụ: ma trận trọng số đầu tiên của MLP được phân chia theo cột và ma trận thứ hai theo hàng, do đó, mỗi GPU tính toán một lát và một lần giảm toàn bộ duy nhất kết hợp các kết quả. Sự chú ý được chia thành nhiều phần, mỗi GPU xử lý một tập hợp con. Bởi vì mọi GPU đều thực hiện đồng thời một phần của mọi lớp, nên tính song song tensor làm giảm bộ nhớ trên mỗi GPU và tăng tốc độ tính toán, nhưng nó đòi hỏi giao tiếp băng thông cao, thường xuyên giữa các GPU mỗi lớp. Đó là lý do tại sao nó thường bị giới hạn trong một nút được kết nối bởi NVLink và được kết hợp với tính song song của đường dẫn và dữ liệu cho các công việc phục vụ và đào tạo rất lớn.
Hiểu biết kỹ thuật
Thủ thuật được Megatron-LM phổ biến là chọn kích thước phân vùng để giảm thiểu khả năng liên lạc. Việc chia cột ma trận MLP đầu tiên theo cột cho phép mỗi GPU áp dụng tính phi tuyến cục bộ mà không cần đồng bộ hóa; chia nhỏ hàng thứ hai có nghĩa là các đầu ra chỉ cần một lần giảm toàn bộ để tính tổng các kết quả từng phần. Do đó, mỗi lớp phát sinh khoảng hai lần giảm toàn bộ (chuyển tiếp) và hai (lùi). Bởi vì các tập thể này xảy ra ở mọi lớp nên độ trễ chiếm ưu thế—do đó tính song song tensor tồn tại đằng sau các liên kết nội bộ nút nhanh như NVLink thay vì các mạng giữa các nút chậm hơn.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của tính song song Tensor cho các mô hình lớn
Sự song song của tensor vẫn là nền tảng nhưng ngày càng được kết hợp thành 'song song 3D' (tensor + đường ống + dữ liệu) và kết hợp với sự song song của chuyên gia cho các mô hình Mixture-of-Experts. Các khung như Megatron-LM, DeepSpeed và vLLM tự động hóa việc bảo vệ. Khi các kết nối GPU (NVLink, NVSwitch) và kết cấu quang học hoạt động nhanh hơn, giới hạn ranh giới nút sẽ giãn ra, cho phép các nhóm song song kéo dài hơn. Mong đợi tính năng tự động song song thông minh hơn giúp chọn kích thước phân đoạn và kích thước nhóm để giảm thiểu giao tiếp cho cấu trúc liên kết cụm nhất định.
Triển khai trong thế giới thực
Huấn luyện mô hình tham số 175B bằng cách phân chia ma trận trọng số của mỗi lớp trên 8 GPU trong một nút được kết nối NVLink bằng Megatron-LM.
Cung cấp mô hình trò chuyện có tham số 70B trong vLLM với tensor_parallel_size=4 để trọng số phù hợp với bốn GPU và phản hồi theo thời gian thực.
Phân chia các đầu chú ý của máy biến áp trên các GPU để mỗi thiết bị tính toán một tập hợp con, sau đó ghép các đầu ra cho lớp tiếp theo.
Kết hợp tính song song tensor trong các nút và tính song song đường dẫn giữa các nút để huấn luyện các mô hình nghìn tỷ tham số trên các cụm GPU lớn.
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Parallelism for Large Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình và đường ống song song
Câu hỏi thường gặp
Tính song song Tensor cho các mô hình lớn là gì?
Một cách để phân chia phép toán bên trong một lớp mạng thần kinh duy nhất trên nhiều GPU để một mô hình quá lớn đối với một thiết bị vẫn có thể chạy được. Điều này quan trọng vì các mô hình tiên tiến có hàng trăm tỷ tham số mà không một GPU nào có thể xử lý hoặc tính toán đủ nhanh một mình.
Tính song song tensor phân chia trên các GPU như thế nào?
Tính song song của tensor (trong lớp) phân chia các ma trận trọng số bên trong một lớp, do đó, mọi GPU đều tính toán một phần của cùng một lớp—khác với tính song song của đường ống, tức là đặt toàn bộ các lớp trên các GPU khác nhau.
Trong phân chia MLP kiểu Megatron, hai ma trận trọng số được phân chia như thế nào để giảm thiểu giao tiếp?
Việc chia ma trận đầu tiên theo các cột cho phép mỗi GPU áp dụng tính phi tuyến cục bộ; chia phần thứ hai theo hàng có nghĩa là tổng giảm toàn bộ các kết quả đầu ra một phần—giảm thiểu đồng bộ hóa.
Tại sao tính song song tensor thường được giữ trong một nút duy nhất?
Mỗi lớp kích hoạt giao tiếp tập thể (giảm toàn bộ), do đó lưu lượng lớn, nhạy cảm với độ trễ đòi hỏi các liên kết nội bộ nút nhanh như NVLink thay vì các mạng giữa các nút chậm hơn.
Cơ chế chú ý thường được song song hóa theo cơ chế song song tensor như thế nào?
Các đầu chú ý là độc lập nên chúng được phân bổ trên các GPU—mỗi thiết bị tính toán một số đầu và các đầu ra được kết hợp lại.
Phép toán tập thể nào thường kết hợp các kết quả từng phần trong sự song song tensor?
Giảm toàn bộ tổng các đầu ra một phần được tính toán trên mỗi GPU để chúng thống nhất với kết quả của lớp; điều này xảy ra nhiều lần trên mỗi lớp trong các lượt tiến và lùi.