HƯỚNG DẪN KỸ THUẬT

Ngăn xếp đào tạo DeepSpeed ​​và Megatron

DeepSpeed (Microsoft) và Megatron-LM (NVIDIA) là các nhóm phần mềm giúp các mô hình đào tạo với hàng tỷ tham số trên hàng nghìn GPU thực sự khả thi.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Lặn sâu

Việc đào tạo một mô hình lớn trên một GPU là không thể vì trọng số, độ dốc và trạng thái tối ưu hóa không phù hợp. Những ngăn xếp này phân chia công việc trên nhiều GPU. Megatron-LM đi tiên phong trong cơ chế song song tensor, chia các phép nhân ma trận riêng lẻ bên trong mỗi lớp trên các GPU, cộng với cơ chế song song đường ống, đặt các lớp khác nhau trên các GPU khác nhau. Đóng góp nổi bật của DeepSpeed ​​là ZeRO (Zero Redundancy Optimizer), giúp phân chia các trạng thái, độ dốc và tham số của trình tối ưu hóa trên các GPU thay vì sao chép chúng, cắt giảm đáng kể bộ nhớ trên mỗi GPU. Cả hai thường được kết hợp (Megatron-DeepSpeed) để đào tạo các mô hình như BLOOM-176B và Megatron-Turing NLG. Họ cũng bổ sung độ chính xác hỗn hợp, điểm kiểm tra kích hoạt và giảm tải cho CPU hoặc NVMe để các mô hình lớn đào tạo trên phần cứng hạn chế.

Hiểu biết kỹ thuật

ZeRO có ba giai đoạn tăng mức tiết kiệm bộ nhớ: Giai đoạn 1 phân chia trạng thái tối ưu hóa, Giai đoạn 2 cũng phân chia độ dốc và Giai đoạn 3 tự phân chia các tham số, thu thập chúng theo yêu cầu trong quá trình chuyển tiếp và lùi. Kết hợp với song song tensor (trong lớp) và song song đường ống (giữa lớp), điều này tạo thành 'song song 3D'. Điểm căng thẳng chính là chi phí liên lạc: mỗi phân chia sẽ bổ sung thêm lưu lượng GPU-GPU, vì vậy các kỹ sư điều chỉnh phân chia để giữ cho các liên kết NVLink và InfiniBand nhanh chóng bão hòa.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của ngăn xếp đào tạo DeepSpeed và Megatron

Mong đợi sự tích hợp chặt chẽ hơn với FSDP gốc (Song song dữ liệu được phân chia hoàn toàn) của PyTorch, tiếp thu nhiều ý tưởng ZeRO, làm mờ ranh giới giữa các ngăn xếp nghiên cứu và khung cốt lõi. Các phương pháp tiếp cận dựa trên trình biên dịch và các công cụ lập kế hoạch song song tự động nhằm mục đích loại bỏ việc điều chỉnh thủ công. Khi các cụm đào tạo phát triển lên tới hàng trăm nghìn máy gia tốc, khả năng chịu lỗi, mở rộng quy mô linh hoạt và giao tiếp chồng chéo với tính toán trở thành những lĩnh vực kỹ thuật thống trị, bên cạnh sự hỗ trợ cho phần cứng mới như NVIDIA Blackwell và chip đào tạo tùy chỉnh.

Triển khai trong thế giới thực

Huấn luyện mô hình BLOOM-176B đa ngôn ngữ mở bằng cách sử dụng ngăn xếp Megatron-DeepSpeed ​​kết hợp trên hàng trăm GPU.

Microsoft và NVIDIA đào tạo mô hình NLG Megatron-Turing 530 tỷ tham số với tính năng song song 3D.

ZeRO-Offload cho phép các nhà nghiên cứu tinh chỉnh mô hình nhiều tỷ thông số trên một GPU máy trạm bằng cách chuyển các trạng thái tối ưu hóa sang RAM CPU.

Sử dụng điểm kiểm tra kích hoạt trong các ngăn xếp này để phù hợp với các cửa sổ ngữ cảnh dài hơn bằng cách tính toán lại các kích hoạt thay vì lưu trữ tất cả.

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Lượng tử hóa sau đào tạo GPTQ và AWQ

Câu hỏi thường gặp

What is DeepSpeed and Megatron Training Stacks?

DeepSpeed (Microsoft) và Megatron-LM (NVIDIA) là các nhóm phần mềm giúp các mô hình đào tạo với hàng tỷ tham số trên hàng nghìn GPU thực sự khả thi. Nếu không có chúng, các mô hình biên giới ngày nay đơn giản là không thể ghi nhớ hoặc hoàn thành quá trình huấn luyện trong thời gian hợp lý.

Mục đích chính của trình tối ưu hóa ZeRO của DeepSpeed ​​là gì?

ZeRO (Trình tối ưu hóa dự phòng bằng không) loại bỏ tình trạng dư thừa bộ nhớ bằng cách phân vùng trạng thái tối ưu hóa, độ dốc và tham số trên các GPU thay vì sao chép chúng trên từng thiết bị.

Sự song song của tenxơ, như được tiên phong trong Megatron-LM, phân chia mô hình như thế nào?

Tính song song của tensor phân chia toán học bên trong một lớp duy nhất (chẳng hạn như phép nhân ma trận lớn) trên nhiều GPU, tức là phân chia trong lớp.

Giai đoạn ZeRO nào giúp tiết kiệm bộ nhớ nhiều nhất bằng cách tự bảo vệ các tham số mô hình?

ZeRO Giai đoạn 3 phân chia các tham số cùng với độ dốc và trạng thái tối ưu hóa, thu thập chúng theo yêu cầu, mang lại mức giảm bộ nhớ lớn nhất.

'Điểm kiểm tra kích hoạt' đánh đổi điều gì để tiết kiệm bộ nhớ trong quá trình luyện tập?

Điểm kiểm tra kích hoạt lưu trữ ít kích hoạt trung gian hơn và tính toán lại chúng trong quá trình truyền ngược, đổi lấy tính toán bổ sung để giảm bộ nhớ.

Tại sao việc kết hợp các kỹ thuật này thường được gọi là 'song song 3D'?

Song song 3D xếp chồng ba chiến lược trực giao: song song dữ liệu, song song tensor (trong lớp) và song song đường ống (giữa các lớp).