HƯỚNG DẪN KỸ THUẬT

Phân vùng GPU đa phiên bản

GPU đa phiên bản (MIG) là công nghệ của NVIDIA giúp chia một GPU vật lý thành nhiều phân vùng phần cứng riêng biệt.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

Lặn sâu

Được giới thiệu với NVIDIA A100 (Ampere) và tiếp tục có trên H100 cũng như các GPU trung tâm dữ liệu mới hơn, MIG chia GPU thành tối đa bảy phiên bản độc lập. Không giống như cắt thời gian phần mềm, MIG cung cấp khả năng cách ly phần cứng thực sự: mỗi phiên bản có bộ đa xử lý phát trực tuyến (SM) chuyên dụng, lát bộ nhớ đệm L2, bộ điều khiển bộ nhớ và một phần cố định của bộ nhớ băng thông cao. Một chiếc A100 với 40GB có thể được chia thành bảy phiên bản 5GB hoặc ít phiên bản lớn hơn. Mỗi phân vùng hoạt động giống như một GPU độc lập nhỏ hơn, do đó, một tác vụ ồn ào hoặc gặp sự cố trong một phiên bản không thể làm hỏng hoặc làm hỏng phiên bản khác. Chất lượng dịch vụ được đảm bảo này khiến MIG trở nên lý tưởng cho việc cung cấp suy luận, cụm nhiều người thuê và môi trường phát triển nơi nhiều người dùng chia sẻ một thẻ.

Hiểu biết kỹ thuật

MIG hoạt động bằng cách kiểm soát vật lý thanh ngang bên trong của GPU để mỗi phiên bản có đường dẫn cố định đến lát bộ nhớ và SM riêng. NVIDIA định nghĩa cấu hình dưới dạng các phân số như 1g.5gb (một lát điện toán, 5GB) lên đến 7g.40gb. Phiên bản GPU dự trữ bộ nhớ và SM; trong đó, Phiên bản điện toán sẽ chia nhỏ các SM hơn nữa. Vì các phân vùng được thực thi bằng phần cứng nên các lỗi, lỗi ECC và băng thông bộ nhớ chỉ được giới hạn trong một phiên bản duy nhất.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của việc phân vùng GPU đa phiên bản

Khi GPU tăng lên 80GB, 141GB và hơn thế nữa, việc phân vùng trở nên hấp dẫn hơn vì các mô hình riêng lẻ hiếm khi cần cả một thẻ để suy luận. Mong đợi tích hợp đám mây và Kubernetes chặt chẽ hơn, phân vùng lại động mà không làm tiêu hao nút và cấu hình chi tiết hơn. Các nhà cung cấp cạnh tranh đang theo đuổi công nghệ ảo hóa GPU kiểu SR-IOV tương tự và các nền tảng suy luận không có máy chủ ngày càng dựa vào phân vùng để đóng gói nhiều mô hình một cách dày đặc và cắt giảm lãng phí nhàn rỗi.

Triển khai trong thế giới thực

Nhà cung cấp đám mây chia một A100 thành bảy trường hợp để bảy khách hàng, mỗi trường hợp nhận được một lát GPU riêng biệt, được đảm bảo để suy luận.

Một cụm nghiên cứu của trường đại học cung cấp cho mỗi nghiên cứu sinh tiến sĩ một phiên bản MIG 10 GB để tạo nguyên mẫu thay vì độc quyền toàn bộ thẻ.

Dịch vụ suy luận gói một số mô hình ngôn ngữ và hình ảnh nhỏ vào một H100, mỗi mô hình nằm trong phân vùng riêng với độ trễ có thể dự đoán được.

Cụm Kubernetes quảng cáo các phiên bản MIG dưới dạng tài nguyên có thể lập lịch để các nhóm yêu cầu 'nvidia.com/mig-1g.5gb' giống như bất kỳ tài nguyên nào khác.

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Multi-Instance GPU Partitioning?

GPU đa phiên bản (MIG) là công nghệ của NVIDIA giúp chia một GPU vật lý thành nhiều phân vùng phần cứng riêng biệt. Điều này quan trọng vì nó cho phép một máy gia tốc đắt tiền xử lý nhiều khối lượng công việc nhỏ cùng một lúc mà không ảnh hưởng lẫn nhau.

MIG cung cấp loại cách ly nào giữa các phiên bản?

MIG thực thi cách ly trong phần cứng, dành riêng SM, lát bộ đệm L2 và bộ nhớ cho từng phiên bản để khối lượng công việc không thể can thiệp.

MIG được giới thiệu lần đầu tiên trên kiến trúc NVIDIA nào?

MIG ra mắt với A100 dựa trên Ampere và tiếp tục trên H100 và các GPU trung tâm dữ liệu sau này.

GPU hỗ trợ MIG có thể được chia thành bao nhiêu phiên bản tối đa?

GPU hỗ trợ MIG như A100 có thể được phân chia thành tối đa bảy trường hợp độc lập.

Trong cấu hình MIG như '1g.5gb', '5gb' thể hiện điều gì?

Cấu hình mã hóa các lát điện toán (1g) và bộ nhớ chuyên dụng (5GB) được cung cấp cho phiên bản.

MIG đặc biệt phù hợp với khối lượng công việc nào?

MIG tỏa sáng khi nhiều khối lượng công việc nhỏ, biệt lập (như suy luận) dùng chung một thẻ với chất lượng dịch vụ được đảm bảo.