Partisi GPU Multi-Instance
Multi-Instance GPU (MIG) adalah teknologi NVIDIA yang membagi satu GPU fisik menjadi beberapa partisi perangkat keras yang terisolasi.
Ikhtisar
It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.
Menyelam Lebih Dalam
Diperkenalkan dengan NVIDIA A100 (Ampere) dan dilanjutkan pada H100 dan GPU pusat data yang lebih baru, MIG membagi GPU menjadi tujuh instance independen. Tidak seperti pengiris waktu perangkat lunak, MIG menyediakan isolasi perangkat keras yang sebenarnya: setiap instance mendapatkan multiprosesor streaming (SM) khusus, irisan cache L2, pengontrol memori, dan sepotong memori bandwidth tinggi yang tetap. A100 dengan 40 GB dapat dipecah menjadi tujuh instans 5 GB, atau lebih sedikit instans yang lebih besar. Setiap partisi berperilaku seperti GPU mandiri yang lebih kecil, sehingga pekerjaan yang berisik atau mogok dalam satu contoh tidak akan membuat yang lain kelaparan atau rusak. Kualitas layanan yang terjamin ini menjadikan MIG ideal untuk layanan inferensi, cluster multi-penyewa, dan lingkungan pengembangan di mana banyak pengguna berbagi satu kartu.
Wawasan Teknis
MIG bekerja dengan melakukan gerbang fisik pada palang internal GPU sehingga setiap instance memiliki jalur tetap ke potongan memori dan SM-nya sendiri. NVIDIA mendefinisikan profil sebagai pecahan seperti 1g.5gb (satu irisan komputasi, 5GB) hingga 7g.40gb. Instans GPU mencadangkan memori dan SM; di dalamnya Instans Komputasi membagi SM lebih lanjut. Karena partisi ini didukung oleh perangkat keras, kesalahan, kesalahan ECC, dan bandwidth memori tetap terbatas pada satu contoh.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Partisi GPU Multi-Instance
Saat GPU tumbuh hingga 80GB, 141GB, dan seterusnya, partisi menjadi lebih menarik karena model individual jarang memerlukan seluruh kartu untuk inferensi. Harapkan Kubernetes yang lebih ketat dan integrasi cloud, partisi ulang dinamis tanpa menguras node, dan profil yang lebih detail. Vendor pesaing sedang mengejar virtualisasi GPU serupa bergaya SR-IOV, dan platform inferensi tanpa server semakin mengandalkan partisi untuk mengemas banyak model secara padat dan mengurangi pemborosan yang tidak ada gunanya.
Implementasi Dunia Nyata
Penyedia cloud membagi satu A100 menjadi tujuh instance sehingga masing-masing tujuh pelanggan mendapatkan potongan GPU yang terjamin dan terisolasi untuk inferensi.
Sebuah cluster penelitian universitas memberi setiap mahasiswa PhD sebuah instance MIG 10GB untuk membuat prototipe alih-alih memonopoli seluruh kartu.
Layanan inferensi mengemas beberapa model bahasa dan visi kecil ke dalam satu H100, masing-masing dalam partisinya sendiri dengan latensi yang dapat diprediksi.
Sebuah klaster Kubernetes mengiklankan instance MIG sebagai sumber daya yang dapat dijadwalkan sehingga pod meminta 'nvidia.com/mig-1g.5gb' seperti sumber daya lainnya.
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Instance GPU Partitioning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pembelajaran Multi-Tugas
Pertanyaan yang sering diajukan
What is Multi-Instance GPU Partitioning?
Multi-Instance GPU (MIG) adalah teknologi NVIDIA yang membagi satu GPU fisik menjadi beberapa partisi perangkat keras yang terisolasi. Hal ini penting karena memungkinkan satu akselerator yang mahal melayani banyak beban kerja kecil sekaligus tanpa mengganggu satu sama lain.
Isolasi seperti apa yang disediakan MIG antar instance?
MIG menerapkan isolasi pada perangkat keras, mendedikasikan SM, irisan cache L2, dan memori untuk setiap instans sehingga beban kerja tidak dapat mengganggu.
Pada arsitektur NVIDIA manakah MIG pertama kali diperkenalkan?
MIG memulai debutnya dengan A100 berbasis Ampere dan dilanjutkan pada H100 dan GPU pusat data yang lebih baru.
Berapa jumlah maksimum instance yang dapat dipecah menjadi GPU berkemampuan MIG?
GPU berkemampuan MIG seperti A100 dapat dipartisi menjadi tujuh instance independen.
Dalam profil MIG seperti '1g.5gb', apa yang dimaksud dengan '5gb'?
Profil ini mengkodekan irisan komputasi (1g) dan memori khusus (5GB) yang diberikan ke instance.
Beban kerja manakah yang paling cocok untuk MIG?
MIG bersinar ketika banyak beban kerja kecil dan terisolasi (seperti inferensi) berbagi satu kartu dengan kualitas layanan yang terjamin.