Paralelisme Model dan Saluran Pipa
Jika suatu model terlalu besar untuk ditampung pada satu GPU, paralelisme model dan pipeline akan membagi model itu sendiri ke seluruh perangkat.
Ikhtisar
This is what makes training giant language models with hundreds of billions of parameters physically possible.
Menyelam Lebih Dalam
Paralelisme model mempartisi satu model ke beberapa GPU sehingga tidak ada satu perangkat pun yang perlu memikul semua beban tersebut. Ada dua rasa utama. Paralelisme tensor (intra-layer) membagi matematika di dalam sebuah lapisan, seperti memotong perkalian matriks besar di seluruh GPU yang masing-masing menghitung bagian dari output. Paralelisme pipeline (antar-lapisan) menetapkan lapisan berurutan yang berbeda ke GPU yang berbeda, sehingga blok lapisan 1 berada di GPU 0, blok 2 di GPU 1, dan seterusnya, dengan aktivasi diteruskan seperti jalur perakitan. Tantangan dalam pipeline naif adalah 'gelembung': ketika GPU 0 bekerja pada batch pertama, GPU hilir tidak digunakan. Pipelining membagi setiap batch menjadi batch mikro sehingga semua tahapan tetap sibuk, sehingga meningkatkan pemanfaatan secara signifikan.
Wawasan Teknis
Paralelisme tensor (seperti pada NVIDIA Megatron-LM) membagi matriks bobot berdasarkan kolom atau baris dan menggunakan pengurangan semua untuk menggabungkan kembali hasil parsial, menjaga komunikasi di dalam node NVLink yang cepat. Paralelisme saluran pipa (GPipe, PipeDream) membagi kumpulan menjadi kumpulan mikro yang mengalir melalui tahapan dalam jadwal yang tidak menentu, sehingga memperkecil waktu 'gelembung' yang menganggur. Keduanya sering kali berlapis bersama, dengan paralelisme tensor dalam satu node dan paralelisme pipeline di seluruh node.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Model dan Paralelisme Saluran Pipa
Kerangka kerja semakin mengotomatiskan masalah sulit dalam memutuskan cara mempartisi model di seluruh perangkat, menggunakan pembuatan profil dan pencarian untuk menyeimbangkan komputasi dan komunikasi. Harapkan integrasi yang lebih erat antara tensor, pipeline, dan paralelisme data (paralelisme 3D), penjadwalan micro-batch yang lebih cerdas untuk hampir menghilangkan gelembung pipeline, dan perangkat keras dengan interkoneksi yang lebih cepat sehingga pemisahan satu lapisan di seluruh chip menjadi lebih murah dan rutin untuk model yang semakin besar.
Implementasi Dunia Nyata
Melatih model bergaya GPT dengan NVIDIA Megatron-LM, yang membagi perhatian setiap lapisan transformator dan matriks feed-forward di seluruh GPU melalui paralelisme tensor.
Menggunakan GPipe untuk menempatkan berbagai lapisan visi raksasa atau model bahasa pada akselerator terpisah sementara batching mikro membuat mereka sibuk.
Mesin pipeline DeepSpeed mempartisi model multi-ratus miliar parameter menjadi beberapa tahap di banyak node.
Menggabungkan paralelisme tensor di dalam satu server 8-GPU dengan paralelisme pipeline yang mencakup beberapa server untuk melatih model yang terlalu besar untuk satu mesin.
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model and Pipeline Parallelism quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Paralelisme Tensor untuk Model Besar
Pertanyaan yang sering diajukan
What is Model and Pipeline Parallelism?
Jika suatu model terlalu besar untuk ditampung pada satu GPU, paralelisme model dan pipeline akan membagi model itu sendiri ke seluruh perangkat. Inilah yang memungkinkan pelatihan model bahasa raksasa dengan ratusan miliar parameter secara fisik.
Masalah mendasar apa yang dipecahkan oleh model dan paralelisme saluran pipa?
Paralelisme model dan pipeline mempartisi model itu sendiri di seluruh perangkat, memungkinkan pelatihan jaringan yang jauh lebih besar daripada yang dapat ditampung oleh GPU mana pun.
Bagaimana cara kerja pemisahan paralelisme tensor (intra-layer)?
Paralelisme tensor membagi komputasi dalam satu lapisan, misalnya memisahkan matriks berbobot besar sehingga setiap GPU menghitung sebagian dari output.
Apa yang dimaksud dengan 'gelembung' dalam paralelisme saluran pipa yang naif?
Di awal langkah pipeline, tahapan hilir belum memiliki masukan dan tidak digunakan, sehingga membuang-buang waktu GPU; celah menganggur ini disebut gelembung.
Bagaimana paralelisme saluran pipa mengurangi gelembung?
Membagi batch menjadi batch mikro memungkinkan beberapa batch mikro menempati tahapan yang berbeda secara bersamaan, membuat semua GPU tetap sibuk dan mengurangi waktu idle.
Mengapa paralelisme tensor biasanya disimpan dalam satu node?
Paralelisme tensor sering berkomunikasi untuk menggabungkan kembali hasil matriks parsial, sehingga ditempatkan di tempat bandwidth interkoneksi tertinggi, di dalam node melalui NVLink.