PANDUAN Teknis

Paralelisme Model dan Saluran Pipa

Jika suatu model terlalu besar untuk ditampung pada satu GPU, paralelisme model dan pipeline akan membagi model itu sendiri ke seluruh perangkat.

2 min readTerakhir diperbarui

Ikhtisar

This is what makes training giant language models with hundreds of billions of parameters physically possible.

Menyelam Lebih Dalam

Paralelisme model mempartisi satu model ke beberapa GPU sehingga tidak ada satu perangkat pun yang perlu memikul semua beban tersebut. Ada dua rasa utama. Paralelisme tensor (intra-layer) membagi matematika di dalam sebuah lapisan, seperti memotong perkalian matriks besar di seluruh GPU yang masing-masing menghitung bagian dari output. Paralelisme pipeline (antar-lapisan) menetapkan lapisan berurutan yang berbeda ke GPU yang berbeda, sehingga blok lapisan 1 berada di GPU 0, blok 2 di GPU 1, dan seterusnya, dengan aktivasi diteruskan seperti jalur perakitan. Tantangan dalam pipeline naif adalah 'gelembung': ketika GPU 0 bekerja pada batch pertama, GPU hilir tidak digunakan. Pipelining membagi setiap batch menjadi batch mikro sehingga semua tahapan tetap sibuk, sehingga meningkatkan pemanfaatan secara signifikan.

Wawasan Teknis

Paralelisme tensor (seperti pada NVIDIA Megatron-LM) membagi matriks bobot berdasarkan kolom atau baris dan menggunakan pengurangan semua untuk menggabungkan kembali hasil parsial, menjaga komunikasi di dalam node NVLink yang cepat. Paralelisme saluran pipa (GPipe, PipeDream) membagi kumpulan menjadi kumpulan mikro yang mengalir melalui tahapan dalam jadwal yang tidak menentu, sehingga memperkecil waktu 'gelembung' yang menganggur. Keduanya sering kali berlapis bersama, dengan paralelisme tensor dalam satu node dan paralelisme pipeline di seluruh node.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Model dan Paralelisme Saluran Pipa

Kerangka kerja semakin mengotomatiskan masalah sulit dalam memutuskan cara mempartisi model di seluruh perangkat, menggunakan pembuatan profil dan pencarian untuk menyeimbangkan komputasi dan komunikasi. Harapkan integrasi yang lebih erat antara tensor, pipeline, dan paralelisme data (paralelisme 3D), penjadwalan micro-batch yang lebih cerdas untuk hampir menghilangkan gelembung pipeline, dan perangkat keras dengan interkoneksi yang lebih cepat sehingga pemisahan satu lapisan di seluruh chip menjadi lebih murah dan rutin untuk model yang semakin besar.

Implementasi Dunia Nyata

Melatih model bergaya GPT dengan NVIDIA Megatron-LM, yang membagi perhatian setiap lapisan transformator dan matriks feed-forward di seluruh GPU melalui paralelisme tensor.

Menggunakan GPipe untuk menempatkan berbagai lapisan visi raksasa atau model bahasa pada akselerator terpisah sementara batching mikro membuat mereka sibuk.

Mesin pipeline DeepSpeed ​​mempartisi model multi-ratus miliar parameter menjadi beberapa tahap di banyak node.

Menggabungkan paralelisme tensor di dalam satu server 8-GPU dengan paralelisme pipeline yang mencakup beberapa server untuk melatih model yang terlalu besar untuk satu mesin.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model and Pipeline Parallelism quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Paralelisme Tensor untuk Model Besar

Pertanyaan yang sering diajukan

What is Model and Pipeline Parallelism?

Jika suatu model terlalu besar untuk ditampung pada satu GPU, paralelisme model dan pipeline akan membagi model itu sendiri ke seluruh perangkat. Inilah yang memungkinkan pelatihan model bahasa raksasa dengan ratusan miliar parameter secara fisik.

Masalah mendasar apa yang dipecahkan oleh model dan paralelisme saluran pipa?

Paralelisme model dan pipeline mempartisi model itu sendiri di seluruh perangkat, memungkinkan pelatihan jaringan yang jauh lebih besar daripada yang dapat ditampung oleh GPU mana pun.

Bagaimana cara kerja pemisahan paralelisme tensor (intra-layer)?

Paralelisme tensor membagi komputasi dalam satu lapisan, misalnya memisahkan matriks berbobot besar sehingga setiap GPU menghitung sebagian dari output.

Apa yang dimaksud dengan 'gelembung' dalam paralelisme saluran pipa yang naif?

Di awal langkah pipeline, tahapan hilir belum memiliki masukan dan tidak digunakan, sehingga membuang-buang waktu GPU; celah menganggur ini disebut gelembung.

Bagaimana paralelisme saluran pipa mengurangi gelembung?

Membagi batch menjadi batch mikro memungkinkan beberapa batch mikro menempati tahapan yang berbeda secara bersamaan, membuat semua GPU tetap sibuk dan mengurangi waktu idle.

Mengapa paralelisme tensor biasanya disimpan dalam satu node?

Paralelisme tensor sering berkomunikasi untuk menggabungkan kembali hasil matriks parsial, sehingga ditempatkan di tempat bandwidth interkoneksi tertinggi, di dalam node melalui NVLink.