Paralelisme Tensor untuk Model Besar
Cara untuk membagi perhitungan di dalam satu lapisan jaringan saraf di beberapa GPU sehingga model yang terlalu besar untuk satu perangkat tetap dapat berjalan.
Ikhtisar
It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.
Menyelam Lebih Dalam
Paralelisme tensor (juga disebut paralelisme model intra-lapisan) memecah matriks bobot individual di seluruh GPU, bukan menempatkan seluruh lapisan pada perangkat terpisah. Dalam transformator, perkalian matriks besar—proyeksi perhatian dan MLP feed-forward—dipisahkan: misalnya, matriks bobot pertama MLP dipartisi berdasarkan kolom dan yang kedua berdasarkan baris, sehingga setiap GPU menghitung satu irisan dan satu hasil gabungan semua pengurangan. Perhatian dibagi ke beberapa kepala, dengan masing-masing GPU menangani subset. Karena setiap GPU melakukan bagian dari setiap lapisan secara bersamaan, paralelisme tensor mengurangi memori per GPU dan mempercepat komputasi, namun hal ini memerlukan komunikasi bandwidth tinggi yang sering antara GPU di setiap lapisan. Itu sebabnya biasanya dibatasi dalam node yang terhubung dengan NVLink, dan dikombinasikan dengan pipeline dan paralelisme data untuk tugas pelatihan dan penyajian yang sangat besar.
Wawasan Teknis
Caranya yang dipopulerkan Megatron-LM adalah dengan memilih dimensi partisi agar komunikasi minimal. Memisahkan kolom matriks MLP pertama memungkinkan setiap GPU menerapkan nonlinier secara lokal tanpa sinkronisasi; memisahkan baris kedua berarti output hanya perlu satu pengurangan semua untuk menjumlahkan hasil parsial. Oleh karena itu, setiap lapisan menimbulkan dua pengurangan semua (maju) dan dua (mundur). Karena kolektif ini terjadi di setiap lapisan, latensi mendominasi—sehingga paralelisme tensor berada di balik tautan intra-node yang cepat seperti NVLink dibandingkan jaringan antar-node yang lebih lambat.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Paralelisme Tensor untuk Model Besar
Paralelisme tensor tetap menjadi dasar tetapi semakin tercampur menjadi 'paralelisme 3D' (tensor + pipeline + data) dan dikombinasikan dengan paralelisme pakar untuk model Mixture-of-Experts. Kerangka kerja seperti Megatron-LM, DeepSpeed, dan vLLM mengotomatiskan sharding. Seiring dengan semakin cepatnya interkoneksi GPU (NVLink, NVSwitch) dan jaringan optik, batas batas node menjadi lebih longgar, sehingga memungkinkan kelompok tensor-paralel yang lebih luas. Harapkan paralelisasi otomatis yang lebih cerdas yang memilih dimensi shard dan ukuran grup guna meminimalkan komunikasi untuk topologi cluster tertentu.
Implementasi Dunia Nyata
Melatih model parameter 175B dengan membagi matriks bobot setiap lapisan ke 8 GPU dalam satu node yang terhubung dengan NVLink menggunakan Megatron-LM.
Melayani model obrolan berparameter 70B di vLLM dengan tensor_parallel_size=4 sehingga bobotnya sesuai dengan empat GPU dan merespons secara real time.
Memisahkan perhatian trafo di seluruh GPU sehingga setiap perangkat menghitung subset, lalu menggabungkan output untuk lapisan berikutnya.
Menggabungkan paralelisme tensor dalam node dan paralelisme pipeline di seluruh node untuk melatih model triliunan parameter pada cluster GPU besar.
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Parallelism for Large Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Paralelisme Model dan Saluran Pipa
Pertanyaan yang sering diajukan
What is Tensor Parallelism for Large Models?
Cara untuk membagi perhitungan di dalam satu lapisan jaringan saraf di beberapa GPU sehingga model yang terlalu besar untuk satu perangkat tetap dapat berjalan. Hal ini penting karena model frontier memiliki ratusan miliar parameter yang tidak dapat disimpan atau dihitung oleh satu GPU pun dengan cukup cepat.
Apa yang dibagi oleh paralelisme tensor ke seluruh GPU?
Paralelisme tensor (intra-layer) memecah matriks bobot di dalam sebuah lapisan, sehingga setiap GPU menghitung bagian dari lapisan yang sama—berbeda dari paralelisme pipeline, yang menempatkan seluruh lapisan pada GPU yang berbeda.
Dalam pemisahan MLP gaya Megatron, bagaimana dua matriks bobot dipartisi untuk meminimalkan komunikasi?
Memisahkan matriks pertama berdasarkan kolom memungkinkan setiap GPU menerapkan nonlinier secara lokal; membagi yang kedua dengan baris berarti satu pengurangan semua menjumlahkan sebagian keluaran—meminimalkan sinkronisasi.
Mengapa paralelisme tensor biasanya disimpan dalam satu node?
Setiap lapisan memicu komunikasi kolektif (pengurangan semua), sehingga lalu lintas yang padat dan sensitif terhadap latensi memerlukan tautan intra-node yang cepat seperti NVLink daripada jaringan antar-node yang lebih lambat.
Bagaimana mekanisme perhatian biasanya diparalelkan dalam paralelisme tensor?
Head perhatian bersifat independen, sehingga didistribusikan ke seluruh GPU—setiap perangkat menghitung beberapa head dan outputnya digabungkan.
Operasi kolektif apa yang biasanya menggabungkan hasil parsial dalam paralelisme tensor?
All-reduce menjumlahkan output parsial yang dihitung pada setiap GPU sehingga menyetujui hasil lapisan; ini terjadi beberapa kali per lapisan dalam gerakan maju dan mundur.