PANDUAN Teknikal

Tensor Parallelism untuk Model Besar

Satu cara untuk memisahkan matematik dalam lapisan rangkaian saraf tunggal merentas berbilang GPU supaya model yang terlalu besar untuk satu peranti masih boleh dijalankan.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

Menyelam dalam

Keselarian tensor (juga dipanggil selari model intra-lapisan) memecahkan matriks berat individu merentas GPU dan bukannya meletakkan keseluruhan lapisan pada peranti berasingan. Dalam pengubah, pendaraban matriks besar—unjuran perhatian dan MLP suapan ke hadapan—dibahagikan: contohnya, matriks berat pertama MLP dibahagikan mengikut lajur dan yang kedua mengikut baris, jadi setiap GPU mengira sekeping dan satu pengurangan semua menggabungkan hasil. Perhatian dibahagikan kepada semua kepala, dengan setiap GPU mengendalikan subset. Oleh kerana setiap GPU melakukan sebahagian daripada setiap lapisan secara serentak, selari tensor mengurangkan memori per-GPU dan mempercepatkan pengiraan, tetapi ia memerlukan komunikasi lebar jalur tinggi yang kerap antara GPU setiap lapisan. Itulah sebabnya ia biasanya terkurung dalam nod yang disambungkan oleh NVLink, dan digabungkan dengan saluran paip dan selari data untuk latihan yang sangat besar dan pekerjaan penyajian.

Wawasan Teknikal

Caranya, yang dipopularkan oleh Megatron-LM, ialah memilih dimensi partition supaya komunikasi adalah minimum. Memisahkan lajur matriks MLP pertama dari segi lajur membolehkan setiap GPU menggunakan ketaklinearan secara setempat tanpa penyegerakan; membelah baris kedua secara bijak bermakna output hanya memerlukan satu pengurangan semua untuk menjumlahkan hasil separa. Oleh itu, setiap lapisan menimbulkan kira-kira dua pengurangan semua (ke hadapan) dan dua (ke belakang). Oleh kerana kolektif ini berlaku setiap lapisan, kependaman mendominasi—jadi selari tensor hidup di sebalik pautan intra-nod pantas seperti NVLink dan bukannya rangkaian antara nod yang lebih perlahan.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan Tensor Parallelism untuk Model Besar

Keselarian tensor kekal asas tetapi semakin diadun ke dalam 'keselarian 3D' (tensor + saluran paip + data) dan digabungkan dengan keselarian pakar untuk model Campuran Pakar. Rangka kerja seperti Megatron-LM, DeepSpeed ​​dan vLLM mengautomasikan sharding. Apabila GPU saling bersambung (NVLink, NVSwitch) dan fabrik optik menjadi lebih pantas, had sempadan nod mengendur, membolehkan kumpulan selari tensor yang lebih luas. Jangkakan penyejajaran automatik yang lebih pintar yang memilih dimensi serpihan dan saiz kumpulan untuk meminimumkan komunikasi untuk topologi kluster tertentu.

Pelaksanaan Dunia Sebenar

Melatih model parameter 175B dengan memisahkan matriks berat setiap lapisan merentas 8 GPU dalam satu nod yang disambungkan NVLink menggunakan Megatron-LM.

Menyediakan model sembang 70B-parameter dalam vLLM dengan tensor_parallel_size=4 supaya pemberat sesuai dengan empat GPU dan bertindak balas dalam masa nyata.

Membahagikan perhatian transformer merentasi GPU supaya setiap peranti mengira subset, kemudian menggabungkan output untuk lapisan seterusnya.

Menggabungkan selari tensor dalam nod dan selari saluran paip merentas nod untuk melatih model trilion parameter pada kelompok GPU yang besar.

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Model dan Paralelisme Talian Paip

Soalan lazim

What is Tensor Parallelism for Large Models?

Satu cara untuk memisahkan matematik dalam lapisan rangkaian saraf tunggal merentas berbilang GPU supaya model yang terlalu besar untuk satu peranti masih boleh dijalankan. Ini penting kerana model sempadan mempunyai beratus-ratus bilion parameter yang tidak boleh disimpan atau dikira dengan cukup pantas sahaja oleh GPU tunggal.

Apakah selari tensor berpecah merentas GPU?

Keselarian tensor (dalam lapisan) memecahkan matriks berat di dalam lapisan, jadi setiap GPU mengira sebahagian daripada lapisan yang sama—berbeza daripada keselarian saluran paip, yang meletakkan keseluruhan lapisan pada GPU yang berbeza.

Dalam pembahagian MLP gaya Megatron, bagaimanakah dua matriks berat dibahagikan untuk meminimumkan komunikasi?

Membahagikan matriks pertama mengikut lajur membolehkan setiap GPU menggunakan ketaklinearan secara setempat; membelah yang kedua dengan baris bermakna satu pengurangan semua menjumlahkan output separa—meminimumkan penyegerakan.

Mengapakah selari tensor biasanya disimpan dalam satu nod?

Setiap lapisan mencetuskan komunikasi kolektif (semua-mengurangkan), jadi trafik yang berat dan sensitif kependaman memerlukan pautan intra-nod yang pantas seperti NVLink dan bukannya rangkaian antara nod yang lebih perlahan.

Bagaimanakah mekanisme perhatian biasanya disejajarkan di bawah selari tensor?

Kepala perhatian adalah bebas, jadi ia diedarkan ke seluruh GPU—setiap peranti mengira beberapa kepala dan output digabungkan.

Apakah operasi kolektif yang biasanya menggabungkan hasil separa dalam keselarian tensor?

All-reduce menjumlahkan output separa yang dikira pada setiap GPU supaya mereka bersetuju dengan hasil lapisan; ini berlaku beberapa kali setiap lapisan dalam hantaran ke hadapan dan ke belakang.