PANDUAN Teknikal

Memori Jalur Lebar Tinggi

Memori Lebar Jalur Tinggi (HBM) ialah memori bertindan yang diletakkan betul-betul di sebelah GPU yang menyampaikan data jauh lebih pantas daripada RAM biasa.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It is what keeps AI accelerators fed, preventing the powerful compute cores from sitting idle while they wait for model weights and data.

Menyelam dalam

HBM menyelesaikan kesesakan asas: cip AI moden boleh melakukan trilion operasi sesaat, tetapi hanya jika data tiba cukup pantas. Memori GDDR standard bersambung melalui bas yang agak sempit, manakala HBM menyusun berbilang DRAM mati secara menegak dan menyambungkannya dengan beribu-ribu wayar menegak kecil yang dipanggil melalui silikon vias (TSV). Tindanan ini terletak pada penyambung silikon milimeter dari GPU, memberikan laluan data yang sangat luas, fikir beribu-ribu bit sekali gus bukannya ratusan. Hasilnya ialah lebar jalur diukur dalam terabait sesaat. Generasi telah maju daripada HBM2 kepada HBM2e, HBM3 dan HBM3e, masing-masing meningkatkan kapasiti dan kelajuan. Untuk model bahasa yang besar, yang beratnya mesti distrim secara berterusan, kapasiti dan lebar jalur HBM selalunya lebih penting daripada pengiraan mentah.

Wawasan Teknikal

HBM mencapai kelajuannya melalui paralelisme melampau dan bukannya kadar jam yang lebih tinggi. Dengan menyusun die DRAM dan memautkannya dengan beribu-ribu TSV, ia mendedahkan antara muka yang sangat luas (1024 bit setiap tindanan dan ke atas), begitu banyak bait bergerak serentak. Meletakkan tindanan pada interposer kongsi di sebelah GPU memastikan wayar pendek, memotong kuasa setiap bit dan kependaman. Pemecut tunggal seperti NVIDIA H100 atau H200 memasangkan beberapa tindanan HBM untuk mencapai berbilang terabait sesaat daripada jumlah lebar jalur memori.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan Memori Jalur Lebar Tinggi

Jalur lebar memori kini menjadi kekangan utama pada AI, jadi HBM sedang berkembang pesat. HBM3e dihantar dalam pemecut perdana, dengan HBM4 di kaki langit menjanjikan antara muka yang lebih luas, tindanan yang lebih tinggi dan lebih banyak kapasiti bagi setiap pakej. Jangkakan reka bentuk bersama yang lebih rapat antara ingatan dan logik, kemungkinan asas mati tersuai dan pemprosesan-hampir-ingatan, serta persaingan sengit antara pembekal seperti SK hynix, Samsung dan Micron. Apabila model berkembang, mendapatkan lebih banyak data lebih dekat untuk dikira, lebih pantas dan pada tenaga yang lebih rendah, kekal sebagai pusat kemajuan perkakasan AI.

Pelaksanaan Dunia Sebenar

Memegang berpuluh-puluh atau ratusan gigabait pemberat untuk model bahasa yang besar dekat dengan GPU supaya ia boleh distrim semasa setiap langkah inferens.

Mendayakan GPU pusat data NVIDIA H100 dan H200 mencapai berbilang terabait sesaat lebar jalur memori untuk latihan.

Menjanakan kluster latihan AI yang mana banyak GPU masing-masing bergantung pada HBM untuk mengelakkan terhenti antara operasi matriks.

Menyokong model imej dan video generatif resolusi tinggi yang mesti memindahkan tensor pengaktifan besar masuk dan keluar dari memori dengan cepat.

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the High Bandwidth Memory quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pengurusan dan Pecahan Memori GPU

Soalan lazim

What is High Bandwidth Memory?

Memori Lebar Jalur Tinggi (HBM) ialah memori bertindan yang diletakkan betul-betul di sebelah GPU yang menyampaikan data jauh lebih pantas daripada RAM biasa. Inilah yang membuatkan pemecut AI sentiasa diberi makan, menghalang teras pengiraan yang berkuasa daripada terbiar sementara mereka menunggu berat dan data model.

Apakah masalah utama yang ditangani oleh Memori Jalur Lebar Tinggi untuk pemecut AI?

Cip AI boleh melakukan trilion operasi sesaat hanya jika data sampai dengan cukup pantas; HBM membekalkan lebar jalur itu supaya teras tidak kebuluran.

Bagaimanakah HBM dibina secara fizikal berbeza daripada memori GDDR biasa?

HBM menyusun DRAM mati di atas satu sama lain dan memautkannya dengan beribu-ribu wayar menegak (TSV), mewujudkan laluan data yang sangat luas.

Apakah yang HBM bergantung terutamanya untuk mencapai lebar jalur yang tinggi?

Daripada mencatat masa lebih cepat, HBM mendedahkan antara muka yang sangat luas (1024 bit setiap tindanan dan ke atas) sehingga banyak bait bergerak serentak.

Mengapakah tindanan HBM diletakkan pada interposer silikon betul-betul di sebelah GPU?

Wayar pendek pada interposer berkongsi mengurangkan tenaga yang diperlukan setiap bit yang dipindahkan dan mengurangkan kependaman antara memori dan pengiraan.

Untuk model bahasa yang besar secara khusus, mengapakah HBM boleh menjadi penting seperti pengiraan mentah?

Inferens LLM secara berterusan menstrimkan matriks berat yang besar, jadi kapasiti memori dan lebar jalur sering menjadi faktor pengehad dan bukannya pengiraan daya pemprosesan.