الدليل الفني

ذاكرة النطاق الترددي العالي

ذاكرة النطاق الترددي العالي (HBM) هي ذاكرة مكدسة موضوعة بجوار وحدة معالجة الرسومات مباشرة والتي توفر البيانات بشكل أسرع بكثير من ذاكرة الوصول العشوائي العادية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is what keeps AI accelerators fed, preventing the powerful compute cores from sitting idle while they wait for model weights and data.

الغوص العميق

تحل HBM عنق الزجاجة الأساسي: يمكن لرقائق الذكاء الاصطناعي الحديثة إجراء تريليونات من العمليات في الثانية، ولكن فقط إذا وصلت البيانات بسرعة كافية. تتصل ذاكرة GDDR القياسية عبر ناقل ضيق نسبيًا، بينما تقوم ذاكرة HBM بتكديس قوالب DRAM المتعددة عموديًا وتوصيلها بآلاف من الأسلاك الرأسية الصغيرة التي تسمى عبر السيليكون (TSVs). تقع هذه الأكوام على وسيط من السيليكون على بعد ملليمترات من وحدة معالجة الرسومات، مما يوفر مسارًا واسعًا للغاية للبيانات، فكر في آلاف البتات في وقت واحد بدلاً من المئات. والنتيجة هي عرض النطاق الترددي المقاس بالتيرابايت في الثانية. لقد تطورت الأجيال من HBM2 إلى HBM2e، وHBM3، وHBM3e، مما أدى إلى زيادة السعة والسرعة. بالنسبة لنماذج اللغات الكبيرة، التي يجب أن يتم دفق أوزانها باستمرار، غالبًا ما تكون سعة HBM وعرض النطاق الترددي أكثر أهمية من الحوسبة الأولية.

البصيرة الفنية

تحقق HBM سرعتها من خلال التوازي الشديد بدلاً من معدلات الساعة الأعلى. ومن خلال تكديس قوالب DRAM وربطها بآلاف من وحدات TSV، فإنه يعرض واجهة واسعة جدًا (1024 بت لكل مكدس وما فوق)، بحيث يتحرك العديد من البايتات في وقت واحد. يؤدي وضع الأكوام على وسيط مشترك بجانب وحدة معالجة الرسومات إلى إبقاء الأسلاك قصيرة، مما يؤدي إلى خفض الطاقة لكل بت وزمن الوصول. يقوم مسرع واحد مثل NVIDIA H100 أو H200 بإقران العديد من مجموعات HBM للوصول إلى عدة تيرابايت في الثانية من إجمالي عرض النطاق الترددي للذاكرة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل الذاكرة ذات النطاق الترددي العالي

يعد النطاق الترددي للذاكرة الآن عائقًا رئيسيًا أمام الذكاء الاصطناعي، لذلك تتقدم HBM بسرعة. يتم شحن HBM3e في مسرعات رائدة، مع وعد HBM4 في الأفق بواجهات أوسع ومكدسات أطول وقدرة أكبر لكل حزمة. توقع تصميمًا مشتركًا أوثق بين الذاكرة والمنطق، وربما قوالب قاعدة مخصصة ومعالجة الذاكرة القريبة، بالإضافة إلى المنافسة الشرسة بين الموردين مثل SK hynix وSamsung وMicron. مع نمو النماذج، يظل تقريب المزيد من البيانات من الحوسبة بشكل أسرع وبطاقة أقل أمرًا أساسيًا لتقدم أجهزة الذكاء الاصطناعي.

التنفيذ في العالم الحقيقي

الاحتفاظ بعشرات أو مئات الجيجابايت من الأوزان لنموذج لغة كبير بالقرب من وحدة معالجة الرسومات حتى يمكن دفقها أثناء كل خطوة استدلال.

تمكين وحدات معالجة الرسومات لمراكز البيانات NVIDIA H100 وH200 من الوصول إلى عدة تيرابايت في الثانية من عرض النطاق الترددي للذاكرة للتدريب.

تشغيل مجموعات تدريب الذكاء الاصطناعي حيث تعتمد العديد من وحدات معالجة الرسومات على HBM لتجنب المماطلة بين عمليات المصفوفة.

دعم نماذج الصور والفيديو التوليدية عالية الدقة التي يجب أن تحرك موترات التنشيط الضخمة داخل وخارج الذاكرة بسرعة.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the High Bandwidth Memory quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

إدارة ذاكرة GPU وتجزئةها

الأسئلة المتداولة

What is High Bandwidth Memory?

ذاكرة النطاق الترددي العالي (HBM) هي ذاكرة مكدسة موضوعة بجوار وحدة معالجة الرسومات مباشرة والتي توفر البيانات بشكل أسرع بكثير من ذاكرة الوصول العشوائي العادية. وهو ما يحافظ على تغذية مسرعات الذكاء الاصطناعي، مما يمنع نوى الحوسبة القوية من البقاء في وضع الخمول أثناء انتظار أوزان النماذج والبيانات.

ما هي المشكلة الأساسية التي تعالجها ذاكرة النطاق الترددي العالي لمسرعات الذكاء الاصطناعي؟

لا يمكن لرقائق الذكاء الاصطناعي إجراء تريليونات من العمليات في الثانية إلا إذا وصلت البيانات بسرعة كافية؛ توفر HBM هذا النطاق الترددي حتى لا يتم تجويع النوى.

كيف يتم بناء HBM فعليًا بشكل مختلف عن ذاكرة GDDR العادية؟

تقوم HBM بتكديس قوالب DRAM فوق بعضها البعض وربطها بآلاف الأسلاك الرأسية (TSVs)، مما يؤدي إلى إنشاء مسار بيانات واسع جدًا.

ما الذي تعتمد عليه HBM بشكل أساسي لتحقيق النطاق الترددي العالي الخاص بها؟

بدلاً من تسجيل الوقت بشكل أسرع، يعرض HBM واجهة واسعة جدًا (1024 بت لكل مكدس وما فوق) بحيث يتحرك العديد من البايتات في وقت واحد.

لماذا يتم وضع مكدسات HBM على وسيط السيليكون بجوار وحدة معالجة الرسومات مباشرةً؟

تعمل الأسلاك القصيرة الموجودة على وسيط مشترك على تقليل الطاقة اللازمة لكل بتة يتم نقلها وتقليل زمن الوصول بين الذاكرة والحوسبة.

بالنسبة لنماذج اللغات الكبيرة على وجه التحديد، لماذا يمكن أن تكون HBM مهمة بقدر أهمية الحوسبة الأولية؟

يقوم استدلال LLM باستمرار بتدفق مصفوفات ذات وزن كبير، لذا غالبًا ما تصبح سعة الذاكرة وعرض النطاق الترددي العامل المحدد بدلاً من حساب الإنتاجية.