الدليل الفني

النوى الموتر

Tensor Cores عبارة عن وحدات أجهزة متخصصة داخل وحدات معالجة الرسومات NVIDIA الحديثة التي تؤدي عمليات مضاعفة وتجميع المصفوفة بسرعة كبيرة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.

الغوص العميق

تم تقديم Tensor Cores مع بنية Volta في عام 2017، وهي عبارة عن دوائر مخصصة تحسب مضاعفة مصفوفة صغيرة بالإضافة إلى إضافة (D = A x B + C) في عملية واحدة، بدلاً من القيام بكل عملية مضاعفة واحدة تلو الأخرى على نوى CUDA القياسية. نظرًا لأن كل طبقة من الشبكة العصبية تقريبًا تقلل من مضاعفات المصفوفة، فإن هذا يتوافق مع الرياضيات التي يحتاجها الذكاء الاصطناعي بالفعل. قام كل جيل من أجيال GPU بتوسيع ما يتعامل معه: قامت Volta بعمل بلاطات 4x4 FP16، بينما أضافت معماريات Ampere وHopper وBlackwell اللاحقة تنسيقات أقل دقة مثل TF32 وBF16 وINT8 وFP8 وFP4. الدقة المنخفضة تعني معالجة المزيد من الأرقام في كل ساعة، مما يزيد بشكل كبير من إنتاجية التدريب والاستدلال مع الحفاظ على الدقة المقبولة.

البصيرة الفنية

يقوم Tensor Core بضرب مصفوفتين صغيرتين وتجميع النتيجة في خطوة واحدة مدمجة، مستغلًا حقيقة إعادة استخدام نفس قيم الإدخال عبر العديد من عناصر الإخراج. يقرأ عادةً المدخلات بدقة منخفضة (FP16 أو BF16 أو FP8) ولكنه يجمع المجموع الجاري بدقة أعلى (غالبًا FP32) للحد من خطأ التقريب. تعمل مكتبات البرامج مثل cuBLAS وcuDNN، وأطر العمل مثل PyTorch، على دمج المصفوفات الكبيرة في هذه الكتل الصغيرة تلقائيًا حتى تحصل النماذج على السرعة دون الحاجة إلى ترميز يدوي.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل النوى الموتر

تستمر نوى Tensor في التحرك نحو دقة أقل من أي وقت مضى: أضاف Hopper FP8 وقدمت Blackwell FP4 4 بت مع إمكانية القياس المُدارة بواسطة الأجهزة، مما أدى إلى مضاعفة الإنتاجية تقريبًا في كل خطوة لأعباء العمل الثقيلة الاستدلال. توقع دعمًا أكثر إحكامًا للتناثر (تخطي الأوزان الصفرية)، وتنسيقات القياس الدقيق التي تربط عوامل القياس بكتل صغيرة من الأرقام، والتكامل الأعمق مع أنظمة الذاكرة حتى تظل النوى مغذية. مع نمو النماذج، يظل محرك المصفوفة، وليس سرعة الساعة الأولية، هو ساحة المعركة المركزية لأداء أجهزة الذكاء الاصطناعي.

التنفيذ في العالم الحقيقي

تدريب نماذج لغوية كبيرة مثل المحولات ذات نمط GPT، حيث يتم تشغيل مليارات عمليات ضرب المصفوفة في كل خطوة على Tensor Cores في BF16 أو FP8.

تشغيل الاستدلال في الوقت الفعلي لروبوتات الدردشة ومولدات الصور، باستخدام تكميم INT8 أو FP8 لخدمة المزيد من المستخدمين لكل وحدة معالجة رسومات.

تسريع NVIDIA DLSS في ألعاب الفيديو، حيث تعمل الشبكة العصبية على ترقية الإطارات ذات الدقة المنخفضة باستخدام Tensor Cores في كل إطار.

تسريع الحوسبة العلمية مثل طي البروتين (AlphaFold) ونماذج الطقس التي تمت إعادة صياغتها كأعباء عمل عصبية ثقيلة المصفوفة.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Cores quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التوازي الموتر للنماذج الكبيرة

الأسئلة المتداولة

What is Tensor Cores?

Tensor Cores عبارة عن وحدات أجهزة متخصصة داخل وحدات معالجة الرسومات NVIDIA الحديثة التي تؤدي عمليات مضاعفة وتجميع المصفوفة بسرعة كبيرة. إنها السبب الرئيسي وراء قدرة وحدة معالجة الرسومات الواحدة على تدريب وتشغيل شبكات عصبية كبيرة بأوامر من حيث الحجم بشكل أسرع مما تسمح به حسابات الأغراض العامة.

ما هي العملية الرياضية الأساسية التي تم تصميم Tensor Cores خصيصًا لتسريعها؟

تؤدي Tensor Cores عملية مضاعفة المصفوفة المدمجة بالإضافة إلى التراكم في خطوة واحدة، وهي بالضبط العملية التي تهيمن على طبقات الشبكة العصبية.

ما هي بنية NVIDIA GPU التي قدمت Tensor Cores لأول مرة؟

ظهرت Tensor Cores لأول مرة مع بنية Volta في عام 2017، بدءًا من عمليات المصفوفة FP16 4x4.

لماذا تستخدم Tensor Cores غالبًا دقة منخفضة مثل FP16 أو FP8؟

إن استخدام عدد أقل من البتات لكل رقم يعني تدفق المزيد من القيم عبر الأجهزة في كل دورة، مما يؤدي إلى زيادة السرعة بشكل كبير مع فقدان صغير للدقة، وعادة ما يكون مقبولاً.

للحفاظ على الدقة، ما هي الدقة التي تستخدمها Tensor Cores عادةً للمجموع الجاري (التراكم)؟

قد تكون المدخلات ذات دقة منخفضة، لكن المركم يعمل عادةً بدقة أعلى مثل FP32 للحد من تراكم أخطاء التقريب.

كيف تستفيد أطر الذكاء الاصطناعي اليومية مثل PyTorch من Tensor Cores؟

تقوم المكتبات الأساسية بتقسيم عمليات المصفوفة الكبيرة إلى مربعات بحجم Tensor-Core تلقائيًا، بحيث تحصل أطر العمل على التسريع دون الحاجة إلى ترميز يدوي.