الدليل الفني

FP8 وتنسيقات منخفضة الدقة

FP8 هو تنسيق أرقام الفاصلة العائمة 8 بت الذي يسمح لنماذج الذكاء الاصطناعي بتخزين الأوزان وإجراء العمليات الحسابية باستخدام ربع ذاكرة الأرقام القياسية 32 بت.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is a key trick for making giant models cheaper and faster to train and serve.

الغوص العميق

تتكون الشبكات العصبية من مليارات الأرقام. تقليديًا، تستخدم هذه الأرقام 32 بت (FP32) أو 16 بت (FP16/BF16) لكل منهما. يقوم FP8 بتقليصها إلى 8 بتات فقط، مما يؤدي إلى خفض الذاكرة وعرض النطاق الترددي إلى النصف تقريبًا مقابل 16 بت. هناك نوعان من تخطيطات FP8 الشائعة: E4M3 (4 بتات أسية، 3 بتات عشرية) تعطي دقة أكبر ولكن نطاق أصغر، وE5M2 (5 أسية، 2 أجزاء عشرية) تعطي نطاقًا أوسع ولكن خطوات أكثر خشونة. والمقايضة هي الإخلاص: عدد البتات الأقل يعني تقريب الأخطاء. للحفاظ على الدقة، تطبق الأطر عوامل قياس لكل موتر أو لكل كتلة تعمل على إعادة قياس القيم إلى النطاق القابل للاستخدام في FP8. أضافت وحدات معالجة الرسوميات Hopper وBlackwell من NVIDIA محركات مصفوفة FP8 للأجهزة، مما يجعلها عملية لكل من التدريب والاستدلال. تعمل التنسيقات الأحدث مثل MXFP8، وMXFP4، وNVFP4 على خفض مستوى الأداء بشكل أكبر من خلال كتل القياس الدقيقة المشتركة.

البصيرة الفنية

التحدي الذي يواجه FP8 هو النطاق الديناميكي. مع عدد قليل فقط من البتات الأسية، تتجاوز عمليات التنشيط الكبيرة أو الصغيرة أو تتدفق إلى الصفر. الحل هو القياس: اضرب الموتر بعامل بحيث تهبط قيمه في نافذة FP8 القابلة للتمثيل، وقم بمضاعفة FP8، ثم اقسمه مرة أخرى، وغالبًا ما تتراكم المبالغ الجزئية بدقة أعلى (FP16/FP32). يُستخدم E4M3 عادةً للأوزان وعمليات التنشيط، ويستخدم E5M2 للتدرجات حيث يكون النطاق أكثر أهمية من الدقة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل FP8 والتنسيقات منخفضة الدقة

الدقة تتسابق نحو الأسفل. بعد FP8، جاءت تنسيقات القياس الدقيقة 4 بت (MXFP4، NVFP4) التي تحتوي على مقياس مشترك صغير لكل كتلة صغيرة، وتقوم أجهزة Blackwell الآن بتسريع FP4 مباشرة. توقع وصفات مختلطة الدقة حيث تستخدم طبقات مختلفة عروض بت مختلفة، بالإضافة إلى تدريب أفضل مدرك للتكميم بحيث يصبح 4 بت هو الإعداد الافتراضي للاستدلال. وتتمثل نهاية اللعبة في الضغط على النماذج ذات النطاق الحدودي على رقائق أقل وأرخص دون خسارة جودة قابلة للقياس.

التنفيذ في العالم الحقيقي

تدريب نماذج اللغات الكبيرة على وحدات معالجة الرسوميات NVIDIA Hopper/Blackwell باستخدام FP8 لمضاعفة الإنتاجية تقريبًا مقابل BF16

تقديم استنتاجات chatbot في FP8 بحيث يتناسب النموذج مع عدد أقل من وحدات معالجة الرسومات ويجيب على المزيد من الطلبات في الثانية

استخدام E5M2 للاتصال المتدرج أثناء التدريب الموزع لخفض عرض النطاق الترددي للشبكة بين العقد

نشر نماذج MXFP4/NVFP4 الكمية لتلائم نموذجًا على نطاق واسع على وحدة معالجة رسومات واحدة عالية الذاكرة للحصول على استدلال أرخص

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تنسيقات التسلسل النموذجي

الأسئلة المتداولة

What is FP8 and Low-Precision Formats?

FP8 هو تنسيق أرقام الفاصلة العائمة 8 بت الذي يسمح لنماذج الذكاء الاصطناعي بتخزين الأوزان وإجراء العمليات الحسابية باستخدام ربع ذاكرة الأرقام القياسية 32 بت. إنها خدعة أساسية لجعل النماذج العملاقة أرخص وأسرع في التدريب والخدمة.

ما عدد البتات التي يستخدمها رقم FP8 مقارنة برقم FP32 القياسي؟

يستخدم FP8 8 بتات بينما يستخدم FP32 32 بت، لذلك يأخذ FP8 ربع مساحة التخزين وعرض النطاق الترددي.

ماذا تصف التسميات "E4M3" و"E5M2" حول تنسيق FP8؟

E4M3 يعني 4 بتات أسية و3 بتات عشرية؛ E5M2 يعني 5 أس و 2 بتات العشرية. المزيد من البتات الأسية تعمل على توسيع النطاق؛ المزيد من البتات العشرية تضيف الدقة.

لماذا تطبق خطوط أنابيب FP8 عوامل القياس على الموترات؟

مع وجود عدد قليل جدًا من البتات الأسية، تتدفق القيم الكبيرة وتتدفق القيم الصغيرة إلى الصفر. يؤدي القياس إلى إعادة قياس الموترات في نافذة FP8 القابلة للاستخدام قبل الرياضيات.

ما هي المقايضة التي تمثل الجانب السلبي الرئيسي لاستخدام FP8؟

البتات الأقل تعني تمثيلًا أكثر خشونة والمزيد من أخطاء التقريب. وتتمثل الفائدة في وجود ذاكرة وعرض نطاق ترددي أقل بكثير، وإجراء عمليات حسابية أسرع على الأجهزة المدعومة.

ما هو جيل NVIDIA GPU الذي أضاف لأول مرة دعمًا مخصصًا للأجهزة لرياضيات مصفوفة FP8؟

قدمت وحدات معالجة الرسومات المستندة إلى Hopper مثل H100 دعم FP8 Tensor Core، ثم قامت Blackwell لاحقًا بتوسيع هذا إلى FP4.