FP8 এবং নিম্ন-নির্ভুল বিন্যাস
FP8 হল একটি 8-বিট ফ্লোটিং-পয়েন্ট নম্বর ফর্ম্যাট যা AI মডেলগুলিকে স্ট্যান্ডার্ড 32-বিট নম্বরগুলির মেমরির এক চতুর্থাংশ ব্যবহার করে ওজন সঞ্চয় করতে এবং গণিত চালাতে দেয়।
ওভারভিউ
It is a key trick for making giant models cheaper and faster to train and serve.
গভীর ডুব
নিউরাল নেটওয়ার্কগুলি কোটি কোটি সংখ্যা দিয়ে তৈরি। ঐতিহ্যগতভাবে এই সংখ্যাগুলি 32 বিট (FP32) বা 16 বিট (FP16/BF16) প্রতিটি ব্যবহার করে। FP8 এগুলিকে মাত্র 8 বিটে সঙ্কুচিত করে, মেমরি এবং ব্যান্ডউইথকে প্রায় অর্ধেক বনাম 16-বিট করে। দুটি সাধারণ FP8 লেআউট রয়েছে: E4M3 (4 সূচক বিট, 3 ম্যান্টিসা বিট) আরও নির্ভুলতা দেয় তবে একটি ছোট পরিসর, এবং E5M2 (5 সূচক, 2 ম্যান্টিসা) একটি বিস্তৃত পরিসর দেয় তবে আরও মোটা পদক্ষেপ। ট্রেড-অফ হল বিশ্বস্ততা: কম বিট মানে রাউন্ডিং ত্রুটি। নির্ভুল থাকার জন্য, ফ্রেমওয়ার্কগুলি প্রতি-টেনসর বা প্রতি-ব্লক স্কেলিং ফ্যাক্টরগুলি প্রয়োগ করে যা FP8 এর ব্যবহারযোগ্য পরিসরে মানগুলিকে পুনঃস্কেল করে। NVIDIA-এর Hopper এবং Blackwell GPUs হার্ডওয়্যার FP8 ম্যাট্রিক্স ইঞ্জিন যোগ করেছে, এটি প্রশিক্ষণ এবং অনুমান উভয়ের জন্যই ব্যবহারিক করে তুলেছে। MXFP8, MXFP4, এবং NVFP4-এর মতো নতুন ফর্ম্যাটগুলি শেয়ার করা মাইক্রো-স্কেলিং ব্লকগুলির সাথে আরও নীচের দিকে ঠেলে দেয়।
প্রযুক্তিগত অন্তর্দৃষ্টি
FP8 এর চ্যালেঞ্জ হল ডাইনামিক রেঞ্জ। শুধুমাত্র মুষ্টিমেয় এক্সপোনেন্ট বিটের সাথে, বড় বা ছোট অ্যাক্টিভেশন ওভারফ্লো বা শূন্যে আন্ডারফ্লো হয়। ফিক্স হল স্কেলিং: একটি ফ্যাক্টর দ্বারা একটি টেনসরকে গুণ করুন যাতে এর মানগুলি FP8 এর প্রতিনিধিত্বযোগ্য উইন্ডোতে আসে, FP8 গুণিত-সঞ্চয় করুন, তারপরে ভাগ করুন, প্রায়শই উচ্চতর নির্ভুলতায় আংশিক সমষ্টি জমা হয় (FP16/FP32)। E4M3 সাধারণত ওজন এবং সক্রিয়করণের জন্য ব্যবহৃত হয়, E5M2 গ্রেডিয়েন্টের জন্য যেখানে পরিসীমা নির্ভুলতার চেয়ে বেশি গুরুত্বপূর্ণ।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
FP8 এবং নিম্ন-নির্ভুল ফর্ম্যাটের ভবিষ্যত
নির্ভুলতা নিম্নগামী হয়. FP8-এর পরে 4-বিট মাইক্রো-স্কেলিং ফরম্যাট (MXFP4, NVFP4) এসেছে যা প্রতি ছোট ব্লকে একটি ক্ষুদ্র শেয়ার্ড স্কেল প্যাক করে এবং ব্ল্যাকওয়েল হার্ডওয়্যার এখন সরাসরি FP4 ত্বরান্বিত করে। মিশ্র-নির্ভুল রেসিপিগুলি আশা করুন যেখানে বিভিন্ন স্তর বিভিন্ন বিট-প্রস্থ ব্যবহার করে, এবং আরও ভাল কোয়ান্টাইজেশন-সচেতন প্রশিক্ষণ যাতে অনুমানের জন্য 4-বিট ডিফল্ট হয়ে যায়। এন্ডগেমটি পরিমাপযোগ্য মানের ক্ষতি ছাড়াই ফ্রন্টিয়ার-স্কেল মডেলগুলিকে কম, সস্তা চিপগুলিতে চেপে দিচ্ছে।
বাস্তব-বিশ্ব বাস্তবায়ন
এনভিআইডিএ হপার/ব্ল্যাকওয়েল জিপিইউ-তে বৃহৎ ভাষার মডেলদের প্রশিক্ষণ দেওয়া হচ্ছে FP8 ব্যবহার করে মোটামুটি দ্বিগুণ থ্রুপুট বনাম BF16
FP8 এ চ্যাটবট অনুমান পরিবেশন করা হচ্ছে যাতে একটি মডেল কম GPU-তে ফিট করে এবং প্রতি সেকেন্ডে আরও অনুরোধের উত্তর দেয়
নোডের মধ্যে নেটওয়ার্ক ব্যান্ডউইথ কাটার জন্য বিতরণ করা প্রশিক্ষণের সময় গ্রেডিয়েন্ট যোগাযোগের জন্য E5M2 ব্যবহার করা
সস্তা অনুমানের জন্য একটি একক উচ্চ-মেমরির GPU-তে ফ্রন্টিয়ার-স্কেল মডেল ফিট করার জন্য MXFP4/NVFP4-কোয়ান্টাইজড মডেলগুলি স্থাপন করা হচ্ছে
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
মডেল সিরিয়ালাইজেশন ফরম্যাট
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is FP8 and Low-Precision Formats?
FP8 হল একটি 8-বিট ফ্লোটিং-পয়েন্ট নম্বর ফর্ম্যাট যা AI মডেলগুলিকে স্ট্যান্ডার্ড 32-বিট নম্বরগুলির মেমরির এক চতুর্থাংশ ব্যবহার করে ওজন সঞ্চয় করতে এবং গণিত চালাতে দেয়। দৈত্য মডেলগুলিকে সস্তা এবং দ্রুত প্রশিক্ষণ এবং পরিবেশন করার জন্য এটি একটি মূল কৌশল।
একটি FP8 সংখ্যা একটি আদর্শ FP32 সংখ্যার তুলনায় কত বিট ব্যবহার করে?
FP8 8 বিট ব্যবহার করে যখন FP32 32 বিট ব্যবহার করে, তাই FP8 স্টোরেজ এবং ব্যান্ডউইথের এক চতুর্থাংশ নেয়।
'E4M3' এবং 'E5M2' লেবেলগুলি একটি FP8 বিন্যাস সম্পর্কে কী বর্ণনা করে?
E4M3 মানে 4টি এক্সপোনেন্ট বিট এবং 3টি ম্যান্টিসা বিট; E5M2 মানে 5টি সূচক এবং 2টি ম্যান্টিসা বিট। আরো সূচক বিট পরিসীমা প্রশস্ত করে; আরও ম্যান্টিসা বিট নির্ভুলতা যোগ করে।
কেন FP8 পাইপলাইনগুলি টেনসরগুলিতে স্কেলিং ফ্যাক্টরগুলি প্রয়োগ করে?
খুব কম সূচক বিটের সাথে, বড় মানগুলি ওভারফ্লো হয় এবং ছোটগুলি শূন্যে আন্ডারফ্লো হয়। স্কেলিং গণিতের আগে FP8 এর ব্যবহারযোগ্য উইন্ডোতে টেনসরগুলিকে পুনরায় স্কেল করে।
কোন ট্রেড-অফ FP8 ব্যবহার করার প্রধান খারাপ দিক?
কম বিট মানে মোটা উপস্থাপনা এবং আরও গোলাকার ত্রুটি। সুবিধাটি অনেক কম মেমরি এবং ব্যান্ডউইথ এবং সমর্থিত হার্ডওয়্যারে দ্রুত গণিত।
কোন NVIDIA GPU জেনারেশন প্রথম FP8 ম্যাট্রিক্স ম্যাথের জন্য ডেডিকেটেড হার্ডওয়্যার সমর্থন যোগ করেছে?
H100-এর মতো হপার-ভিত্তিক GPUগুলি FP8 টেনসর কোর সমর্থন চালু করেছে এবং ব্ল্যাকওয়েল পরে এটিকে FP4-তে প্রসারিত করেছে।