প্রযুক্তিগত গাইড

সিপিইউ এবং এনভিএমে অপ্টিমাইজার স্টেট অফলোডিং

একটি মেমরি-সেভিং ট্রিক যা কম জিপিইউ মেমরির পরিবর্তে সিপিইউ র‌্যামে বা এনভিএমই এসএসডি-তে প্রশিক্ষণের ভারী হিসাব সংরক্ষণ (অপ্টিমাইজার স্টেট, গ্রেডিয়েন্ট, কখনও কখনও ওজন) পার্ক করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It lets people train far larger models than their GPU's memory would otherwise allow.

গভীর ডুব

আপনি যখন অ্যাডামের মতো একটি অপ্টিমাইজারের সাহায্যে একটি নিউরাল নেটওয়ার্ককে প্রশিক্ষণ দেন, তখন প্রতিটি প্যারামিটার অতিরিক্ত লাগেজ বহন করে: দুটি চলমান পরিসংখ্যান (বেগ এবং পরিবর্তন), ওজনের একটি সম্পূর্ণ-নির্ভুল কপি এবং এর গ্রেডিয়েন্ট। মিশ্র-নির্ভুল প্রশিক্ষণে এটি প্রতি প্যারামিটারে মোটামুটিভাবে 16 বাইট হতে পারে, যা ওজনের জন্য 2 বাইটকে বামন করে। অফলোড করা সেই লাগেজটিকে GPU থেকে সরিয়ে দেয়। CPU অফলোড স্ট্রীম অপ্টিমাইজারকে PCIe বাসে সাধারণ সিস্টেম র‌্যামে নিয়ে যায়, যখন NVMe অফলোড সেগুলিকে দ্রুত সলিড-স্টেট ডিস্কে ঠেলে দেয়। DeepSpeed-এর ZeRO-Infinity এবং ZeRO-Offload দ্বারা জনপ্রিয়, কৌশলটি ক্ষমতার জন্য কাঁচা গতির ব্যবসা করে, একটি একক GPU বা বিলিয়ন প্যারামিটার সহ ছোট ক্লাস্টার ফাইন-টিউন মডেলকে অনুমতি দেয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল হল গণনার সাথে ডেটা মুভমেন্ট ওভারল্যাপ করা। অপ্টিমাইজার স্টেটগুলি CPU/NVMe-তে বসে; ব্যাকওয়ার্ড পাসের সময়, পার্টিশনগুলি প্রয়োজনের ঠিক আগে PCIe-এ প্রিফেচ করা হয় এবং অপ্টিমাইজার স্টেপ নিজেই প্রায়ই CPU-তে চলে। ZeRO-Offload CPU-তে float32 মাস্টার ওয়েট এবং অ্যাডাম মোমেন্টস রাখে, তাই GPU-তে শুধুমাত্র ফরোয়ার্ড এবং ব্যাকওয়ার্ড ম্যাথ থাকে। NVMe একটি টায়ার্ড ক্যাশে যুক্ত করে যাতে টেরাবাইট-স্কেল স্টেটগুলি ডিস্কে ছড়িয়ে পড়ে যখন গরম পার্টিশনগুলি RAM-তে থাকে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

সিপিইউ এবং NVMe-তে অপ্টিমাইজার স্টেট অফলোডিং এর ভবিষ্যত

যেহেতু মডেলগুলি জিপিইউ মেমরি বাড়াতে থাকে, তাই টায়ার্ড অফলোডিং বহিরাগত না হয়ে মানক হয়ে উঠছে। NVLink-C2C এবং CXL মেমরি পুলগুলির মতো দ্রুত আন্তঃসংযোগগুলির সাথে আরও শক্ত ইন্টিগ্রেশন আশা করুন যা CPU-GPU সীমানাকে ঝাপসা করে, এছাড়াও আরও স্মার্ট শিডিউলার যা পূর্বাভাস দেয় যে কোন রাজ্যগুলি প্রিফেচ করতে হবে৷ গ্রেস হপারের মতো ইউনিফাইড-মেমরি আর্কিটেকচারগুলি PCIe পেনাল্টি কমিয়ে দেয় এবং ফ্রেমওয়ার্কগুলি মাল্টি-টায়ার অফলোডকে প্রায় স্বচ্ছ করার দিকে ঠেলে দিচ্ছে যাতে শৌখিনরা পরিমিত হার্ডওয়্যারে বড় মডেলগুলিকে সুন্দর করতে পারে৷

বাস্তব-বিশ্ব বাস্তবায়ন

অ্যাডাম স্টেটকে CPU RAM-এ ঠেলে দিতে DeepSpeed ​​ZeRO-Offload ব্যবহার করে একটি 24 GB ভোক্তা GPU-তে 13-বিলিয়ন-প্যারামিটার এলএলএম ফাইন-টিউনিং।

একটি ছোট গবেষণা ল্যাব ZeRO-ইনফিনিটির সাথে NVMe ড্রাইভে অপ্টিমাইজার স্টেট স্পিল করে কয়েকটি GPU-তে মাল্টি-বিলিয়ন-প্যারামিটার মডেলকে প্রশিক্ষণ দেয়।

হাগিং ফেস এক্সিলারেট কনফিগারেশন যা CPU অফলোড সক্ষম করে যাতে ব্যবহারকারীরা সম্পূর্ণ ফাইন-টিউনিং কাজ চালাতে পারে যা অন্যথায় মেমরির বাইরের ত্রুটিগুলি ফেলে দেবে।

খরচ-সচেতন স্টার্টআপগুলি সস্তা, নিম্ন-মেমরির ক্লাউড জিপিইউ ভাড়া করে এবং শীর্ষ-স্তরের 80 জিবি কার্ডের জন্য অর্থ প্রদানের পরিবর্তে সংযুক্ত NVMe-এ অফলোড করে।

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optimizer State Offloading to CPU and NVMe quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অ্যাডাম এবং অ্যাডাপটিভ অপ্টিমাইজার

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Optimizer State Offloading to CPU and NVMe?

একটি মেমরি-সেভিং ট্রিক যা কম জিপিইউ মেমরির পরিবর্তে সিপিইউ র‌্যামে বা এনভিএমই এসএসডি-তে প্রশিক্ষণের ভারী হিসাব সংরক্ষণ (অপ্টিমাইজার স্টেট, গ্রেডিয়েন্ট, কখনও কখনও ওজন) পার্ক করে। এটি লোকেদের তাদের GPU এর মেমরির চেয়ে অনেক বড় মডেলের প্রশিক্ষণ দিতে দেয় অন্যথায় অনুমতি দেয়।

CPU বা NVMe-তে অপ্টিমাইজার স্টেট অফলোড করার প্রাথমিক লক্ষ্য কী?

অফলোডিং ভারী অপ্টিমাইজারকে GPU-কে CPU RAM বা NVMe-এ সরিয়ে দেয়, GPU মেমরি মুক্ত করে যাতে বড় মডেলগুলিকে একই হার্ডওয়্যারে প্রশিক্ষণ দেওয়া যায়।

মিশ্র নির্ভুলতায় অ্যাডাম অপ্টিমাইজারের জন্য, কোন ডেটা সাধারণত প্রতি প্যারামিটারে সবচেয়ে বেশি মেমরি খরচ করে?

অ্যাডাম ভরবেগ, ভিন্নতা, এবং একটি পূর্ণ-নির্ভুলতা প্রধান ওজন সঞ্চয় করে, প্রতি প্যারামিটারে মোটামুটি 16 বাইট, যা 2-বাইটের অর্ধ-নির্ভুল ওজনের চেয়ে অনেক বেশি।

কোন ফ্রেমওয়ার্ক বৈশিষ্ট্যটি বড় আকারের অপ্টিমাইজার অফলোডিংকে জনপ্রিয় করেছে?

ডিপস্পিড-এর জিরো-অফলোড এবং জিরো-ইনফিনিটি সিপিইউ এবং এনভিএম-এ অফলোডিং অপ্টিমাইজার স্টেট চালু করেছে এবং জনপ্রিয় করেছে।

CPU বা NVMe তে অফলোড করার প্রধান কর্মক্ষমতা খরচ কি?

GPU-এর বাইরে অবস্থানগুলি সরানো মানে PCIe বা NVMe-তে ডেটা স্থানান্তর করা, যা অন-GPU মেমরির চেয়ে ধীর, তাই কম্পিউটের সাথে ওভারল্যাপ না করা হলে থ্রুপুট কমে যায়।

অফলোডিং সিস্টেমগুলি কীভাবে ট্রান্সফার লেটেন্সির বেশিরভাগ লুকিয়ে রাখে?

GPU এখনও কম্পিউটিং করার সময় সিডিউলাররা PCIe-এ প্রয়োজনীয় পার্টিশনগুলি প্রিফেচ করে, লেটেন্সি মাস্ক করার জন্য কম্পিউটেশনের সাথে ওভারল্যাপ করে।