চেকপয়েন্ট শার্ডিং এবং পুনরায় শুরুযোগ্য প্রশিক্ষণ
একটি মডেলের ট্রেনিং স্টেটকে টুকরো টুকরো (শার্ডে) সংরক্ষণ করার কৌশল যাতে দৈত্য মডেলগুলিকে মেমরি বা ডিস্কের সীমাবদ্ধতায় দম বন্ধ না করে সংরক্ষণ করা যায় এবং পুনরায় লোড করা যায়, এবং তাই একটি ক্র্যাশ হওয়া দৌড়টি ঠিক যেখান থেকে ছেড়েছিল সেখানে উঠতে পারে।
ওভারভিউ
Essential for any training job that runs for days or weeks across many GPUs.
গভীর ডুব
একটি প্রশিক্ষণ চেকপয়েন্ট হল পুনরায় শুরু করার জন্য প্রয়োজনীয় সবকিছুর একটি স্ন্যাপশট: মডেল ওজন, অপ্টিমাইজার স্টেট, শেখার হারের সময়সূচী, ডেটা লোডারের অবস্থান এবং এলোমেলো সংখ্যা জেনারেটর বীজ। বড় মডেলের জন্য এই স্ন্যাপশট শত শত গিগাবাইট হতে পারে, একটি একক ফাইল বা একটি একক মেশিনের মেমরির জন্য অনেক বড়। চেকপয়েন্ট শার্ডিং অনেক ফাইল এবং অনেক র্যাঙ্ক জুড়ে স্ন্যাপশটকে বিভক্ত করে, তাই প্রতিটি GPU সমান্তরালভাবে শুধুমাত্র নিজস্ব স্লাইস লেখে। পুনঃসূচনাযোগ্য প্রশিক্ষণ তারপর সেই শার্ডগুলিকে পুনরায় লোড করে এবং সঠিকভাবে সম্পূর্ণ অবস্থা পুনরুদ্ধার করে। এটি ছাড়া, 200 ঘন্টায় ক্র্যাশ হওয়া একটি মাল্টি-সপ্তাহের দৌড় স্ক্র্যাচ থেকে পুনরায় চালু করতে হবে। PyTorch Distributed Checkpoint, DeepSpeed এবং Hugging Face Hub-এর শার্ডেড সেফটেনসর ফরম্যাটের মতো ফ্রেমওয়ার্কগুলি এই রুটিন তৈরি করে৷
প্রযুক্তিগত অন্তর্দৃষ্টি
শেয়ারিং কাজ করে কারণ বিতরণ করা প্রশিক্ষণ ইতিমধ্যেই র্যাঙ্ক জুড়ে ওজন এবং অপ্টিমাইজার স্টেটগুলিকে পার্টিশন করে (ডেটা, টেনসর বা জিরো সমান্তরালতার মাধ্যমে)। প্রতিটি র্যাঙ্ক শুধুমাত্র তার পার্টিশনকে সিরিয়ালাইজ করে, প্রায়শই সেফটেনসরের মতো ফরম্যাটে যা অলস, মেমরি-ম্যাপ করা লোডিংয়ের অনুমতি দেয়। একটি সূচী ফাইল শার্ড ফাইলে প্যারামিটার নাম ম্যাপ করে। নির্ধারকভাবে পুনরায় শুরু করার জন্য, সিস্টেমটি আরএনজি স্টেট, অপ্টিমাইজার স্টেপ কাউন্ট এবং সঠিক ডেটালোডার অফসেটও বজায় রাখে, তাই রিরান ব্যাচগুলির একই ক্রম পুনরুত্পাদন করে।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
চেকপয়েন্ট শেয়ারিং এবং পুনরায় শুরুযোগ্য প্রশিক্ষণের ভবিষ্যত
চেকপয়েন্টিং একটি পর্যায়ক্রমিক স্টপ-দ্য-ওয়ার্ল্ড ইভেন্ট থেকে অ্যাসিঙ্ক্রোনাস এবং প্রায় বিনামূল্যে কিছুতে স্থানান্তরিত হচ্ছে। আরও ইন-মেমরি এবং ওভারল্যাপড চেকপয়েন্টিং আশা করুন যা প্রশিক্ষণ চলাকালীন ব্যাকগ্রাউন্ডে শার্ডগুলি লেখে, এছাড়াও ইরেজার-কোডেড এবং প্রতিলিপি করা চেকপয়েন্ট যা হাজার-GPU স্কেলে সাধারণ নোড ব্যর্থতা থেকে বাঁচে। ক্লাউড অবজেক্ট স্টোর এবং দ্রুততর স্থানীয় NVMe টিয়ারগুলি শার্ডগুলি হোস্ট করবে এবং সেফটেনসরের মতো স্ট্যান্ডার্ড ফর্ম্যাটগুলি প্রশিক্ষণ পুনঃসূচনা এবং অনুমান স্থাপন উভয়ের জন্য নিরাপদ, দ্রুত, আংশিক লোডিং উন্নত করতে থাকবে।
বাস্তব-বিশ্ব বাস্তবায়ন
একটি ফ্রন্টিয়ার-মডেল হাজার হাজার জিপিইউ জুড়ে চলে যা প্রতি কয়েকশ ধাপে শার্ডেড চেকপয়েন্টগুলিকে স্বয়ংক্রিয়ভাবে সংরক্ষণ করে তাই একটি ব্যর্থ নোডের জন্য কয়েক মিনিটের খরচ হয়, দিন নয়।
আলিঙ্গন মুখ একাধিক সেফটেনসর শার্ড এবং একটি index.json হিসাবে একটি বড় খোলা মডেল বিতরণ করে যাতে ব্যবহারকারীরা এটিকে টুকরো টুকরো করে ডাউনলোড এবং লোড করতে পারে৷
একজন গবেষক একটি বাধাপ্রাপ্ত ফাইন-টিউন পুনরায় শুরু করছেন যা নির্বিঘ্নে চালিয়ে যাওয়ার জন্য সঠিক অপ্টিমাইজার ভরবেগ, ধাপ গণনা এবং ডেটালোডার অবস্থান পুনরুদ্ধার করে।
সস্তা প্রিমম্পিবল ক্লাউড জিপিইউ-তে স্পট-ইন্সট্যান্স ট্রেনিং, যেখানে ঘন ঘন শার্ড চেকপয়েন্ট চাকরিটিকে উচ্ছেদ করা এবং পুনঃনির্ধারণ করা থেকে বাঁচতে দেয়।
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Checkpoint Sharding and Resumable Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
এআই ট্রেনিং ক্লাস্টারের জন্য স্লার্ম
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Checkpoint Sharding and Resumable Training?
একটি মডেলের ট্রেনিং স্টেটকে টুকরো টুকরো (শার্ডে) সংরক্ষণ করার কৌশল যাতে দৈত্য মডেলগুলিকে মেমরি বা ডিস্কের সীমাবদ্ধতায় দম বন্ধ না করে সংরক্ষণ করা যায় এবং পুনরায় লোড করা যায়, এবং তাই একটি ক্র্যাশ হওয়া দৌড়টি ঠিক যেখান থেকে ছেড়েছিল সেখানে উঠতে পারে। যে কোনো প্রশিক্ষণ কাজের জন্য অপরিহার্য যা অনেক GPU জুড়ে কয়েক দিন বা সপ্তাহ ধরে চলে।
কেন বড়-মডেল চেকপয়েন্টগুলিকে ভাগে ভাগ করা হয়?
বিশাল চেকপয়েন্ট (শত গিগাবাইট) একটি ফাইল হিসাবে অব্যবহার্য; শার্ডিং অনেক র্যাঙ্ককে তাদের স্লাইস সমান্তরালে লিখতে দেয় এবং টুকরো টুকরো লোডিং সক্ষম করে।
মডেল ওজন ছাড়াও, একটি পুনরায় শুরুযোগ্য চেকপয়েন্ট সাধারণত কি সংরক্ষণ করা আবশ্যক?
ঠিকভাবে পুনরায় শুরু করার জন্য, চেকপয়েন্ট অপ্টিমাইজার স্টেট, র্যান্ডম-নম্বর-জেনারেটর স্টেট, স্টেপ কাউন্ট এবং ডাটা লোডার কোথায় রেখে গেছে তা সংরক্ষণ করে।
দীর্ঘ চাকরির জন্য পুনরায় শুরুযোগ্য প্রশিক্ষণের প্রধান সুবিধা কী?
পুনঃসূচনাযোগ্য চেকপয়েন্টগুলির সাথে, একটি বিঘ্নিত দৌড় তার শেষ সংরক্ষিত অবস্থা পুনরায় লোড করে এবং গণনার দিনগুলি ফেলে দেওয়ার পরিবর্তে চালিয়ে যায়।
কিভাবে প্রতিটি GPU র্যাঙ্ক সাধারণত একটি ছেঁড়া চেকপয়েন্টে অবদান রাখে?
যেহেতু বিতরণ করা প্রশিক্ষণ ইতিমধ্যেই মডেলটিকে র্যাঙ্ক জুড়ে বিভাজন করে, প্রতিটি র্যাঙ্ক কেবল তার স্লাইস লিখে, যা সমান্তরাল এবং মেমরি-দক্ষ করে সংরক্ষণ করে।
একটি সূচী ফাইল শার্ড চেকপয়েন্টে কি ভূমিকা পালন করে?
একটি সূচক (যেমন, index.json) রেকর্ড করে কোন শার্ড প্রতিটি পরামিতি ধারণ করে যাতে লোডাররা সঠিক টুকরা আনতে এবং পুনরায় একত্রিত করতে পারে।