প্রযুক্তিগত গাইড

চেকপয়েন্ট শার্ডিং এবং পুনরায় শুরুযোগ্য প্রশিক্ষণ

একটি মডেলের ট্রেনিং স্টেটকে টুকরো টুকরো (শার্ডে) সংরক্ষণ করার কৌশল যাতে দৈত্য মডেলগুলিকে মেমরি বা ডিস্কের সীমাবদ্ধতায় দম বন্ধ না করে সংরক্ষণ করা যায় এবং পুনরায় লোড করা যায়, এবং তাই একটি ক্র্যাশ হওয়া দৌড়টি ঠিক যেখান থেকে ছেড়েছিল সেখানে উঠতে পারে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

Essential for any training job that runs for days or weeks across many GPUs.

গভীর ডুব

একটি প্রশিক্ষণ চেকপয়েন্ট হল পুনরায় শুরু করার জন্য প্রয়োজনীয় সবকিছুর একটি স্ন্যাপশট: মডেল ওজন, অপ্টিমাইজার স্টেট, শেখার হারের সময়সূচী, ডেটা লোডারের অবস্থান এবং এলোমেলো সংখ্যা জেনারেটর বীজ। বড় মডেলের জন্য এই স্ন্যাপশট শত শত গিগাবাইট হতে পারে, একটি একক ফাইল বা একটি একক মেশিনের মেমরির জন্য অনেক বড়। চেকপয়েন্ট শার্ডিং অনেক ফাইল এবং অনেক র‌্যাঙ্ক জুড়ে স্ন্যাপশটকে বিভক্ত করে, তাই প্রতিটি GPU সমান্তরালভাবে শুধুমাত্র নিজস্ব স্লাইস লেখে। পুনঃসূচনাযোগ্য প্রশিক্ষণ তারপর সেই শার্ডগুলিকে পুনরায় লোড করে এবং সঠিকভাবে সম্পূর্ণ অবস্থা পুনরুদ্ধার করে। এটি ছাড়া, 200 ঘন্টায় ক্র্যাশ হওয়া একটি মাল্টি-সপ্তাহের দৌড় স্ক্র্যাচ থেকে পুনরায় চালু করতে হবে। PyTorch Distributed Checkpoint, DeepSpeed ​​এবং Hugging Face Hub-এর শার্ডেড সেফটেনসর ফরম্যাটের মতো ফ্রেমওয়ার্কগুলি এই রুটিন তৈরি করে৷

প্রযুক্তিগত অন্তর্দৃষ্টি

শেয়ারিং কাজ করে কারণ বিতরণ করা প্রশিক্ষণ ইতিমধ্যেই র‍্যাঙ্ক জুড়ে ওজন এবং অপ্টিমাইজার স্টেটগুলিকে পার্টিশন করে (ডেটা, টেনসর বা জিরো সমান্তরালতার মাধ্যমে)। প্রতিটি র‌্যাঙ্ক শুধুমাত্র তার পার্টিশনকে সিরিয়ালাইজ করে, প্রায়শই সেফটেনসরের মতো ফরম্যাটে যা অলস, মেমরি-ম্যাপ করা লোডিংয়ের অনুমতি দেয়। একটি সূচী ফাইল শার্ড ফাইলে প্যারামিটার নাম ম্যাপ করে। নির্ধারকভাবে পুনরায় শুরু করার জন্য, সিস্টেমটি আরএনজি স্টেট, অপ্টিমাইজার স্টেপ কাউন্ট এবং সঠিক ডেটালোডার অফসেটও বজায় রাখে, তাই রিরান ব্যাচগুলির একই ক্রম পুনরুত্পাদন করে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

চেকপয়েন্ট শেয়ারিং এবং পুনরায় শুরুযোগ্য প্রশিক্ষণের ভবিষ্যত

চেকপয়েন্টিং একটি পর্যায়ক্রমিক স্টপ-দ্য-ওয়ার্ল্ড ইভেন্ট থেকে অ্যাসিঙ্ক্রোনাস এবং প্রায় বিনামূল্যে কিছুতে স্থানান্তরিত হচ্ছে। আরও ইন-মেমরি এবং ওভারল্যাপড চেকপয়েন্টিং আশা করুন যা প্রশিক্ষণ চলাকালীন ব্যাকগ্রাউন্ডে শার্ডগুলি লেখে, এছাড়াও ইরেজার-কোডেড এবং প্রতিলিপি করা চেকপয়েন্ট যা হাজার-GPU স্কেলে সাধারণ নোড ব্যর্থতা থেকে বাঁচে। ক্লাউড অবজেক্ট স্টোর এবং দ্রুততর স্থানীয় NVMe টিয়ারগুলি শার্ডগুলি হোস্ট করবে এবং সেফটেনসরের মতো স্ট্যান্ডার্ড ফর্ম্যাটগুলি প্রশিক্ষণ পুনঃসূচনা এবং অনুমান স্থাপন উভয়ের জন্য নিরাপদ, দ্রুত, আংশিক লোডিং উন্নত করতে থাকবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি ফ্রন্টিয়ার-মডেল হাজার হাজার জিপিইউ জুড়ে চলে যা প্রতি কয়েকশ ধাপে শার্ডেড চেকপয়েন্টগুলিকে স্বয়ংক্রিয়ভাবে সংরক্ষণ করে তাই একটি ব্যর্থ নোডের জন্য কয়েক মিনিটের খরচ হয়, দিন নয়।

আলিঙ্গন মুখ একাধিক সেফটেনসর শার্ড এবং একটি index.json হিসাবে একটি বড় খোলা মডেল বিতরণ করে যাতে ব্যবহারকারীরা এটিকে টুকরো টুকরো করে ডাউনলোড এবং লোড করতে পারে৷

একজন গবেষক একটি বাধাপ্রাপ্ত ফাইন-টিউন পুনরায় শুরু করছেন যা নির্বিঘ্নে চালিয়ে যাওয়ার জন্য সঠিক অপ্টিমাইজার ভরবেগ, ধাপ গণনা এবং ডেটালোডার অবস্থান পুনরুদ্ধার করে।

সস্তা প্রিমম্পিবল ক্লাউড জিপিইউ-তে স্পট-ইন্সট্যান্স ট্রেনিং, যেখানে ঘন ঘন শার্ড চেকপয়েন্ট চাকরিটিকে উচ্ছেদ করা এবং পুনঃনির্ধারণ করা থেকে বাঁচতে দেয়।

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Checkpoint Sharding and Resumable Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

এআই ট্রেনিং ক্লাস্টারের জন্য স্লার্ম

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Checkpoint Sharding and Resumable Training?

একটি মডেলের ট্রেনিং স্টেটকে টুকরো টুকরো (শার্ডে) সংরক্ষণ করার কৌশল যাতে দৈত্য মডেলগুলিকে মেমরি বা ডিস্কের সীমাবদ্ধতায় দম বন্ধ না করে সংরক্ষণ করা যায় এবং পুনরায় লোড করা যায়, এবং তাই একটি ক্র্যাশ হওয়া দৌড়টি ঠিক যেখান থেকে ছেড়েছিল সেখানে উঠতে পারে। যে কোনো প্রশিক্ষণ কাজের জন্য অপরিহার্য যা অনেক GPU জুড়ে কয়েক দিন বা সপ্তাহ ধরে চলে।

কেন বড়-মডেল চেকপয়েন্টগুলিকে ভাগে ভাগ করা হয়?

বিশাল চেকপয়েন্ট (শত গিগাবাইট) একটি ফাইল হিসাবে অব্যবহার্য; শার্ডিং অনেক র‌্যাঙ্ককে তাদের স্লাইস সমান্তরালে লিখতে দেয় এবং টুকরো টুকরো লোডিং সক্ষম করে।

মডেল ওজন ছাড়াও, একটি পুনরায় শুরুযোগ্য চেকপয়েন্ট সাধারণত কি সংরক্ষণ করা আবশ্যক?

ঠিকভাবে পুনরায় শুরু করার জন্য, চেকপয়েন্ট অপ্টিমাইজার স্টেট, র্যান্ডম-নম্বর-জেনারেটর স্টেট, স্টেপ কাউন্ট এবং ডাটা লোডার কোথায় রেখে গেছে তা সংরক্ষণ করে।

দীর্ঘ চাকরির জন্য পুনরায় শুরুযোগ্য প্রশিক্ষণের প্রধান সুবিধা কী?

পুনঃসূচনাযোগ্য চেকপয়েন্টগুলির সাথে, একটি বিঘ্নিত দৌড় তার শেষ সংরক্ষিত অবস্থা পুনরায় লোড করে এবং গণনার দিনগুলি ফেলে দেওয়ার পরিবর্তে চালিয়ে যায়।

কিভাবে প্রতিটি GPU র‍্যাঙ্ক সাধারণত একটি ছেঁড়া চেকপয়েন্টে অবদান রাখে?

যেহেতু বিতরণ করা প্রশিক্ষণ ইতিমধ্যেই মডেলটিকে র‌্যাঙ্ক জুড়ে বিভাজন করে, প্রতিটি র‌্যাঙ্ক কেবল তার স্লাইস লিখে, যা সমান্তরাল এবং মেমরি-দক্ষ করে সংরক্ষণ করে।

একটি সূচী ফাইল শার্ড চেকপয়েন্টে কি ভূমিকা পালন করে?

একটি সূচক (যেমন, index.json) রেকর্ড করে কোন শার্ড প্রতিটি পরামিতি ধারণ করে যাতে লোডাররা সঠিক টুকরা আনতে এবং পুনরায় একত্রিত করতে পারে।