প্রযুক্তিগত গাইড

গ্রেডিয়েন্ট জমা

গ্রেডিয়েন্ট সঞ্চয়ন আপনাকে সীমিত GPU মেমরিতে একটি বড় ব্যাচের আকার অনুকরণ করতে দেয় ওজনগুলি আপডেট করার আগে কয়েকটি ছোট মিনি-ব্যাচের উপর গ্রেডিয়েন্ট যোগ করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It is the standard workaround for training big models when memory is the bottleneck.

গভীর ডুব

সাধারণত একটি প্রশিক্ষণ পদক্ষেপ একটি ব্যাচ প্রক্রিয়া করে, গ্রেডিয়েন্ট গণনা করে এবং অবিলম্বে পরামিতি আপডেট করে। With gradient accumulation, you run several forward and backward passes on smaller micro-batches, adding their gradients together in the parameter buffers, and only call the optimizer step (and zero the gradients) after N micro-batches. কার্যকর ব্যাচের আকার মাইক্রো-ব্যাচের আকার N গুণে পরিণত হয়, যদিও পিক মেমরিতে শুধুমাত্র একটি মাইক্রো-ব্যাচ সক্রিয়করণ থাকে। This matters because many training recipes assume large batches for stable statistics, and because models like large transformers cannot fit a full target batch on a single device. The catch: batch-normalization statistics are computed per micro-batch, so layer norm or group norm pair better with accumulation, and you must scale the loss correctly to keep the effective learning rate right.

প্রযুক্তিগত অন্তর্দৃষ্টি

যেহেতু একটি সংমিশ্রিত ক্ষতির গ্রেডিয়েন্টগুলি সংযোজনকারী, তাই N মাইক্রো-ব্যাচগুলির উপর গ্রেডিয়েন্ট জমা করা গাণিতিকভাবে একটি বড় ব্যাচের সমতুল্য, যদি আপনি সঠিকভাবে গড় করেন। ইমপ্লিমেন্টেশনগুলি সাধারণত পিছিয়ে যাওয়ার আগে প্রতিটি মাইক্রো-ব্যাচের ক্ষতিকে N দ্বারা ভাগ করে, তাই সঞ্চিত গ্রেডিয়েন্ট সম্পূর্ণ কার্যকর ব্যাচের গড় সমান। আপনি এনম মাইক্রো-ব্যাচ পর্যন্ত optimizer.step() এবং zero_grad() এড়িয়ে যান, কম পিক মেমরির জন্য অতিরিক্ত গণনা সময় ট্রেড করুন।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

গ্রেডিয়েন্ট সঞ্চয়ের ভবিষ্যত

মডেলের আকার একক-ডিভাইস মেমরিকে ছাড়িয়ে যাওয়ার কারণে গ্রেডিয়েন্ট জমা একটি ডিফল্ট লিভার থাকবে। এটি ক্রমবর্ধমানভাবে মিশ্র নির্ভুলতা, অ্যাক্টিভেশন চেকপয়েন্টিং, জিআরও শার্ডিং এবং ডিপস্পিড এবং এফএসডিপি-এর মতো ফ্রেমওয়ার্কগুলিতে পাইপলাইন সমান্তরালতার সাথে একত্রিত হয়। কঠোর অটোমেশন আশা করুন যেখানে লাইব্রেরিগুলি মেমরি বাজেটে স্বয়ংক্রিয়-টিউন সঞ্চয় করার পদক্ষেপ, এবং ভোক্তা জিপিইউ সহ সাধারণ হার্ডওয়্যারে বড় মডেলগুলিকে ফাইন-টিউন করার জন্য অবিরত গুরুত্ব বজায় রাখে যেখানে এটি প্রশিক্ষণ আনলক করে যা অন্যথায় অসম্ভব হবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একক ভোক্তা GPU-তে 8 বা 16 মাইক্রো-ব্যাচ জমা করে একটি বৃহৎ ভাষার মডেলকে সূক্ষ্ম-টিউনিং করে শত শতের কার্যকর ব্যাচে পৌঁছানোর জন্য।

উচ্চ-রেজোলিউশন ভিশন বা সেগমেন্টেশন মডেলের প্রশিক্ষণ যেখানে এমনকি 2 এর ব্যাচ ফিট করে, কিন্তু রেসিপিটির জন্য 32 এর একটি কার্যকর ব্যাচ প্রয়োজন।

আলিঙ্গন ফেস প্রশিক্ষক এবং পাইটর্চ লাইটনিং সীমিত-ভিআরএএম সেটআপগুলিতে নিয়মিতভাবে ব্যবহৃত গ্রেডিয়েন্ট_সঞ্চয়_স্টেপ সেটিং প্রকাশ করে।

সঞ্চয়ের মাধ্যমে কার্যকর ব্যাচের আকার মেলে ছোট হার্ডওয়্যারে একটি কাগজের বড়-ব্যাচের ফলাফল পুনরুত্পাদন করা।

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gradient Accumulation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অদৃশ্য এবং বিস্ফোরণ গ্রেডিয়েন্ট

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Gradient Accumulation?

Gradient accumulation lets you simulate a large batch size on limited GPU memory by summing gradients over several small mini-batches before updating the weights. মেমরি যখন বাধা হয়ে দাঁড়ায় তখন বড় মডেলদের প্রশিক্ষণের জন্য এটি আদর্শ সমাধান।

গ্রেডিয়েন্ট জমে প্রাথমিকভাবে আপনাকে কী করতে দেয়?

আপডেট করার আগে বেশ কয়েকটি মাইক্রো-ব্যাচের উপর গ্রেডিয়েন্ট যোগ করে, আপনি একবারে মেমরিতে না ধরে একটি বড় ব্যাচ অনুকরণ করেন।

সঞ্চয়ের সময়, আপনি কখন অপ্টিমাইজারের ধাপ এবং শূন্যকে গ্রেডিয়েন্ট বলবেন?

আপনি N মাইক্রো-ব্যাচ জুড়ে গ্রেডিয়েন্ট জমা করেন এবং চক্রের শেষে শুধুমাত্র একবার আপডেট করুন।

কোন স্বাভাবিককরণ স্তর গ্রেডিয়েন্ট সঞ্চয়নের সাথে আরও পরিষ্কারভাবে জোড়া দেয়?

ব্যাচ-নর্ম প্রতি মাইক্রো-ব্যাচের পরিসংখ্যান গণনা করে, তাই স্তর বা গোষ্ঠীর আদর্শ ছোট মাইক্রো-ব্যাচগুলির সাথে অমিল এড়ায়।