মৌলিক নির্দেশিকা

ওজন ক্ষয় এবং L2 নিয়মিতকরণ

ওজন ক্ষয় একটি সহজ, শক্তিশালী কৌশল যা প্রশিক্ষণের সময় একটি মডেলের ওজনকে শূন্যের দিকে ঠেলে দেয়, এটিকে কোনো একক বৈশিষ্ট্যের উপর খুব বেশি নির্ভর করতে নিরুৎসাহিত করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It reduces overfitting and is one of the most widely used regularizers in deep learning.

গভীর ডুব

যখন একটি মডেল ট্রেনিং করে, তখন এটি বড়, সূক্ষ্মভাবে টিউন করা ওজন বাড়ার মাধ্যমে ডেটার মধ্যে গোলমাল করতে পারে যা প্রশিক্ষণ সেটের সাথে পুরোপুরি ফিট করে কিন্তু সাধারণভাবে খারাপ করে। L2 নিয়মিতকরণ ক্ষতির ফাংশনে বর্গ ওজনের যোগফলের সমানুপাতিক শাস্তি যোগ করে এর বিরুদ্ধে লড়াই করে। অপ্টিমাইজারের এখন দুটি লক্ষ্য রয়েছে: ডেটা ফিট করা এবং ওজন ছোট রাখা, যাতে এটি মসৃণ, আরও শক্তিশালী সমাধানের উপর স্থির হয়। ওজন ক্ষয় হল প্রতিটি আপডেট ধাপে একটি ছোট ভগ্নাংশ দ্বারা প্রতিটি ওজন সঙ্কুচিত করার ঘনিষ্ঠভাবে সম্পর্কিত ধারণা। প্লেইন গ্রেডিয়েন্ট ডিসেন্টের সাথে দুটি গাণিতিকভাবে সমতুল্য, কিন্তু অ্যাডামের মতো অভিযোজিত অপ্টিমাইজারের সাথে তাদের পার্থক্য রয়েছে, যে কারণে অ্যাডামডব্লিউ গ্রেডিয়েন্ট-ভিত্তিক আপডেট থেকে ক্ষয়কে ডিকপল করার জন্য এবং এটিকে সঠিকভাবে আচরণ করার জন্য চালু করা হয়েছিল।

প্রযুক্তিগত অন্তর্দৃষ্টি

L2 নিয়মিতকরণ ক্ষতির সাথে বর্গ ওজনের যোগফলের ল্যাম্বডা গুণ যোগ করে, তাই এর গ্রেডিয়েন্ট প্রতিটি ওজনের সমানুপাতিক একটি শব্দ যোগ করে, এটিকে শূন্যের দিকে টেনে নেয়। Decoupled ওজন ক্ষয় পরিবর্তে প্রতিটি ওজনকে একটি ফ্যাক্টর দ্বারা গুণিত করে যেমন (1 বিয়োগ লার্নিং_রেট গুণ ল্যাম্বডা)। অভিযোজিত পদ্ধতিতে, L2 কে লসের সাথে সংযুক্ত করলে প্রতি-প্যারামিটার স্কেলিং শাস্তিকে বিকৃত করতে দেয়, তাই AdamW আলাদাভাবে সংকোচন প্রয়োগ করে, ছোট ওজনের দিকে অভিন্ন টান পুনরুদ্ধার করে।

কৌশলগত প্রভাব

সুস্পষ্ট সিদ্ধান্ত

এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।

খরচ ও বাজেট

অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।

টিম এবং ওয়ার্কফ্লো

ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।

ওজন ক্ষয় এবং L2 নিয়মিতকরণের ভবিষ্যত

বৃহৎ ভাষার মডেল এবং ভিশন ট্রান্সফরমারের জন্য প্রশিক্ষণ রেসিপিতে ওজন ক্ষয় একটি ডিফল্ট উপাদান হিসাবে রয়ে গেছে এবং অ্যাডামডাব্লু এখন তাদের জন্য আদর্শ অপ্টিমাইজার। ক্ষয় কিভাবে শেখার হারের সময়সূচী, স্বাভাবিকীকরণ স্তর এবং মডেল স্কেলের সাথে ইন্টারঅ্যাক্ট করে তা নিয়ে গবেষণা চলতে থাকে, যেহেতু মডেল বাড়ার সাথে সাথে এর কার্যকরী শক্তি পরিবর্তিত হয়। স্বয়ংক্রিয় হাইপারপ্যারামিটার অনুসন্ধান এবং স্কেলিং-আইন অধ্যয়ন পরিপক্ক হিসাবে আরও নীতিগত, সম্ভবত প্রতি-স্তর বা সময়সূচী-সচেতন ক্ষয় টিউনিং আশা করুন।

বাস্তব-বিশ্ব বাস্তবায়ন

ওভারফিটিং রোধ করার জন্য ইমেজ ক্লাসিফায়ারদের প্রশিক্ষণ দেওয়ার সময় PyTorch-এর AdamW বা SGD অপ্টিমাইজারে weight_decay যোগ করা

রিজ রিগ্রেশনে ল্যাম্বডা সহগকে টিউন করা, ক্লাসিক L2-দন্ডিত রৈখিক মডেল, পারস্পরিক সম্পর্কযুক্ত বৈশিষ্ট্যগুলির উপর ভবিষ্যদ্বাণীগুলিকে স্থিতিশীল করতে

শেখার হারের সময়সূচীর পাশাপাশি একটি ছোট ওজনের ক্ষয় (প্রায়ই প্রায় 0.1) সেট করে বৃহৎ ভাষার মডেল প্রি-ট্রেনিং রেসিপি

একটি ছোট মেডিকেল-ইমেজিং মডেলকে সীমিত প্রশিক্ষণ স্ক্যানগুলি মনে রাখা থেকে বাঁচাতে ডেটা বৃদ্ধি এবং ড্রপআউটের সাথে ওজন ক্ষয়ের সমন্বয়

ঝুঁকি এবং প্রহরী

বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।

বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।

ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।

বাস্তবায়ন রোডম্যাপ

1

আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।

2

পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।

3

একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷

4

নথি যেখানে ওজন ক্ষয় এবং L2 নিয়মিতকরণ সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Weight Decay and L2 Regularization?

ওজন ক্ষয় একটি সহজ, শক্তিশালী কৌশল যা প্রশিক্ষণের সময় একটি মডেলের ওজনকে শূন্যের দিকে ঠেলে দেয়, এটিকে কোনো একক বৈশিষ্ট্যের উপর খুব বেশি নির্ভর করতে নিরুৎসাহিত করে। এটি ওভারফিটিং হ্রাস করে এবং গভীর শিক্ষার ক্ষেত্রে এটি সবচেয়ে বেশি ব্যবহৃত নিয়মিতকরণকারীদের মধ্যে একটি।

L2 নিয়মিতকরণ ক্ষতি ফাংশন কি যোগ করে?

L2 নিয়মিতকরণ বর্গাকার ওজনের যোগফলের ল্যাম্বডাকে যোগ করে, বড় ওজনকে শাস্তি দেয় এবং ছোট, মসৃণ সমাধানকে উৎসাহিত করে।

ওজন ক্ষয় প্রতিরোধে সাহায্য করে এমন প্রধান সমস্যা কী?

ওজন ছোট রাখার মাধ্যমে, ওজনের ক্ষয় মডেলটিকে ফিটিং শব্দ থেকে নিরুৎসাহিত করে, নতুন ডেটাতে সাধারণীকরণ উন্নত করে।

ওজন ক্ষয় মডেলের ওজনকে কোন দিকে ঠেলে দেয়?

ওজন ক্ষয় প্রতিটি আপডেটে ওজনকে শূন্যের দিকে সঙ্কুচিত করে, যে কারণে এটিকে কখনও কখনও ওজনের 'ক্ষয়' হিসাবে বর্ণনা করা হয়।

কেন অ্যাডামডব্লিউ চালু করা হয়েছিল?

অ্যাডাম-এ, L2 ভাঁজ করা ক্ষতির মধ্যে প্রতি-প্যারামিটার স্কেলিং এর সাথে খারাপভাবে ইন্টারঅ্যাক্ট করে; অভিন্ন সংকোচন পুনরুদ্ধার করার জন্য AdamW আলাদাভাবে ক্ষয় প্রয়োগ করে।

প্লেইন স্টোকাস্টিক গ্রেডিয়েন্ট ডিসেন্টের জন্য, L2 নিয়মিতকরণ এবং ওজন ক্ষয় কীভাবে সম্পর্কিত?

প্লেইন SGD এর সাথে, ক্ষতির সাথে একটি L2 পেনাল্টি যোগ করলে সরাসরি সঙ্কুচিত ওজনের মতো একই আপডেট তৈরি হয়, তাই দুটি সমান।