মৌলিক নির্দেশিকা

গ্রোকিং এবং বিলম্বিত সাধারণীকরণ

গ্রোকিং হল একটি চমকপ্রদ ঘটনা যেখানে একটি নিউরাল নেটওয়ার্ক প্রথমে তার প্রশিক্ষণের ডেটা মুখস্থ করে, দীর্ঘ সময়ের জন্য শূন্যের কাছাকাছি বৈধতা নির্ভুলতায় বসে থাকে এবং তারপর হঠাৎ করে প্রশিক্ষণের সঠিকতা 100% আঘাত করার অনেক পরে সাধারণীকরণ করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It overturns the intuition that learning and generalization happen together.

গভীর ডুব

2021 সালে OpenAI গবেষকরা মডুলার পাটিগণিতের মতো ছোট অ্যালগরিদমিক কাজের উপর আবিষ্কার করেছেন, গ্রোকিং একটি তীক্ষ্ণ দুই-ফেজ বক্ররেখা দেখায়। প্রথম দিকে, মডেলটি প্রশিক্ষণ সেটের সাথে পুরোপুরি ফিট করে যখন বৈধতা কর্মক্ষমতা সুযোগ থাকে, আশাহীনভাবে অতিরিক্ত ফিট দেখায়। তারপরে, হাজার হাজার বা এমনকি লক্ষ লক্ষ অতিরিক্ত পদক্ষেপের পরে কোন আপাত অগ্রগতি ছাড়াই, বৈধতা নির্ভুলতা হঠাৎ করে প্রায় নিখুঁত হয়ে যায়। নেতৃস্থানীয় ব্যাখ্যা হল যে ওজন ক্ষয় (নিয়মিতকরণ) ধীরে ধীরে নেটওয়ার্ককে চাপ দেয় একটি ভঙ্গুর মুখস্থ সমাধান পরিত্যাগ করতে এবং একটি কম্প্যাক্ট, কাঠামোবদ্ধ একটি আবিষ্কার করে যা প্রকৃতপক্ষে অন্তর্নিহিত নিয়মকে ক্যাপচার করে, উদাহরণস্বরূপ একটি বৃত্তে ঘূর্ণন হিসাবে মডুলার সংযোজন উপস্থাপন করে। ছোট সিন্থেটিক ডেটাসেটগুলিতে গ্রোকিং সবচেয়ে বেশি দৃশ্যমান, তবে এটি বোঝা কখন এবং কেন সাধারণীকরণের আবির্ভাব ঘটে তার গভীর মেকানিক্সের উপর আলোকপাত করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

মেকানিস্টিক অধ্যয়ন রিভার্স-ইঞ্জিনিয়ারড গ্রোকড নেটওয়ার্ক এবং তারা পরিষ্কার অ্যালগরিদম প্রয়োগ করে, যেমন ফুরিয়ারের মতো বৃত্তাকার এম্বেডিং ব্যবহার করে ত্রিকোণমিতিক পরিচয়ের মাধ্যমে মডুলার গাণিতিক সম্পাদন করে। পরিবর্তনটি নিয়মিতকরণের অধীনে নেটওয়ার্কের ওজন স্পার্সার এবং নিম্ন-আদর্শ হওয়ার সাথে সম্পর্কযুক্ত: মুখস্থ করার জন্য বড়, অনিয়মিত ওজন প্রয়োজন, যখন সাধারণীকরণ সার্কিট সহজ। গ্রোকিং এইভাবে একটি দ্রুত-থেকে-খোঁজানো মুখস্থ সমাধান এবং একটি ধীর-থেকে-ফর্ম, আরও দক্ষ সাধারণীকরণের মধ্যে একটি প্রতিযোগিতাকে চিত্রিত করে।

কৌশলগত প্রভাব

সুস্পষ্ট সিদ্ধান্ত

এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।

খরচ ও বাজেট

অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।

টিম এবং ওয়ার্কফ্লো

ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।

গ্রোকিং এবং বিলম্বিত সাধারণীকরণের ভবিষ্যত

গ্রোকিং হল সাধারণীকরণের বিজ্ঞানের একটি উইন্ডো যা গবেষকরা স্কেল করার আশা করছেন। খোলা প্রশ্নগুলির মধ্যে রয়েছে যে বিলম্বিত সাধারণীকরণ বড় মডেলগুলির মধ্যে নীরবে ঘটে কিনা, কীভাবে রূপান্তরটি সনাক্ত করা যায় বা ত্বরান্বিত করা যায় এবং একটি মডেল কখন মুখস্থ উদাহরণের বিপরীতে একটি ধারণা সত্যই শিখেছে তা জানার জন্য এটি কী বোঝায়। অন্তর্দৃষ্টিগুলি আরও ভাল নিয়মিতকরণ, প্রশিক্ষণের সময়সূচী এবং ব্যাখ্যাযোগ্যতার সরঞ্জামগুলিকে জানাতে পারে এবং বৃহৎ ভাষার মডেলগুলিতে উদ্ভূত ক্ষমতার পূর্বাভাস দিতে সহায়তা করতে পারে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি নেটওয়ার্ক যে সঠিক সার্কিটগুলি শিখে তা বিপরীত-ইঞ্জিনিয়ার করার জন্য মডুলার গাণিতিক কাজগুলি অধ্যয়ন করা

কিভাবে ওজন ক্ষয় মুখস্থ থেকে সত্যিকারের সাধারণীকরণে স্থানান্তরিত করে তা প্রদর্শন করা

বিশ্লেষণ করার জন্য পরিষ্কার, সম্পূর্ণরূপে বোধগম্য মডেল আচরণ প্রদান করে ব্যাখ্যাযোগ্যতা গবেষণাকে অবহিত করা

অনুশীলনকারীদের সতর্ক করা যে প্রাথমিক বৈধতা মালভূমির অর্থ সবসময় এই নয় যে একটি মডেল শিখতে ব্যর্থ হয়েছে

ঝুঁকি এবং প্রহরী

বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।

বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।

ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।

বাস্তবায়ন রোডম্যাপ

1

আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।

2

পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।

3

একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷

4

নথি যেখানে গ্রোকিং এবং বিলম্বিত সাধারণীকরণ সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grokking and Delayed Generalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Grokking and Delayed Generalization?

গ্রোকিং হল একটি চমকপ্রদ ঘটনা যেখানে একটি নিউরাল নেটওয়ার্ক প্রথমে তার প্রশিক্ষণের ডেটা মুখস্থ করে, দীর্ঘ সময়ের জন্য শূন্যের কাছাকাছি বৈধতা নির্ভুলতায় বসে থাকে এবং তারপর হঠাৎ করে প্রশিক্ষণের সঠিকতা 100% আঘাত করার অনেক পরে সাধারণীকরণ করে। এটি অন্তর্দৃষ্টিকে উল্টে দেয় যে শেখার এবং সাধারণীকরণ একসাথে ঘটে।

নিউরাল নেটওয়ার্ক প্রশিক্ষণে গ্রোকিংকে কী সংজ্ঞায়িত করে?

গ্রোকিং হ'ল ভাল বৈধতা পারফরম্যান্সে হঠাৎ লাফ যা প্রশিক্ষণের সঠিকতা ইতিমধ্যে 100% হওয়ার পরে ভালভাবে ঘটে।

কোন ধরনের কাজের উপর প্রথম grokking প্রধানত পালন করা হয়েছিল?

OpenAI গবেষকরা 2021 সালে মডুলার সংযোজনের মতো ছোট সিন্থেটিক অ্যালগরিদমিক সমস্যার বিষয়ে গ্রোকিং রিপোর্ট করেছেন।

গ্রোকিংয়ে সাধারণীকরণে রূপান্তর চালানোর জন্য প্রায়শই কোন ফ্যাক্টরকে কৃতিত্ব দেওয়া হয়?

ওজনের ক্ষয় ধীরে ধীরে নেটওয়ার্কটিকে একটি ভঙ্গুর মুখস্থ সমাধান থেকে একটি কমপ্যাক্ট, সাধারণীকরণ সার্কিটের দিকে ঠেলে দেয়।

গবেষকরা যখন মডুলার পাটিগণিতের উপর একটি গ্রোকড নেটওয়ার্ক রিভার্স-ইঞ্জিনিয়ার করেন, তখন তারা কী খুঁজে পান?

যান্ত্রিক ব্যাখ্যাযোগ্যতা প্রকাশ করেছে যে নেটওয়ার্ক মডুলার গাণিতিক গণনা করতে ত্রিকোণমিতিক, বৃত্তাকার উপস্থাপনা শিখেছে।

কেন grokking দুটি সমাধান মধ্যে একটি প্রতিযোগিতা হিসাবে বর্ণনা করা হয়?

নেটওয়ার্কগুলি দ্রুত একটি স্মরণীয় সমাধান খুঁজে পায় কিন্তু, নিয়মিতকরণের অধীনে, অবশেষে একটি সহজ সাধারণীকরণ সার্কিটে রূপান্তরিত হয়।