চিনচিলা স্কেলিং আইন
2022 সালে ডিপমাইন্ড থেকে চিনচিলা স্কেলিং আইন দেখায় যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষণপ্রাপ্ত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য, আপনার মডেলের আকার এবং প্রশিক্ষণের ডেটা মোটামুটি সমান অনুপাতে স্কেল করা উচিত।
ওভারভিউ
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
গভীর ডুব
চিনচিলার আগে, প্রবণতা ছিল তুলনামূলকভাবে পরিমিত পরিমাণ ডেটার উপর প্রশিক্ষণের সময় সবসময় বড় মডেল (যেমন 175B-প্যারামিটার GPT-3) তৈরি করা। ডিপমাইন্ড অনেক আকার এবং ডেটা বাজেট জুড়ে 400 টিরও বেশি মডেলকে প্রশিক্ষিত করেছে, তারপর একটি নির্দিষ্ট গণনা (FLOP) বাজেটের অধীনে প্যারামিটার এবং টোকেনগুলির একটি ফাংশন হিসাবে ক্ষতির পূর্বাভাস দেওয়ার কার্ভগুলি ফিট করেছে৷ তাদের অনুসন্ধান: পরামিতি এবং প্রশিক্ষণ টোকেনগুলিকে একসাথে স্কেল করা উচিত, মোটামুটিভাবে 1-থেকে-1 অনুপাত, প্রতি প্যারামিটারে প্রায় 20 টোকেন প্রশিক্ষণ ডেটা বোঝায়। এটি প্রমাণ করার জন্য, তারা চিনচিলাকে প্রশিক্ষণ দিয়েছে, একটি 70B-প্যারামিটার মডেল 1.4 ট্রিলিয়ন টোকেনে, যা একই গণনা ব্যবহার করা সত্ত্বেও অনেক বড় 280B-প্যারামিটার গোফারকে ছাড়িয়ে গেছে, কারণ এটি অনেক বেশি ডেটাতে প্রশিক্ষিত ছিল।
প্রযুক্তিগত অন্তর্দৃষ্টি
আইনগুলি একটি প্যারামেট্রিক লস ফাংশন L(N, D) ফিট করা থেকে আসে যেখানে N হল প্যারামিটার এবং D হল টোকেন, যার মধ্যে অপরিবর্তনীয়-ক্ষতি, মডেল-আকার এবং ডেটা-আকার শর্তাবলী রয়েছে। একটি কম্পিউট সীমাবদ্ধতার সাপেক্ষে ক্ষতি কম করা (কম্পিউট মোটামুটিভাবে N বার D এর সমানুপাতিক) ফলাফল দেয় যে অনুকূল N এবং D উভয়ই অনুরূপ সূচক সহ গণনার শক্তি হিসাবে বৃদ্ধি পায়, তাই গণনা-অনুকূল অনুপাত প্রতি প্যারামিটারে 20 টোকেনের কাছাকাছি থাকে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
চিনচিলা স্কেলিং আইনের ভবিষ্যত
চিনচিলা প্যারামিটার গণনা থেকে ক্ষেত্রটিকে অনেক বেশি উচ্চ-মানের ডেটা ফিডিং মডেলগুলিতে স্থানান্তরিত করেছে, এবং আধুনিক মডেলগুলি প্রায়শই অনুমানকে সস্তা করার জন্য 'কম্পিউট-অপ্টিমাল' পয়েন্টকে ভালভাবে প্রশিক্ষণ দেয়। উচ্চ-মানের ওয়েব টেক্সট দুষ্প্রাপ্য হয়ে পড়ায়, স্কেলিং ধরে রাখতে ডেটা কিউরেশন, সিন্থেটিক ডেটা, একাধিক যুগ এবং মাল্টিমোডাল ডেটার দিকে মনোযোগ দেওয়া হচ্ছে। মূল পাঠটি স্থায়ী হয়: ডেটা এবং পরামিতিগুলি অবশ্যই ভারসাম্যপূর্ণ হতে হবে এবং শুধুমাত্র কাঁচা আকার আর লক্ষ্য নয়।
বাস্তব-বিশ্ব বাস্তবায়ন
ডিপমাইন্ডের 70B-প্যারামিটার চিনচিলা অনেক বেশি ডেটার প্রশিক্ষণের মাধ্যমে সমান কম্পিউট ব্যবহার করে বেঞ্চমার্কে 280B গোফারকে পরাজিত করেছে
স্ক্র্যাচ মডেলের পরিকল্পনা করার সময় প্রতি প্যারামিটারে মোটামুটি 20টি প্রশিক্ষণ টোকেন বাজেট করার জন্য দলকে গাইড করা
LLaMA-এর মতো ছোট, ডেটা-সমৃদ্ধ মডেলগুলিকে সমর্থন করা যা অনুমান সময়ে চালানোর জন্য সস্তা
একটি পরিকল্পিত মডেল 'আন্ডারট্রেইনড' কিনা এবং অতিরিক্ত প্যারামিটারের চেয়ে অতিরিক্ত ডেটা থেকে বেশি উপকৃত হবে কিনা তা অনুমান করা
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
নিউরাল নেটওয়ার্কের জন্য স্কেলিং আইন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Chinchilla Scaling Laws?
2022 সালে ডিপমাইন্ড থেকে চিনচিলা স্কেলিং আইন দেখায় যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষণপ্রাপ্ত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য, আপনার মডেলের আকার এবং প্রশিক্ষণের ডেটা মোটামুটি সমান অনুপাতে স্কেল করা উচিত। এটি গুরুত্বপূর্ণ কারণ এটি 'অনুকূল' মডেলের আকারের অর্থ কী তা পুনরায় সংজ্ঞায়িত করেছে এবং ল্যাবগুলি কীভাবে গণনা ব্যয় করে তা পুনরায় আকার দিয়েছে।
চিনচিলা স্কেলিং আইনের কেন্দ্রীয় অনুসন্ধান কী ছিল?
চিনচিলা দেখিয়েছে যে একটি নির্দিষ্ট কম্পিউট বাজেটের জন্য, প্যারামিটার এবং প্রশিক্ষণ টোকেনগুলি একসাথে বৃদ্ধি করা উচিত, মোটামুটি 1-থেকে-1।
চিনচিলা প্রতি প্যারামিটারে আনুমানিক কতগুলি প্রশিক্ষণ টোকেন কম্পিউট-অনুকূল বলে পরামর্শ দিয়েছে?
কম্পিউট-অনুকূল অনুপাত প্রতিটি মডেল প্যারামিটারের জন্য মোটামুটি 20টি প্রশিক্ষণ টোকেনে কাজ করে।
চিনচিলা অনেক ছোট হওয়া সত্ত্বেও কোন মডেলকে ছাড়িয়ে গেছে?
70B-প্যারামিটার চিনচিলা একই গণনা ব্যবহার করে ডিপমাইন্ডের নিজস্ব 280B-প্যারামিটার গোফারকে পরাজিত করেছে, কারণ এটি অনেক বেশি ডেটার উপর প্রশিক্ষিত।
চিনচিলা সেই সময়ে GPT-3 এর মতো মডেল সম্পর্কে কী বোঝায়?
সেই যুগের অনেক বড় মডেলকে প্রশিক্ষণ দেওয়া হয়েছিল, যার অর্থ তারা তাদের প্যারামিটার গণনার জন্য অনেক বেশি ডেটা দিয়ে আরও ভাল পারফর্ম করতে পারত।
চিনচিলা বিশ্লেষণে মোটামুটিভাবে কীভাবে গণনা করা হয়েছিল?
ট্রেনিং কম্পিউট (FLOPs) প্রশিক্ষণ টোকেনের সংখ্যা দ্বারা গুণিত প্যারামিটারের সংখ্যার প্রায় সমানুপাতিক।