ভাষা এআই গাইড

চিনচিলা স্কেলিং আইন

2022 সালে ডিপমাইন্ড থেকে চিনচিলা স্কেলিং আইন দেখায় যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষণপ্রাপ্ত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য, আপনার মডেলের আকার এবং প্রশিক্ষণের ডেটা মোটামুটি সমান অনুপাতে স্কেল করা উচিত।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

গভীর ডুব

চিনচিলার আগে, প্রবণতা ছিল তুলনামূলকভাবে পরিমিত পরিমাণ ডেটার উপর প্রশিক্ষণের সময় সবসময় বড় মডেল (যেমন 175B-প্যারামিটার GPT-3) তৈরি করা। ডিপমাইন্ড অনেক আকার এবং ডেটা বাজেট জুড়ে 400 টিরও বেশি মডেলকে প্রশিক্ষিত করেছে, তারপর একটি নির্দিষ্ট গণনা (FLOP) বাজেটের অধীনে প্যারামিটার এবং টোকেনগুলির একটি ফাংশন হিসাবে ক্ষতির পূর্বাভাস দেওয়ার কার্ভগুলি ফিট করেছে৷ তাদের অনুসন্ধান: পরামিতি এবং প্রশিক্ষণ টোকেনগুলিকে একসাথে স্কেল করা উচিত, মোটামুটিভাবে 1-থেকে-1 অনুপাত, প্রতি প্যারামিটারে প্রায় 20 টোকেন প্রশিক্ষণ ডেটা বোঝায়। এটি প্রমাণ করার জন্য, তারা চিনচিলাকে প্রশিক্ষণ দিয়েছে, একটি 70B-প্যারামিটার মডেল 1.4 ট্রিলিয়ন টোকেনে, যা একই গণনা ব্যবহার করা সত্ত্বেও অনেক বড় 280B-প্যারামিটার গোফারকে ছাড়িয়ে গেছে, কারণ এটি অনেক বেশি ডেটাতে প্রশিক্ষিত ছিল।

প্রযুক্তিগত অন্তর্দৃষ্টি

আইনগুলি একটি প্যারামেট্রিক লস ফাংশন L(N, D) ফিট করা থেকে আসে যেখানে N হল প্যারামিটার এবং D হল টোকেন, যার মধ্যে অপরিবর্তনীয়-ক্ষতি, মডেল-আকার এবং ডেটা-আকার শর্তাবলী রয়েছে। একটি কম্পিউট সীমাবদ্ধতার সাপেক্ষে ক্ষতি কম করা (কম্পিউট মোটামুটিভাবে N বার D এর সমানুপাতিক) ফলাফল দেয় যে অনুকূল N এবং D উভয়ই অনুরূপ সূচক সহ গণনার শক্তি হিসাবে বৃদ্ধি পায়, তাই গণনা-অনুকূল অনুপাত প্রতি প্যারামিটারে 20 টোকেনের কাছাকাছি থাকে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

চিনচিলা স্কেলিং আইনের ভবিষ্যত

চিনচিলা প্যারামিটার গণনা থেকে ক্ষেত্রটিকে অনেক বেশি উচ্চ-মানের ডেটা ফিডিং মডেলগুলিতে স্থানান্তরিত করেছে, এবং আধুনিক মডেলগুলি প্রায়শই অনুমানকে সস্তা করার জন্য 'কম্পিউট-অপ্টিমাল' পয়েন্টকে ভালভাবে প্রশিক্ষণ দেয়। উচ্চ-মানের ওয়েব টেক্সট দুষ্প্রাপ্য হয়ে পড়ায়, স্কেলিং ধরে রাখতে ডেটা কিউরেশন, সিন্থেটিক ডেটা, একাধিক যুগ এবং মাল্টিমোডাল ডেটার দিকে মনোযোগ দেওয়া হচ্ছে। মূল পাঠটি স্থায়ী হয়: ডেটা এবং পরামিতিগুলি অবশ্যই ভারসাম্যপূর্ণ হতে হবে এবং শুধুমাত্র কাঁচা আকার আর লক্ষ্য নয়।

বাস্তব-বিশ্ব বাস্তবায়ন

ডিপমাইন্ডের 70B-প্যারামিটার চিনচিলা অনেক বেশি ডেটার প্রশিক্ষণের মাধ্যমে সমান কম্পিউট ব্যবহার করে বেঞ্চমার্কে 280B গোফারকে পরাজিত করেছে

স্ক্র্যাচ মডেলের পরিকল্পনা করার সময় প্রতি প্যারামিটারে মোটামুটি 20টি প্রশিক্ষণ টোকেন বাজেট করার জন্য দলকে গাইড করা

LLaMA-এর মতো ছোট, ডেটা-সমৃদ্ধ মডেলগুলিকে সমর্থন করা যা অনুমান সময়ে চালানোর জন্য সস্তা

একটি পরিকল্পিত মডেল 'আন্ডারট্রেইনড' কিনা এবং অতিরিক্ত প্যারামিটারের চেয়ে অতিরিক্ত ডেটা থেকে বেশি উপকৃত হবে কিনা তা অনুমান করা

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

নিউরাল নেটওয়ার্কের জন্য স্কেলিং আইন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Chinchilla Scaling Laws?

2022 সালে ডিপমাইন্ড থেকে চিনচিলা স্কেলিং আইন দেখায় যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষণপ্রাপ্ত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য, আপনার মডেলের আকার এবং প্রশিক্ষণের ডেটা মোটামুটি সমান অনুপাতে স্কেল করা উচিত। এটি গুরুত্বপূর্ণ কারণ এটি 'অনুকূল' মডেলের আকারের অর্থ কী তা পুনরায় সংজ্ঞায়িত করেছে এবং ল্যাবগুলি কীভাবে গণনা ব্যয় করে তা পুনরায় আকার দিয়েছে।

চিনচিলা স্কেলিং আইনের কেন্দ্রীয় অনুসন্ধান কী ছিল?

চিনচিলা দেখিয়েছে যে একটি নির্দিষ্ট কম্পিউট বাজেটের জন্য, প্যারামিটার এবং প্রশিক্ষণ টোকেনগুলি একসাথে বৃদ্ধি করা উচিত, মোটামুটি 1-থেকে-1।

চিনচিলা প্রতি প্যারামিটারে আনুমানিক কতগুলি প্রশিক্ষণ টোকেন কম্পিউট-অনুকূল বলে পরামর্শ দিয়েছে?

কম্পিউট-অনুকূল অনুপাত প্রতিটি মডেল প্যারামিটারের জন্য মোটামুটি 20টি প্রশিক্ষণ টোকেনে কাজ করে।

চিনচিলা অনেক ছোট হওয়া সত্ত্বেও কোন মডেলকে ছাড়িয়ে গেছে?

70B-প্যারামিটার চিনচিলা একই গণনা ব্যবহার করে ডিপমাইন্ডের নিজস্ব 280B-প্যারামিটার গোফারকে পরাজিত করেছে, কারণ এটি অনেক বেশি ডেটার উপর প্রশিক্ষিত।

চিনচিলা সেই সময়ে GPT-3 এর মতো মডেল সম্পর্কে কী বোঝায়?

সেই যুগের অনেক বড় মডেলকে প্রশিক্ষণ দেওয়া হয়েছিল, যার অর্থ তারা তাদের প্যারামিটার গণনার জন্য অনেক বেশি ডেটা দিয়ে আরও ভাল পারফর্ম করতে পারত।

চিনচিলা বিশ্লেষণে মোটামুটিভাবে কীভাবে গণনা করা হয়েছিল?

ট্রেনিং কম্পিউট (FLOPs) প্রশিক্ষণ টোকেনের সংখ্যা দ্বারা গুণিত প্যারামিটারের সংখ্যার প্রায় সমানুপাতিক।