চিনচিলা কম্পিউট - সর্বোত্তম প্রশিক্ষণ
চিনচিলা হল একটি 2022 ডিপমাইন্ড যা খুঁজে পেয়েছে যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষিত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য আপনাকে প্যারামিটার এবং ডেটা মোটামুটি সমানভাবে স্কেল করা উচিত, কেবল একটি বড় মডেল তৈরি করা উচিত নয়।
ওভারভিউ
It reshaped how the industry balances model size against training data.
গভীর ডুব
ডিপমাইন্ডের চিনচিলা পেপার স্কেলিংয়ের পুনর্বিবেচনা করেছে এবং গণনা-অনুকূল ভারসাম্য খুঁজে পেতে 400 টিরও বেশি মডেলকে প্রশিক্ষণ দিয়েছে। থাম্বের শিরোনাম নিয়ম: মডেলের আকার এবং প্রশিক্ষণ টোকেনগুলি লকস্টেপে বৃদ্ধি পাবে, প্রতি প্যারামিটারে প্রায় 20টি প্রশিক্ষণ টোকেন। এটি প্রমাণ করার জন্য, তারা চিনচিলাকে প্রশিক্ষণ দিয়েছে, একটি 70-বিলিয়ন-প্যারামিটার মডেল 1.4 ট্রিলিয়ন টোকেনে, একই গণনা ব্যবহার করে 280-বিলিয়ন-প্যারামিটার গোফার অনেক কম টোকেনে প্রশিক্ষিত। চিনচিলা, চারগুণ ছোট হওয়া সত্ত্বেও, প্রায় প্রতিটি বেঞ্চমার্কে Gopher, GPT-3 এবং অন্যান্য জায়ান্টকে ছাড়িয়ে গেছে। পাঠটি পূর্বের OpenAI উপসংহারটিকে উল্টে দিয়েছে যে ডেটার চেয়ে আকারকে পছন্দ করে, দেখায় যে অনেকগুলি ফ্ল্যাগশিপ মডেল খুব বড় এবং খুব ডেটা-ক্ষুধার্ত হয়ে টেবিলে কার্যক্ষমতা ছেড়ে দিচ্ছে৷
প্রযুক্তিগত অন্তর্দৃষ্টি
চিনচিলা ফিট লস হিসাবে L(N,D) = E + A·N^(-α) + B·D^(-β), সঙ্গে α এবং β উভয়ই 0.34 এর কাছাকাছি, মানে প্যারামিটার এবং ডেটা প্রায় প্রতিসাম্যভাবে অবদান রাখে। একটি নির্দিষ্ট গণনা সীমাবদ্ধতার অধীনে এটিকে অপ্টিমাইজ করা (ট্রান্সফরমারের জন্য গণনা ≈ 6·N·D) সমান-স্কেলিং ফলাফল দেয়। একটি ছোট, ডেটা-সমৃদ্ধ মডেল অনুমানে চালানোর জন্যও সস্তা, তাই এর সুবিধা কেবল প্রশিক্ষণ নয়, স্থাপনার ক্ষেত্রে যৌগিক।
কৌশলগত প্রভাব
সুস্পষ্ট সিদ্ধান্ত
এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।
খরচ ও বাজেট
অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।
টিম এবং ওয়ার্কফ্লো
ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।
চিনচিলা কম্পিউট-অনুকূল প্রশিক্ষণের ভবিষ্যত
Llama 3-এর মতো আধুনিক মডেলগুলি ইচ্ছাকৃতভাবে চিনচিলার 20-টোকেন-প্রতি-প্যারামিটার অনুপাতকে বহুদূর এগিয়ে নিয়ে যায়, অনুমানকে সস্তা করার জন্য ট্রিলিয়ন টোকেনে ছোট মডেলকে প্রশিক্ষণ দেয়, সাবঅপ্টিমাল ট্রেনিং কম্পিউট গ্রহণ করে। ভালো ডেটার অভাব বাড়ার সাথে সাথে, পুনরাবৃত্ত যুগ, সিন্থেটিক ডেটা এবং গুণমান ফিল্টারিংয়ের প্রতি আগ্রহ বাড়ছে। চিনচিলা রেফারেন্স পয়েন্ট থেকে যায়, কিন্তু সর্বোত্তম ক্রমবর্ধমান আজীবন অনুমান খরচের উপর নির্ভর করে, শুধুমাত্র এককালীন প্রশিক্ষণ বাজেট নয়।
বাস্তব-বিশ্ব বাস্তবায়ন
একই বাজেটের জন্য খুব কম ডেটাতে 30-বিলিয়ন মডেলের পরিবর্তে 2 ট্রিলিয়ন টোকেনে 7-বিলিয়ন-প্যারামিটার মডেলকে প্রশিক্ষণ দেওয়া বেছে নেওয়া।
অনুমান করা হচ্ছে যে একটি 10-বিলিয়ন-প্যারামিটার মডেল কম্পিউট-অনুকূল মিষ্টি স্পট আঘাত করার জন্য প্রায় 200 বিলিয়ন টোকেন চায়।
একটি বৃহত্তর প্রতিদ্বন্দ্বীর গুণমানের সাথে মেলে প্রতি-কোয়েরি অনুমানের খরচ কমানোর জন্য একটি ছোট মোতায়েন করা মডেলকে সমর্থন করা।
একটি বিদ্যমান মডেলের অডিট করা এবং উপসংহারে এটিকে প্রশিক্ষণ দেওয়া হয়েছে, তারপর প্যারামিটার বৃদ্ধির পরিবর্তে একটি দীর্ঘ প্রশিক্ষণ চালানোর পরিকল্পনা করুন।
ঝুঁকি এবং প্রহরী
বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।
বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।
ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।
বাস্তবায়ন রোডম্যাপ
আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।
পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।
একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷
নথি যেখানে চিনচিলা কম্পিউট-অপ্টিমাল ট্রেনিং সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
টেস্ট-টাইম ট্রেনিং
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Chinchilla Compute-Optimal Training?
চিনচিলা হল একটি 2022 ডিপমাইন্ড যা খুঁজে পেয়েছে যে বেশিরভাগ বড় ভাষার মডেলগুলি খারাপভাবে প্রশিক্ষিত ছিল: একটি নির্দিষ্ট গণনা বাজেটের জন্য আপনাকে প্যারামিটার এবং ডেটা মোটামুটি সমানভাবে স্কেল করা উচিত, কেবল একটি বড় মডেল তৈরি করা উচিত নয়। প্রশিক্ষণ ডেটার বিপরীতে শিল্প কীভাবে মডেলের আকারকে ভারসাম্যপূর্ণ করে তা পুনরায় আকার দিয়েছে।
গণনা-অনুকূল প্রশিক্ষণের জন্য চিনচিলার বিখ্যাত নিয়ম কি?
ডিপমাইন্ড পাওয়া প্যারামিটার এবং টোকেনগুলিকে একটি প্রদত্ত গণনা বাজেটের জন্য প্রতি প্যারামিটারে প্রায় 20 টোকেন একসাথে স্কেল করা উচিত।
কিভাবে 70B-প্যারামিটার চিনচিলা 280B-প্যারামিটার গোফারের সাথে তুলনা করেছে?
একই কম্পিউটের সাথে অনেক বেশি টোকেনে প্রশিক্ষিত, চিনচিলা বেশিরভাগ বেঞ্চমার্ক জুড়ে অনেক বড় গোফারকে পরাজিত করেছে।
চিনচিলা কাগজটি পূর্বের বড় মডেলগুলি সম্পর্কে কী কী সমস্যা প্রকাশ করেছিল?
GPT-3 এবং গোফারের মতো মডেলগুলি তাদের প্রশিক্ষণের ডেটার তুলনায় অনেক বড় ছিল, যার ফলে কর্মক্ষমতা অবাস্তব ছিল।
চিনচিলা নিয়মটি 10-বিলিয়ন-প্যারামিটার মডেলের জন্য মোটামুটি কতগুলি টোকেন প্রস্তাব করে?
প্রতি প্যারামিটারে 20 টোকেন, 10 বিলিয়ন প্যারামিটার প্রায় 200 বিলিয়ন প্রশিক্ষণ টোকেন বোঝায়।
প্রশিক্ষণের দক্ষতা ছাড়াও, কেন একটি ছোট, ডেটা সমৃদ্ধ মডেল স্থাপনার ক্ষেত্রে আকর্ষণীয়?
কম প্যারামিটার মানে কম প্রতি-কোয়েরি কম্পিউট, তাই সঞ্চয় যৌগ প্রতিবার মডেল ব্যবহার করা হয়।