কি হয়েছে
22শে আগস্ট arXiv-এ জমা দেওয়া একটি পেপার MoEXBench প্রবর্তন করে, যা বিশেষজ্ঞদের বৃহৎ ভাষার মডেলের মিশ্রণের জন্য একটি সম্মিলিত স্থাপনার কর্মপ্রবাহ হিসাবে একাধিক কম্প্রেশন কৌশল মূল্যায়ন করার জন্য একটি মানদণ্ড। এটি 30 বিলিয়ন থেকে 235 বিলিয়ন মোট প্যারামিটার পর্যন্ত 10টি মডেল জুড়ে বিশেষজ্ঞ ছাঁটাই, ওজন পরিমাপকরণ এবং কেভি-ক্যাশে কম্প্রেশন পরীক্ষা করে, বিভিন্ন মনোযোগ আর্কিটেকচার এবং কম্প্রেশন সেটিংস ব্যবহার করে।
কাগজটি বিশেষজ্ঞদের মিশ্রণ, বা MoE, ভাষার মডেলগুলিতে ফোকাস করে। এই সিস্টেমগুলিতে একাধিক বিশেষজ্ঞ উপাদান রয়েছে এবং স্পার্স অ্যাক্টিভেশন ব্যবহার করে যাতে মডেলের শুধুমাত্র একটি অংশ প্রদত্ত ইনপুটের জন্য ব্যবহার করা হয়। উত্সটি বলে যে এই পদ্ধতিটি মডেলের ক্ষমতা দক্ষতার সাথে স্কেল করতে পারে, তবে এটি স্থাপনার সমস্যাও তৈরি করে কারণ সম্পূর্ণ বিশেষজ্ঞ প্যারামিটার ফুটপ্রিন্ট বড় থাকে, রাউটিং ভারসাম্যহীন হতে পারে এবং দীর্ঘ-প্রসঙ্গ অনুমানের জন্য ব্যবহৃত মূল-মান ক্যাশে যথেষ্ট পরিমাণে বৃদ্ধি পেতে পারে। কাগজটি বিচ্ছিন্নভাবে প্রয়োগ করা একক কৌশল হিসাবে না হয়ে, একসাথে বেশ কয়েকটি সীমাবদ্ধতা জড়িত একটি স্থাপনার সমস্যা হিসাবে কম্প্রেশনকে বিবেচনা করে।
MoEXBench কম্প্রেশনের তিনটি রূপ মূল্যায়ন করে। বিশেষজ্ঞ ছাঁটাই অপ্রয়োজনীয় হিসাবে কাগজ দ্বারা বর্ণিত বিশেষজ্ঞদের অপসারণ. ওজন পরিমাপকরণ 1 থেকে 16 বিট পর্যন্ত পরীক্ষিত সেটিংস সহ মডেল ওজন সঞ্চয় করতে ব্যবহৃত সংখ্যাসূচক নির্ভুলতা হ্রাস করে। কেভি-ক্যাশে কম্প্রেশন দীর্ঘ প্রসঙ্গগুলির সাথে সম্পর্কিত মেমরির চাপকে হ্রাস করে এবং বেঞ্চমার্কে একাধিক ক্যাশে-নির্ভুলতা সেটিংস অন্তর্ভুক্ত থাকে। লেখকরা এই পদ্ধতিগুলিকে আলাদাভাবে এবং সংমিশ্রণে মূল্যায়ন করেন, কর্মপ্রবাহ সহ যেখানে একই মডেলে একাধিক কম্প্রেশন প্রয়োগ করা হয়।
বেঞ্চমার্ক 30 বিলিয়ন থেকে 235 বিলিয়ন মোট প্যারামিটার পর্যন্ত 10টি MoE মডেল কভার করে। সূত্রটি বলে যে সেটটিতে স্ট্যান্ডার্ড-মনোযোগ, হাইব্রিড লিনিয়ার-অ্যাটেনশন এবং স্লাইডিং-উইন্ডো-অ্যাটেনশন আর্কিটেকচার অন্তর্ভুক্ত রয়েছে। বিশেষজ্ঞ-ছাঁটাইয়ের হার 20% থেকে 50% পর্যন্ত। মূল্যায়ন স্যুটে আটটি মডিউল রয়েছে যা সম্মিলিত-সংকোচনের গুণমান, কাজের চাপ এবং স্থাপত্য জুড়ে দৃঢ়তা, ছাঁটাইয়ের সংবেদনশীলতা, পরিমাপকরণ এবং ক্যাশে সেটিংস এবং পণ্য হার্ডওয়্যারে স্থাপনার দক্ষতা পরিমাপ করার উদ্দেশ্যে।
কাগজটি এই মূল্যায়ন থেকে বেশ কয়েকটি ফলাফলের প্রতিবেদন করেছে। সম্মিলিত কম্প্রেশন প্রতিটি পৃথক পদ্ধতির কর্মক্ষমতা থেকে ভবিষ্যদ্বাণী করা যায় না, এবং সামগ্রিক কম্প্রেশন হার নির্ভরযোগ্যভাবে গুণমান হ্রাস বা রানটাইম উন্নতির পূর্বাভাস দেয় না। বিশেষজ্ঞ ছাঁটাই অবক্ষয়ের প্রধান উৎস হিসাবে রিপোর্ট করা হয়। লেখকরা আরও সতর্ক করেছেন যে গড় মানের স্কোর ব্যর্থতাগুলিকে গোপন করতে পারে যা নির্দিষ্ট কাজের চাপ বা আর্কিটেকচারের জন্য নির্দিষ্ট। MoEXBench একটি পুনরুত্পাদনযোগ্য বেঞ্চমার্ক হিসাবে উপস্থাপিত হয়, যার মধ্যে সাধারণ মডিউল স্কোর, সংকুচিত শিল্পকর্ম এবং স্ক্রিপ্টগুলি MoE পরিবার এবং হার্ডওয়্যার ব্যাকএন্ড জুড়ে তুলনা সমর্থন করার জন্য প্রকাশিত হয়।
কেন এটা গুরুত্বপূর্ণ
বিশেষজ্ঞদের মিশ্রণের মডেলগুলি একটি বৃহৎ মোট প্যারামিটার ক্ষমতা বজায় রেখে প্রতিটি টোকেনের জন্য ব্যবহৃত গণনার পরিমাণ হ্রাস করতে পারে, তবে তাদের মেমরি এবং পরিবেশন প্রয়োজনীয়তা এখনও পণ্য হার্ডওয়্যারে স্থাপন করা কঠিন করে তুলতে পারে। কাগজের কেন্দ্রীয় অনুসন্ধান হল যে কম্প্রেশন পদ্ধতিগুলি এমনভাবে ইন্টারঅ্যাক্ট করে যেগুলি স্বতন্ত্র মূল্যায়নগুলি মিস করতে পারে, বিশেষজ্ঞ ছাঁটাইকে লেখকের বেঞ্চমার্কে গুণমান অবনতির প্রধান উত্স হিসাবে চিহ্নিত করা হয়।
কাজের ব্যবহারিক মূল্য নিহিত রয়েছে স্থাপনার সিদ্ধান্তের উপর ফোকাস করার মধ্যে। একটি মডেল যা একটি কম্প্রেশন ধাপের পরে গ্রহণযোগ্য বলে মনে হয় তা ভিন্নভাবে আচরণ করতে পারে যখন অতিরিক্ত মেমরি-সংরক্ষণ কৌশলগুলি উপরে স্তরিত হয়। সীমিত হার্ডওয়্যারে বৃহৎ ভাষার মডেল পরিবেশন করার চেষ্টা করা সংস্থাগুলির জন্য, এই মিথস্ক্রিয়া কোনও সিস্টেম মেমরিতে ফিট করে কিনা, যথেষ্ট দ্রুত প্রতিক্রিয়া জানায় বা গ্রহণযোগ্য আউটপুট গুণমান সংরক্ষণ করে কিনা তা প্রভাবিত করতে পারে। উত্সটি স্থাপন করে না যে MoEXBench সেই স্থাপনার সমস্যাগুলি সমাধান করে, তবে এটি তাদের একসাথে পরিমাপের জন্য একটি কাঠামো সরবরাহ করে।
ফলাফলগুলি একটি সহজ অনুমানকে চ্যালেঞ্জ করে যে কম্প্রেশন পদ্ধতিগুলি স্বাধীনভাবে নির্বাচন করা যেতে পারে এবং তাদের প্রভাবগুলি একসাথে যুক্ত করা যেতে পারে। কাগজ অনুসারে, মিলিত ফলাফল ছাঁটাই, পরিমাপকরণ এবং কেভি-ক্যাশে কম্প্রেশনের মধ্যে মিথস্ক্রিয়াগুলির উপর নির্ভর করে। এটি গুরুত্বপূর্ণ কারণ একটি স্থাপনার দল অন্যথায় পৃথক বেঞ্চমার্ক ফলাফলের উপর ভিত্তি করে সেটিংস বেছে নিতে পারে এবং মানের ক্ষতি বা রানটাইম লাভকে অত্যধিক মূল্যায়ন করতে পারে। পেপারের বিশেষজ্ঞ ছাঁটাইয়ের আধিপত্যের প্রতিবেদনটি অনুশীলনকারীদের আচরণের বিরুদ্ধে মডেলের আকারের ভারসাম্য বজায় রাখার সময় যাচাই করার জন্য একটি কংক্রিট পরিবর্তনশীল দেয়।
কাজের চাপ এবং আর্কিটেকচার-নির্দিষ্ট ব্যর্থতার প্রতি বেঞ্চমার্কের মনোযোগ মূল্যায়ন অনুশীলনের জন্য গুরুত্বপূর্ণ। টাস্ক জুড়ে একটি গড় স্কোর পরামর্শ দিতে পারে যে একটি সংকুচিত মডেল স্থিতিশীল থাকে যখন এক ধরণের কাজের চাপ বা একটি মনোযোগ ডিজাইনের গুরুতর দুর্বলতা অস্পষ্ট করে। এই মাত্রাগুলিকে আলাদা করে, কাগজটি গবেষক এবং প্রকৌশলীদেরকে একটি সমষ্টি সংখ্যার উপর নির্ভর না করে একটি সংকুচিত MoE মডেল কোথায় ব্যর্থ হয় সে সম্পর্কে আরও নির্দিষ্ট প্রশ্ন জিজ্ঞাসা করতে সাহায্য করতে পারে।
ফলাফলের তাৎপর্যের সীমাবদ্ধতা রয়েছে। এটি একটি arXiv প্রিপ্রিন্ট, এবং উত্সটি রিপোর্ট করা তুলনার জন্য কোনও স্বাধীন বৈধতা, পিয়ার-রিভিউ স্ট্যাটাস বা বিশদ প্রমাণ সরবরাহ করে না। বিমূর্তটি 10টি মডেল শনাক্ত করে না, কাজের চাপ বা হার্ডওয়্যার ব্যাকএন্ডের নাম দেয়, গুণমান হ্রাসের পরিমাণ নির্ধারণ করে, বা কংক্রিট লেটেন্সি এবং মেমরির পরিসংখ্যান প্রতিবেদন করে না। তাই এটি এই উপসংহারটিকে সমর্থন করে যে লেখকরা উল্লিখিত ফলাফলগুলির সাথে একটি পদ্ধতিগত বেঞ্চমার্ক তৈরি করেছেন এবং পরিচালনা করেছেন, তবে কোন কম্প্রেশন সেটিংস উত্পাদন সিস্টেমের জন্য সর্বোত্তম সে সম্পর্কে বিস্তৃত দাবি নয়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
প্রধান খোলা প্রশ্ন হল MoEXBench-এর ফলাফলগুলি পরীক্ষিত মডেল, কাজের চাপ, আর্কিটেকচার এবং হার্ডওয়্যার ব্যাকএন্ডের বাইরে সাধারণীকরণ করে কিনা। উত্সটি বিশদ মডেল-বাই-মডেল ফলাফল, নিখুঁত নির্ভুলতা পরিবর্তন, বিলম্ব পরিমাপ বা উত্পাদন স্থাপনা থেকে প্রমাণ সরবরাহ করে না। ফলো-আপ কাজের জন্য প্রকাশিত শিল্পকর্ম এবং স্ক্রিপ্টগুলি স্বাধীনভাবে পরীক্ষা করা উচিত এবং বেঞ্চমার্কের স্বাভাবিক স্কোরগুলি প্রকৃত ব্যবহারকারী-মুখী কর্মক্ষমতার পূর্বাভাস দেয় কিনা তা পরীক্ষা করা উচিত।
প্রথম দরকারী পরীক্ষা হবে প্রজননযোগ্যতা। লেখকরা বলছেন যে তারা স্বাভাবিক স্কোর, সংকুচিত শিল্পকর্ম এবং পুনরুত্পাদনযোগ্য স্ক্রিপ্ট প্রকাশ করছে। স্বাধীন গবেষক এবং স্থাপনার দলগুলি পরীক্ষা করতে পারে যে সেই উপকরণগুলি রিপোর্ট করা মিথস্ক্রিয়াগুলি পুনরুত্পাদন করে কিনা এবং স্কোরিং মডিউলগুলি মডেলগুলির তুলনা করার জন্য যথেষ্ট পরিষ্কার কিনা। উত্সটি নির্দিষ্ট করে না কোথায় উপকরণগুলি হোস্ট করা হয়েছে বা তাদের লাইসেন্সিং বর্ণনা করে, তাই ব্যবহারিক অ্যাক্সেসযোগ্যতা একটি অজানা থেকে যায়৷
ভবিষ্যত মূল্যায়ন নির্ধারণ করা উচিত যে ফলাফলগুলি নির্বাচিত মডেল এবং কাজের চাপের জন্য কতটা সংবেদনশীল। বেঞ্চমার্ক একটি উল্লেখযোগ্য পরামিতি পরিসীমা এবং বেশ কয়েকটি মনোযোগের আর্কিটেকচারকে বিস্তৃত করে, কিন্তু উত্সটি বলে না যে 10টি মডেল বিস্তৃত MoE ইকোসিস্টেমের কতটা প্রতিনিধিত্বশীল। এটাও বলে না যে ওয়ার্কলোড সেটে কথোপকথন, কোডিং, বহুভাষিক, পুনরুদ্ধার-ভারী বা অন্যান্য উত্পাদন নিদর্শন অন্তর্ভুক্ত রয়েছে কিনা। এই বিবরণগুলি কতটা ব্যাপকভাবে উপসংহার প্রয়োগ করা যেতে পারে তা প্রভাবিত করবে।
বেঞ্চমার্ক স্কোর এবং ব্যবহারকারী-মুখী আচরণের মধ্যে সম্পর্ক মনোযোগের দাবি রাখে। বিমূর্তটি বলে যে MoEXBench গুণমান, দৃঢ়তা এবং স্থাপনার দক্ষতা পরিমাপ করে, কিন্তু এটি অন্তর্নিহিত মেট্রিক্স প্রদান করে না বা দেখায় না যে এর স্বাভাবিক মডিউল স্কোরগুলি মানুষের বিচার, কার্য সমাপ্তি বা পরিষেবা-স্তরের উদ্দেশ্যগুলির সাথে সম্পর্কযুক্ত কিনা। ফলো-আপ অধ্যয়নগুলি একই হার্ডওয়্যার এবং সফ্টওয়্যার অবস্থার অধীনে পরম মেমরি ব্যবহার, লেটেন্সি, থ্রুপুট এবং গুণমান পরিবর্তনের রিপোর্ট করা উচিত।
লেখকদের ফলাফলে ছাঁটাই সবচেয়ে ফলপ্রসূ ঝুঁকির কারণ বলে মনে হয়, তবে উপযুক্ত ছাঁটাই স্তর বিশেষজ্ঞদের কীভাবে পথ দেখানো হয় এবং কাজের চাপ দেওয়া হয় তার উপর নির্ভর করতে পারে। কাগজটি 20% থেকে 50% ছাঁটাইতে পরীক্ষার রিপোর্ট করে, তবুও উত্সটি একটি নিরাপদ থ্রেশহোল্ড সনাক্ত করে না বা দাবি করে না যে কোনও সেটিং সর্বজনীনভাবে গুণমান রক্ষা করে। পাঠকদের ফলাফলগুলিকে পরিমাপের নির্দেশিকা হিসাবে বিবেচনা করা উচিত, একটি স্থাপনার রেসিপি হিসাবে নয়। এটিও অজানা যে নতুন MoE আর্কিটেকচার বা বিভিন্ন ক্যাশে বাস্তবায়ন একই মিথস্ক্রিয়া দেখাবে কিনা।