কি হয়েছে
একটি নতুন arXiv প্রিপ্রিন্ট এমন পদ্ধতিগুলিকে মূল্যায়ন করে যা বৃহৎ ভাষা মডেল অনুমানের সময় কিছু ট্রান্সফরমার স্তরগুলি এড়িয়ে যায়। লেখকরা ভ্যানিলা অটোরিগ্রেসিভ ডিকোডিংকে ConfLayers-এর সাথে তুলনা করেছেন, একটি কনফিডেন্স-গেটেড প্রারম্ভিক-প্রস্থান পদ্ধতি এবং SWIFT, একটি স্ব-অনুমানমূলক ডিকোডিং পদ্ধতি, Qwen2.5-0.5B এবং Qwen2.5-1.5B জুড়ে, GSM8K যুক্তি এবং CNN/DailyMail টাস্ক মারাইজেশন যোগ।
প্রিপ্রিন্ট উপস্থাপন করে যাকে বলা হয় কঠোর-মিলিত, পর্যায়ক্রমিক-পদক্ষেপ স্তর-এড়িয়ে যাওয়ার পদ্ধতির তিন-বীজ নিরীক্ষা। এই সিস্টেমগুলি একটি ইনপুটের জন্য কোন ট্রান্সফরমার স্তরগুলি কার্যকর করতে হবে তা নির্ধারণ করে এবং প্রতি কয়েক প্রজন্মের ধাপে সেই সিদ্ধান্তটি পুনর্বিবেচনা করে। তুলনার মধ্যে রয়েছে ভ্যানিলা অটোরিগ্রেসিভ ডিকোডিং, কনফলেয়ার এবং সুইফট। ConfLayers কে একটি আত্মবিশ্বাস-প্রস্তুত প্রারম্ভিক-প্রস্থান বেসলাইন হিসাবে বর্ণনা করা হয়েছে, যখন SWIFT কে প্রকৃত স্ব-অনুমানমূলক ডিকোডিং হিসাবে বর্ণনা করা হয়েছে। লেখকরা দুটি Qwen2.5 মডেল স্কেল, 0.5 বিলিয়ন এবং 1.5 বিলিয়ন প্যারামিটারে এবং দুটি কাজের উপর উভয় পদ্ধতির মূল্যায়ন করেন: GSM8K যুক্তি এবং CNN/DailyMail সারসংক্ষেপ।
কাগজটি রিপোর্ট করেছে যে SWIFT ছিল চারটি মডেল-এবং-টাস্ক সংমিশ্রণের তিনটিতে নির্ভুলতার সবচেয়ে শক্তিশালী পদ্ধতি। 1.5B স্কেলে GSM8K-তে বিশেষ করে বড় ঘাটতি সহ, প্রতিটি কোষে কনফলেয়ারের প্রাধান্য ছিল বলে জানা গেছে। উৎসটি সরবরাহ করা পাঠ্যের নির্ভুলতার মানের সম্পূর্ণ সারণী প্রদান করে না, তাই সঠিক মার্জিন এখানে স্বাধীনভাবে বলা যাবে না। কেন্দ্রীয় ফলাফল তাই লেখকের তুলনামূলক র্যাঙ্কিং দাবি করার পরিবর্তে যে কোনও পদ্ধতিই সমস্ত ভাষার মডেল বা কাজের চাপে সর্বজনীনভাবে উচ্চতর।
অডিটের একটি মূল অংশ অনলাইন-সার্চ ওভারহেডকে মডেলটি চালানোর খরচ থেকে আলাদা করে। সেই পরিমাপে, লেখকরা রিপোর্ট করেছেন যে SWIFT-এর বিশুদ্ধ অনুমান গতি চারটি কক্ষে ConfLayers-এর তুলনায় 5% থেকে 21% বেশি ছিল, তিনটি ক্ষেত্রে নিরীহ প্রাচীর-ঘড়ি র্যাঙ্কিংকে উল্টে দেয়। ConfLayers-এর সার্চ ওভারহেড ছোট এবং স্থিতিশীল হিসাবে রিপোর্ট করা হয়েছে, খরচের 1% থেকে 2%, যখন SWIFT-এর বৃহত্তর এবং আরও পরিবর্তনশীল, 28.7% পর্যন্ত পৌঁছেছে। কাগজটিতে লেয়াররুট এবং লেয়ারড্রপের একটি সম্পূরক বিশ্লেষণও রয়েছে, দুটি প্রশিক্ষিত-রাউটিং পদ্ধতি যা মোটা দানাদারিতে সিদ্ধান্ত নেয়। লেখক যাকে একটি যাচাইকৃত প্রোটোকল বলে তার অধীনে, উভয়ই 1.08x থেকে 1.33x এর পরিমিত গতি তৈরি করেছিল, কিন্তু তাদের যথার্থতা পর্যায়ক্রমিক-পদক্ষেপ পদ্ধতির চেয়ে কম ছিল। LayerRoute-এর রিপোর্ট করা মানে 1.5B-তে GSM8K-তে সঠিক মিল ছিল তিনটি বীজ জুড়ে 0.003।
কেন এটা গুরুত্বপূর্ণ
কাগজটি যুক্তি দেয় যে দক্ষতার তুলনা বিভ্রান্তিকর হতে পারে যখন অনলাইন অনুসন্ধান খরচ এবং প্রকৃত অনুমান খরচ তাদের আলাদা না করে একত্রিত করা হয়। এর ফলাফলগুলি পরামর্শ দেয় যে প্রাচীর-ঘড়ির পরিমাপগুলিতে দ্রুত প্রদর্শিত একটি পদ্ধতি কম কার্যকর হতে পারে একবার কোন স্তরগুলি এড়িয়ে যেতে হবে তা নির্ধারণ করার জন্য হিসাব করা হয়৷
ব্যবহারিক সমস্যা হল যে অনুমান দক্ষতার একাধিক উপাদান রয়েছে। একটি লেয়ার-স্কিপিং পদ্ধতি নিউরাল-নেটওয়ার্ক কম্পিউটেশনের পরিমাণ কমাতে পারে যখন একটি পৃথক সিদ্ধান্ত প্রক্রিয়া যোগ করে যা কি চালানো হবে তা বেছে নেয়। যদি মূল্যায়ন শুধুমাত্র এন্ড-টু-এন্ড প্রাচীর-ঘড়ির সময়, অথবা শুধুমাত্র কার্যকর করা মডেল স্তরগুলির খরচের রিপোর্ট করে, তাহলে তারা বিভিন্ন র্যাঙ্কিং তৈরি করতে পারে। কাগজের তুলনা এই পরিমাপের সমস্যাটিকে হাইলাইট করে এবং দক্ষতার দাবিগুলিকে আরও সরাসরি তুলনাযোগ্য করার উদ্দেশ্যে একটি প্রোটোকল সরবরাহ করে।
ভাষা মডেল পরিবেশনকারী অপারেটরদের জন্য, রিপোর্ট করা ফলাফলগুলি নির্দেশ করে যে কার্যকর করা স্তরগুলি হ্রাস করা নিজেই যথেষ্ট নয়। নির্ভুলতা, সিদ্ধান্তের ওভারহেড, এবং কণিকা যেখানে রাউটিং ঘটে তা সব বিষয়। একটি পরিমিত কম্পিউটেশনাল শর্টকাট সহ একটি পদ্ধতি অআকর্ষণীয় হতে পারে যদি এর গুণমান যুক্তির কাজগুলিতে তীব্রভাবে পড়ে। বিপরীতভাবে, উচ্চতর অনুসন্ধান খরচ সহ একটি পদ্ধতি এখনও পছন্দনীয় হতে পারে যদি এটি আরও নির্ভুলতা ধরে রাখে এবং পরীক্ষা করা সেটআপের অধীনে আরও ভাল বিশুদ্ধ অনুমান গতি সরবরাহ করে। এগুলি রিপোর্ট করা পরীক্ষা-নিরীক্ষার প্রভাব, প্রমাণ নয় যে কোনও নির্দিষ্ট পদ্ধতি উৎপাদনে খরচ কমিয়ে দেবে।
গবেষণাটি মূল্যায়ন প্রোটোকলের সাথে মিল না করে অনলাইন, পর্যায়ক্রমিক-পদক্ষেপ পদ্ধতির সাথে প্রশিক্ষিত-রাউটিং সিস্টেমের তুলনা করার ঝুঁকিগুলিকেও চিত্রিত করে। লেখক বলেছেন যে তারা সম্পূরক বিশ্লেষণের জন্য একটি প্রকৃত পূর্ণ-মডেল বেসলাইন, প্রকৃত প্রতি-ইনপুট গেটিং এবং প্রকৃত অনুমান-সময় গণনা স্কিপিং ব্যবহার করেছেন। এই নিয়ন্ত্রণগুলি গুরুত্বপূর্ণ কারণ একটি নামমাত্র স্পার্স বা রাউটেড মডেল বাস্তব গণনা সংরক্ষণ করতে ব্যর্থ হতে পারে যদি বাস্তবায়ন এখনও এড়িয়ে যাওয়া অনেক কাজ সম্পাদন করে। একটি GSM8K সেটিং-এ LayerRoute-এর জন্য পেপারের প্রায়-পতনের রিপোর্ট আরও ইঙ্গিত করে যে গতি লাভ গুরুতর টাস্ক-নির্দিষ্ট মানের ট্রেডঅফের সাথে আসতে পারে।
দৃঢ়তার সাথে মিলে যাওয়া দক্ষতা তুলনার জন্য একটি টেমপ্লেট হিসাবে সম্পূর্ণ অডিট প্রোটোকল প্রকাশ করে উত্সটি একটি দরকারী পদ্ধতিগত অবদান প্রদান করে। এটি গবেষক এবং প্রকৌশল দলগুলিকে অনুসন্ধান ওভারহেড, অনুমান খরচ, নির্ভুলতা, মডেল স্কেল এবং টাস্ক শর্তাবলী আরও সামঞ্জস্যপূর্ণ উপায়ে প্রতিবেদন করতে সহায়তা করতে পারে। এখনও, উত্সটি প্রতিষ্ঠিত করে না যে প্রোটোকলটি অন্যান্য গবেষকরা গ্রহণ করেছেন, বা এটি বাণিজ্যিক মডেল, বিশেষ অনুমান হার্ডওয়্যার, দীর্ঘ প্রসঙ্গ, ইন্টারেক্টিভ ওয়ার্কলোড বা বাস্তব ব্যবহারকারীদের ফলাফল দেখায় না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
ফলাফলগুলি আরও মডেলের আকার, আর্কিটেকচার, কাজ, হার্ডওয়্যার সেটিংস এবং বাস্তবায়ন পরিবেশে পরীক্ষা করা দরকার। কাগজটি একটি সংস্করণ-একটি প্রিপ্রিন্ট, এবং এর সিদ্ধান্তগুলি স্বাধীন প্রতিলিপি বা উত্পাদন স্থাপনার প্রমাণের পরিবর্তে লেখকদের রিপোর্ট করা প্রোটোকলের উপর ভিত্তি করে।
সবচেয়ে গুরুত্বপূর্ণ পরবর্তী ধাপ হল দুটি Qwen2.5 মডেলের মাপ এবং দুটি মূল্যায়ন করা কাজের বাইরে প্রতিলিপি করা। GSM8K এবং CNN/DailyMail যুক্তি এবং সংক্ষিপ্তকরণের প্রতিনিধিত্ব করে, কিন্তু তারা কাজের চাপের সম্পূর্ণ পরিসীমা কভার করে না যার জন্য অনুমান দক্ষতা গুরুত্বপূর্ণ। কোডিং, বহুভাষিক প্রজন্ম, দীর্ঘ-প্রসঙ্গ পুনরুদ্ধার, টুল ব্যবহার, কাঠামোগত আউটপুট বা মাল্টিমোডাল মডেলগুলির জন্য ফলাফলগুলি ভিন্ন হতে পারে। উত্স এই ধরনের পরীক্ষার রিপোর্ট করে না.
হার্ডওয়্যার এবং সফ্টওয়্যার বাস্তবায়নও গুরুত্বপূর্ণ। সরবরাহকৃত উত্স আপেক্ষিক ওভারহেড এবং গতির প্রতিবেদন করে তবে পরীক্ষায় ব্যবহৃত হার্ডওয়্যার, রানটাইম কনফিগারেশন, ব্যাচের আকার, টোকেন-জেনারেশন সেটিংস বা স্থাপনার শর্ত সনাক্ত করে না। পরিমাপ করা ট্রেডঅফগুলি ডেটা-সেন্টার পরিবেশন, স্থানীয় অনুমান, বা অন্যান্য পরিবেশে স্থানান্তরিত হয় কিনা তা নির্ধারণের জন্য এই বিবরণগুলি প্রয়োজনীয়। উৎস দ্বারা কোন উৎপাদন খরচ, শক্তি, লেটেন্সি-সার্ভিস-লেভেল বা প্রাপ্যতার ফলাফল প্রতিষ্ঠিত হয় না।
কাগজটি একটি নিষ্পত্তিকৃত ঐক্যমতের পরিবর্তে একটি প্রিপ্রিন্ট ফলাফল হিসাবেও পড়া উচিত। এটি arXiv-এ 28 আগস্ট, 2026-এ প্রথম সংস্করণ হিসাবে জমা দেওয়া হয়েছিল এবং উত্সটি কোনও পিয়ার-রিভিউ ফলাফল বা স্বাধীন বৈধতা সনাক্ত করেনি। ConfLayers, SWIFT, LayerRoute এবং LayerDrop সম্পর্কে লেখকদের দাবি তাদের নির্বাচিত বাস্তবায়ন এবং প্রোটোকল দ্বারা আবদ্ধ। পরবর্তী সংস্করণ, বিকল্প টিউনিং পছন্দ বা বিভিন্ন রাউটিং থ্রেশহোল্ড র্যাঙ্কিং পরিবর্তন করবে কিনা তা উৎসটি বলে না।
আরও কাজ বাস্তবসম্মত কাজের চাপের অধীনে অনুসন্ধান ওভারহেড এবং মোট সিস্টেম খরচের মধ্যে সম্পর্ক স্পষ্ট করা উচিত। SWIFT-এর ওভারহেড পরিবর্তনশীল এবং 28.7% এর মতো উচ্চ হিসাবে রিপোর্ট করা হয়েছিল, যখন এর বিশুদ্ধ অনুমান গতি পরীক্ষিত কোষগুলিতে কনফলায়ার্সের চেয়ে বেশি ছিল। সেই ট্রেডঅফ সুবিধাজনক কিনা তা নির্ভর করে কাজের চাপের আকার, লেটেন্সি লক্ষ্য, হার্ডওয়্যার ব্যবহার এবং নির্ভুলতার উপর রাখা মূল্যের উপর। পাঠকদের বৃহত্তর অডিট, প্রকাশিত কোড বা বেঞ্চমার্ক আর্টিফ্যাক্ট, স্বাধীন প্রতিলিপি এবং মূল্যায়নের দিকে নজর দেওয়া উচিত যা শেষ-থেকে-এন্ড লেটেন্সি এবং পচনশীল গণনা খরচ উভয়ই রিপোর্ট করে।