সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

দক্ষ LLM অনুমানের জন্য ConfLayers থেকে অডিট SWIFT আরও সঠিক এবং দ্রুত খুঁজে পেয়েছে

একটি থ্রি-সিড অডিট রিপোর্ট করে যে SWIFT সাধারনত নির্ভুলতার উপর আস্থা-গেটেড লেয়ার এড়িয়ে যাওয়াকে ছাড়িয়ে যায় এবং অনুসন্ধান ওভারহেড আলাদা করার পরে উচ্চতর বিশুদ্ধ অনুমান গতি অর্জন করে। গবেষণায় দুটি প্রশিক্ষিত-রাউটিং পদ্ধতির জন্য পরিমিত লাভ কিন্তু যথেষ্ট নির্ভুলতার ক্ষতিও পাওয়া গেছে।

5 min readRead the primary source
Source-provided image accompanying Audit finds SWIFT more accurate and faster than ConfLayers for efficient LLM inference
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.28846
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
অনুমান
রানটাইম ফেজ যেখানে একটি প্রশিক্ষিত মডেল ভবিষ্যদ্বাণী বা আউটপুট তৈরি করে।
কনভোল্যুশনাল নিউরাল নেটওয়ার্ক (সিএনএন)
একটি নিউরাল আর্কিটেকচার যা ইমেজের মতো গ্রিডের মতো ডেটা প্রক্রিয়াকরণের জন্য অপ্টিমাইজ করা হয়েছে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

একটি নতুন arXiv প্রিপ্রিন্ট এমন পদ্ধতিগুলিকে মূল্যায়ন করে যা বৃহৎ ভাষা মডেল অনুমানের সময় কিছু ট্রান্সফরমার স্তরগুলি এড়িয়ে যায়। লেখকরা ভ্যানিলা অটোরিগ্রেসিভ ডিকোডিংকে ConfLayers-এর সাথে তুলনা করেছেন, একটি কনফিডেন্স-গেটেড প্রারম্ভিক-প্রস্থান পদ্ধতি এবং SWIFT, একটি স্ব-অনুমানমূলক ডিকোডিং পদ্ধতি, Qwen2.5-0.5B এবং Qwen2.5-1.5B জুড়ে, GSM8K যুক্তি এবং CNN/DailyMail টাস্ক মারাইজেশন যোগ।

প্রিপ্রিন্ট উপস্থাপন করে যাকে বলা হয় কঠোর-মিলিত, পর্যায়ক্রমিক-পদক্ষেপ স্তর-এড়িয়ে যাওয়ার পদ্ধতির তিন-বীজ নিরীক্ষা। এই সিস্টেমগুলি একটি ইনপুটের জন্য কোন ট্রান্সফরমার স্তরগুলি কার্যকর করতে হবে তা নির্ধারণ করে এবং প্রতি কয়েক প্রজন্মের ধাপে সেই সিদ্ধান্তটি পুনর্বিবেচনা করে। তুলনার মধ্যে রয়েছে ভ্যানিলা অটোরিগ্রেসিভ ডিকোডিং, কনফলেয়ার এবং সুইফট। ConfLayers কে একটি আত্মবিশ্বাস-প্রস্তুত প্রারম্ভিক-প্রস্থান বেসলাইন হিসাবে বর্ণনা করা হয়েছে, যখন SWIFT কে প্রকৃত স্ব-অনুমানমূলক ডিকোডিং হিসাবে বর্ণনা করা হয়েছে। লেখকরা দুটি Qwen2.5 মডেল স্কেল, 0.5 বিলিয়ন এবং 1.5 বিলিয়ন প্যারামিটারে এবং দুটি কাজের উপর উভয় পদ্ধতির মূল্যায়ন করেন: GSM8K যুক্তি এবং CNN/DailyMail সারসংক্ষেপ।

কাগজটি রিপোর্ট করেছে যে SWIFT ছিল চারটি মডেল-এবং-টাস্ক সংমিশ্রণের তিনটিতে নির্ভুলতার সবচেয়ে শক্তিশালী পদ্ধতি। 1.5B স্কেলে GSM8K-তে বিশেষ করে বড় ঘাটতি সহ, প্রতিটি কোষে কনফলেয়ারের প্রাধান্য ছিল বলে জানা গেছে। উৎসটি সরবরাহ করা পাঠ্যের নির্ভুলতার মানের সম্পূর্ণ সারণী প্রদান করে না, তাই সঠিক মার্জিন এখানে স্বাধীনভাবে বলা যাবে না। কেন্দ্রীয় ফলাফল তাই লেখকের তুলনামূলক র‌্যাঙ্কিং দাবি করার পরিবর্তে যে কোনও পদ্ধতিই সমস্ত ভাষার মডেল বা কাজের চাপে সর্বজনীনভাবে উচ্চতর।

অডিটের একটি মূল অংশ অনলাইন-সার্চ ওভারহেডকে মডেলটি চালানোর খরচ থেকে আলাদা করে। সেই পরিমাপে, লেখকরা রিপোর্ট করেছেন যে SWIFT-এর বিশুদ্ধ অনুমান গতি চারটি কক্ষে ConfLayers-এর তুলনায় 5% থেকে 21% বেশি ছিল, তিনটি ক্ষেত্রে নিরীহ প্রাচীর-ঘড়ি র‌্যাঙ্কিংকে উল্টে দেয়। ConfLayers-এর সার্চ ওভারহেড ছোট এবং স্থিতিশীল হিসাবে রিপোর্ট করা হয়েছে, খরচের 1% থেকে 2%, যখন SWIFT-এর বৃহত্তর এবং আরও পরিবর্তনশীল, 28.7% পর্যন্ত পৌঁছেছে। কাগজটিতে লেয়াররুট এবং লেয়ারড্রপের একটি সম্পূরক বিশ্লেষণও রয়েছে, দুটি প্রশিক্ষিত-রাউটিং পদ্ধতি যা মোটা দানাদারিতে সিদ্ধান্ত নেয়। লেখক যাকে একটি যাচাইকৃত প্রোটোকল বলে তার অধীনে, উভয়ই 1.08x থেকে 1.33x এর পরিমিত গতি তৈরি করেছিল, কিন্তু তাদের যথার্থতা পর্যায়ক্রমিক-পদক্ষেপ পদ্ধতির চেয়ে কম ছিল। LayerRoute-এর রিপোর্ট করা মানে 1.5B-তে GSM8K-তে সঠিক মিল ছিল তিনটি বীজ জুড়ে 0.003।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাগজটি যুক্তি দেয় যে দক্ষতার তুলনা বিভ্রান্তিকর হতে পারে যখন অনলাইন অনুসন্ধান খরচ এবং প্রকৃত অনুমান খরচ তাদের আলাদা না করে একত্রিত করা হয়। এর ফলাফলগুলি পরামর্শ দেয় যে প্রাচীর-ঘড়ির পরিমাপগুলিতে দ্রুত প্রদর্শিত একটি পদ্ধতি কম কার্যকর হতে পারে একবার কোন স্তরগুলি এড়িয়ে যেতে হবে তা নির্ধারণ করার জন্য হিসাব করা হয়৷

ব্যবহারিক সমস্যা হল যে অনুমান দক্ষতার একাধিক উপাদান রয়েছে। একটি লেয়ার-স্কিপিং পদ্ধতি নিউরাল-নেটওয়ার্ক কম্পিউটেশনের পরিমাণ কমাতে পারে যখন একটি পৃথক সিদ্ধান্ত প্রক্রিয়া যোগ করে যা কি চালানো হবে তা বেছে নেয়। যদি মূল্যায়ন শুধুমাত্র এন্ড-টু-এন্ড প্রাচীর-ঘড়ির সময়, অথবা শুধুমাত্র কার্যকর করা মডেল স্তরগুলির খরচের রিপোর্ট করে, তাহলে তারা বিভিন্ন র‌্যাঙ্কিং তৈরি করতে পারে। কাগজের তুলনা এই পরিমাপের সমস্যাটিকে হাইলাইট করে এবং দক্ষতার দাবিগুলিকে আরও সরাসরি তুলনাযোগ্য করার উদ্দেশ্যে একটি প্রোটোকল সরবরাহ করে।

ভাষা মডেল পরিবেশনকারী অপারেটরদের জন্য, রিপোর্ট করা ফলাফলগুলি নির্দেশ করে যে কার্যকর করা স্তরগুলি হ্রাস করা নিজেই যথেষ্ট নয়। নির্ভুলতা, সিদ্ধান্তের ওভারহেড, এবং কণিকা যেখানে রাউটিং ঘটে তা সব বিষয়। একটি পরিমিত কম্পিউটেশনাল শর্টকাট সহ একটি পদ্ধতি অআকর্ষণীয় হতে পারে যদি এর গুণমান যুক্তির কাজগুলিতে তীব্রভাবে পড়ে। বিপরীতভাবে, উচ্চতর অনুসন্ধান খরচ সহ একটি পদ্ধতি এখনও পছন্দনীয় হতে পারে যদি এটি আরও নির্ভুলতা ধরে রাখে এবং পরীক্ষা করা সেটআপের অধীনে আরও ভাল বিশুদ্ধ অনুমান গতি সরবরাহ করে। এগুলি রিপোর্ট করা পরীক্ষা-নিরীক্ষার প্রভাব, প্রমাণ নয় যে কোনও নির্দিষ্ট পদ্ধতি উৎপাদনে খরচ কমিয়ে দেবে।

গবেষণাটি মূল্যায়ন প্রোটোকলের সাথে মিল না করে অনলাইন, পর্যায়ক্রমিক-পদক্ষেপ পদ্ধতির সাথে প্রশিক্ষিত-রাউটিং সিস্টেমের তুলনা করার ঝুঁকিগুলিকেও চিত্রিত করে। লেখক বলেছেন যে তারা সম্পূরক বিশ্লেষণের জন্য একটি প্রকৃত পূর্ণ-মডেল বেসলাইন, প্রকৃত প্রতি-ইনপুট গেটিং এবং প্রকৃত অনুমান-সময় গণনা স্কিপিং ব্যবহার করেছেন। এই নিয়ন্ত্রণগুলি গুরুত্বপূর্ণ কারণ একটি নামমাত্র স্পার্স বা রাউটেড মডেল বাস্তব গণনা সংরক্ষণ করতে ব্যর্থ হতে পারে যদি বাস্তবায়ন এখনও এড়িয়ে যাওয়া অনেক কাজ সম্পাদন করে। একটি GSM8K সেটিং-এ LayerRoute-এর জন্য পেপারের প্রায়-পতনের রিপোর্ট আরও ইঙ্গিত করে যে গতি লাভ গুরুতর টাস্ক-নির্দিষ্ট মানের ট্রেডঅফের সাথে আসতে পারে।

দৃঢ়তার সাথে মিলে যাওয়া দক্ষতা তুলনার জন্য একটি টেমপ্লেট হিসাবে সম্পূর্ণ অডিট প্রোটোকল প্রকাশ করে উত্সটি একটি দরকারী পদ্ধতিগত অবদান প্রদান করে। এটি গবেষক এবং প্রকৌশল দলগুলিকে অনুসন্ধান ওভারহেড, অনুমান খরচ, নির্ভুলতা, মডেল স্কেল এবং টাস্ক শর্তাবলী আরও সামঞ্জস্যপূর্ণ উপায়ে প্রতিবেদন করতে সহায়তা করতে পারে। এখনও, উত্সটি প্রতিষ্ঠিত করে না যে প্রোটোকলটি অন্যান্য গবেষকরা গ্রহণ করেছেন, বা এটি বাণিজ্যিক মডেল, বিশেষ অনুমান হার্ডওয়্যার, দীর্ঘ প্রসঙ্গ, ইন্টারেক্টিভ ওয়ার্কলোড বা বাস্তব ব্যবহারকারীদের ফলাফল দেখায় না।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

ফলাফলগুলি আরও মডেলের আকার, আর্কিটেকচার, কাজ, হার্ডওয়্যার সেটিংস এবং বাস্তবায়ন পরিবেশে পরীক্ষা করা দরকার। কাগজটি একটি সংস্করণ-একটি প্রিপ্রিন্ট, এবং এর সিদ্ধান্তগুলি স্বাধীন প্রতিলিপি বা উত্পাদন স্থাপনার প্রমাণের পরিবর্তে লেখকদের রিপোর্ট করা প্রোটোকলের উপর ভিত্তি করে।

সবচেয়ে গুরুত্বপূর্ণ পরবর্তী ধাপ হল দুটি Qwen2.5 মডেলের মাপ এবং দুটি মূল্যায়ন করা কাজের বাইরে প্রতিলিপি করা। GSM8K এবং CNN/DailyMail যুক্তি এবং সংক্ষিপ্তকরণের প্রতিনিধিত্ব করে, কিন্তু তারা কাজের চাপের সম্পূর্ণ পরিসীমা কভার করে না যার জন্য অনুমান দক্ষতা গুরুত্বপূর্ণ। কোডিং, বহুভাষিক প্রজন্ম, দীর্ঘ-প্রসঙ্গ পুনরুদ্ধার, টুল ব্যবহার, কাঠামোগত আউটপুট বা মাল্টিমোডাল মডেলগুলির জন্য ফলাফলগুলি ভিন্ন হতে পারে। উত্স এই ধরনের পরীক্ষার রিপোর্ট করে না.

হার্ডওয়্যার এবং সফ্টওয়্যার বাস্তবায়নও গুরুত্বপূর্ণ। সরবরাহকৃত উত্স আপেক্ষিক ওভারহেড এবং গতির প্রতিবেদন করে তবে পরীক্ষায় ব্যবহৃত হার্ডওয়্যার, রানটাইম কনফিগারেশন, ব্যাচের আকার, টোকেন-জেনারেশন সেটিংস বা স্থাপনার শর্ত সনাক্ত করে না। পরিমাপ করা ট্রেডঅফগুলি ডেটা-সেন্টার পরিবেশন, স্থানীয় অনুমান, বা অন্যান্য পরিবেশে স্থানান্তরিত হয় কিনা তা নির্ধারণের জন্য এই বিবরণগুলি প্রয়োজনীয়। উৎস দ্বারা কোন উৎপাদন খরচ, শক্তি, লেটেন্সি-সার্ভিস-লেভেল বা প্রাপ্যতার ফলাফল প্রতিষ্ঠিত হয় না।

কাগজটি একটি নিষ্পত্তিকৃত ঐক্যমতের পরিবর্তে একটি প্রিপ্রিন্ট ফলাফল হিসাবেও পড়া উচিত। এটি arXiv-এ 28 আগস্ট, 2026-এ প্রথম সংস্করণ হিসাবে জমা দেওয়া হয়েছিল এবং উত্সটি কোনও পিয়ার-রিভিউ ফলাফল বা স্বাধীন বৈধতা সনাক্ত করেনি। ConfLayers, SWIFT, LayerRoute এবং LayerDrop সম্পর্কে লেখকদের দাবি তাদের নির্বাচিত বাস্তবায়ন এবং প্রোটোকল দ্বারা আবদ্ধ। পরবর্তী সংস্করণ, বিকল্প টিউনিং পছন্দ বা বিভিন্ন রাউটিং থ্রেশহোল্ড র‌্যাঙ্কিং পরিবর্তন করবে কিনা তা উৎসটি বলে না।

আরও কাজ বাস্তবসম্মত কাজের চাপের অধীনে অনুসন্ধান ওভারহেড এবং মোট সিস্টেম খরচের মধ্যে সম্পর্ক স্পষ্ট করা উচিত। SWIFT-এর ওভারহেড পরিবর্তনশীল এবং 28.7% এর মতো উচ্চ হিসাবে রিপোর্ট করা হয়েছিল, যখন এর বিশুদ্ধ অনুমান গতি পরীক্ষিত কোষগুলিতে কনফলায়ার্সের চেয়ে বেশি ছিল। সেই ট্রেডঅফ সুবিধাজনক কিনা তা নির্ভর করে কাজের চাপের আকার, লেটেন্সি লক্ষ্য, হার্ডওয়্যার ব্যবহার এবং নির্ভুলতার উপর রাখা মূল্যের উপর। পাঠকদের বৃহত্তর অডিট, প্রকাশিত কোড বা বেঞ্চমার্ক আর্টিফ্যাক্ট, স্বাধীন প্রতিলিপি এবং মূল্যায়নের দিকে নজর দেওয়া উচিত যা শেষ-থেকে-এন্ড লেটেন্সি এবং পচনশীল গণনা খরচ উভয়ই রিপোর্ট করে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেট্রান্সফরমারএআই প্রশিক্ষণএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?