সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

পেপার রিপোর্ট 90% কম ভিজ্যুয়াল টোকেন সহ ভিডিও AI নির্ভুলতা সংরক্ষণ করে

একটি নতুন arXiv প্রিপ্রিন্ট টোকেন-বাজেট ডিস্টিলেশনের প্রস্তাব করেছে, একটি সূক্ষ্ম-টিউনিং পদ্ধতি যা আক্রমনাত্মক ভিজ্যুয়াল-টোকেন কম্প্রেশনের পরে ভিডিও ভিশন-ভাষা মডেলগুলির শব্দার্থিক আচরণ বজায় রাখার উদ্দেশ্যে।

6 min readRead the primary source
Source-provided image accompanying Paper reports preserving video AI accuracy with 90% fewer visual tokens
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.28138
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

দৃষ্টি-ভাষা মডেল (ভিএলএম)
একটি মাল্টিমোডাল মডেল যা যৌথভাবে ভিজ্যুয়াল এবং পাঠ্য তথ্য প্রক্রিয়া করে।
LoRA (নিম্ন-র্যাঙ্ক অভিযোজন)
একটি পরামিতি-দক্ষ ফাইন-টিউনিং পদ্ধতি যা নিম্ন-র্যাঙ্ক অ্যাডাপ্টার ম্যাট্রিক্স যোগ করে।
জ্ঞান পাতন
একটি বড় মডেলের আউটপুট অনুকরণ করার জন্য একটি ছোট মডেলকে প্রশিক্ষণ দেওয়া।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা টোকেন-বাজেট ডিস্টিলেশন, বা টিবিডি, একটি নির্দিষ্ট টোকেন বাজেটের অধীনে ভিডিও ভিশন-ভাষা মডেলগুলিকে অভিযোজিত করার জন্য একটি প্যারামিটার-দক্ষ পদ্ধতির প্রস্তাব করেছেন। পদ্ধতিটি শুধুমাত্র LoRA অ্যাডাপ্টার আপডেট করার সময় একটি সংকুচিত ছাত্র মডেলের তত্ত্বাবধানের জন্য একটি পূর্ণ-টোকেন শিক্ষক মডেল ব্যবহার করে।

28 অগাস্ট, 2026-এ জমা দেওয়া একটি arXiv পেপার ভিডিও ভিশন-ভাষা মডেলগুলির জন্য টোকেন-বাজেট ডিস্টিলেশন প্রবর্তন করে৷ লেখকরা কেন্দ্রীয় সমস্যাটিকে গণনাগত দক্ষতা এবং শব্দার্থিক বিশ্বস্ততার মধ্যে একটি লেনদেন হিসাবে বর্ণনা করেছেন: ভিডিও ইনপুটগুলি অনেকগুলি ভিজ্যুয়াল টোকেন তৈরি করে, যখন সেই টোকেনগুলিকে সংকুচিত করার ফলে অভিযোজিত মডেলটি আসল পূর্ণ-টোকেন সিস্টেমের আচরণ থেকে সরে যেতে পারে। প্রস্তাবিত পদ্ধতিটি সংকুচিত ইনপুটগুলিতে সরাসরি ফাইন-টিউনিংয়ের পরিবর্তে একটি নির্দিষ্ট টোকেন বাজেটের অধীনে কাজ করার জন্য ডিজাইন করা হয়েছে। সেই ফ্রেমিংয়ের অর্থ হল পদ্ধতিটি একটি বিদ্যমান মডেলের জন্য একটি অভিযোজন পদ্ধতি হিসাবে উপস্থাপিত হয়, টোকেন বাজেটকে প্রশিক্ষণকে আকার দেয় এমন একটি সীমাবদ্ধতা হিসাবে বিবেচনা করা হয়। সরবরাহ করা বিবরণ তাই একটি নতুন ভিডিও এনকোডার বা একটি নতুন টাস্ক-নির্দিষ্ট অ্যাপ্লিকেশন বর্ণনা করার পরিবর্তে শিক্ষক এবং শিক্ষার্থীকে একে অপরের সাথে কীভাবে প্রশিক্ষিত করা হয় তার উপর জোর দেয়।

TBD পূর্বপ্রশিক্ষিত মডেলের ব্যাকবোনকে হিমায়িত করে এবং শুধুমাত্র LoRA অ্যাডাপ্টারগুলিকে আপডেট করে, যা কাগজটি একটি প্যারামিটার-দক্ষ অভিযোজন কৌশল হিসাবে উপস্থাপন করে। এটি ভিডিও পাথওয়েতে FlashVID-ভিত্তিক ভিজ্যুয়াল-টোকেন কম্প্রেশনকেও একীভূত করে। প্রশিক্ষণ নকশা দুটি পথ ব্যবহার করে: একজন পূর্ণ-টোকেন শিক্ষক তত্ত্বাবধান সরবরাহ করেন, যখন একজন সংকুচিত ছাত্র টাস্ক উদ্দেশ্য এবং বেশ কয়েকটি পাতন সংকেত থেকে শেখে। এর মধ্যে রয়েছে উত্তর-অঞ্চল KL পাতন, স্থল-সত্য-অ্যাঙ্করড মার্জিন পাতন, এবং জ্ঞান পাতনের নির্ভরযোগ্যতা-সচেতন নিয়ন্ত্রণ। এই উপাদানগুলিকে প্রশিক্ষণের নকশার অংশ হিসাবে বর্ণনা করা হয়েছে, তাই রিপোর্ট করা অবদান হল ফিক্সড-বাজেট সেটআপ, সংকুচিত ভিজ্যুয়াল পাথ এবং শিক্ষক থেকে ছাত্রের কাছে তত্ত্বাবধানের সংমিশ্রণ। ব্যাকবোন বর্ণিত অভিযোজনের জন্য রেফারেন্স পয়েন্ট অবশেষ।

লেখক তিনটি ভিডিও VLM ব্যাকবোনের উপর মূল্যায়ন রিপোর্ট করেছেন: LLaVA-Video, LLaVA-OneVision, এবং Qwen3-VL-8B-ইন্সট্রাক্ট। তারা বলে যে পদ্ধতিটি মাঝারি এবং আক্রমনাত্মক উভয় কম্প্রেশনের অধীনে চারটি ভিডিও-বোঝার বেঞ্চমার্ক জুড়ে কম্প্রেশন-কেবল বেসলাইনকে ধারাবাহিকভাবে ছাড়িয়ে গেছে। 10% টোকেন-ধারণ অনুপাতে, কাগজটি রিপোর্ট করেছে যে TBD LLaVA-ভিডিওতে ভ্যানিলা মডেলের গড় নির্ভুলতার 97.0% সংরক্ষণ করেছে। LLaVA-OneVision-এ, এটি একই ধারণ অনুপাতের গড় স্কোর 58.4 এবং 100.0% আপেক্ষিক নির্ভুলতা রিপোর্ট করে। এই ফলাফলগুলিকে কাগজের সারাংশে গড় বা আপেক্ষিক ফলাফল হিসাবে বিবৃত করা হয়েছে এবং সেগুলি সেখানে চিহ্নিত ধারণ সেটিং এর সাথে আবদ্ধ। সরবরাহ করা অ্যাকাউন্ট প্রতি-বেঞ্চমার্ক ব্রেকডাউন বা এই রিপোর্ট করা তুলনার বাইরে আরও পরীক্ষামূলক ফলাফল যোগ করে না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

ভিডিও মডেলগুলি প্রচুর পরিমাণে ভিজ্যুয়াল টোকেন প্রক্রিয়া করে, যা ফাইন-টিউনিং এবং অনুমানকে ব্যয়বহুল করে তুলতে পারে। যদি রিপোর্ট করা ফলাফলগুলি বৃহত্তর পরীক্ষায় ধারণ করে, তবে পদ্ধতিটি একটি মডেলের ভিডিও বোঝার ক্ষমতার বেশিরভাগ সংরক্ষণ করার সময় ভিজ্যুয়াল-প্রসেসিং ওভারহেড কমাতে পারে।

কাগজ দ্বারা সম্বোধন করা ব্যবহারিক সমস্যাটি ভিডিও AI সিস্টেমের জন্য তাৎপর্যপূর্ণ কারণ ভিডিও ইনপুটগুলি একক চিত্রের তুলনায় যথেষ্ট বেশি ভিজ্যুয়াল টোকেন তৈরি করতে পারে। আরও টোকেন সাধারণত অনুমান এবং অভিযোজন উভয়ের গণনাগত বোঝা বাড়ায়। একটি কৌশল যা মূল ভিজ্যুয়াল উপস্থাপনার একটি ভগ্নাংশ প্রক্রিয়াকরণের সময় দরকারী ভিডিও শব্দার্থ সংরক্ষণ করে কিছু ভিডিও-ভাষা অ্যাপ্লিকেশনগুলিকে চালানোর জন্য কম চাহিদা বা সূক্ষ্ম সুর করতে পারে। সম্ভাব্য সুবিধা তাই কম ভিজ্যুয়াল-টোকেন বাজেটে শব্দার্থগত উপযোগিতা সংরক্ষণের সাথে জড়িত। এটি শুধুমাত্র সরবরাহকৃত উপাদান থেকে নয়, সমগ্র প্রশিক্ষণ এবং অনুমান পাইপলাইনের জন্য প্রয়োজনীয় সংস্থানগুলির একটি সম্পূর্ণ অ্যাকাউন্টিং।

কাগজের শিক্ষক-ছাত্রের নকশা সাধারণ কম্প্রেশনের একটি নির্দিষ্ট দুর্বলতাকে লক্ষ্য করে। কম্প্রেশন-শুধুমাত্র অভিযোজন গণনা সংরক্ষণ করতে পারে তবে ভিডিও সম্পর্কে প্রশ্নের উত্তর দেওয়ার জন্য গুরুত্বপূর্ণ তথ্য বাতিল করতে পারে। প্রশিক্ষণের সময় একজন পূর্ণ-টোকেন শিক্ষক রেখে এবং সংকুচিত শিক্ষার্থীকে বিভিন্ন ধরণের তত্ত্বাবধানে পাস করার মাধ্যমে, TBD কম-সংকুচিত মডেলের শব্দার্থিক আচরণকে অনুকরণ করতে ছোট উপস্থাপনা শেখানোর চেষ্টা করে। এটি শুধুমাত্র একটি প্রিপ্রসেসিং পদক্ষেপ হিসাবে সংকোচনকে বিবেচনা করার চেয়ে গুণমান হ্রাসের জন্য আরও লক্ষ্যযুক্ত প্রতিক্রিয়া। প্রস্তাবটি ব্যাখ্যা করার সময় এই পার্থক্যটি গুরুত্বপূর্ণ: কম্প্রেশন সেটিং একটি বিস্তৃত অভিযোজন রেসিপির অংশ, এবং শিক্ষকের ভূমিকা প্রশিক্ষণের অন্তর্গত। সারাংশটি বলে না যে অভিযোজিত শিক্ষার্থীর প্রতিটি পরবর্তী ব্যবহারের জন্য একজন শিক্ষক প্রয়োজন।

রিপোর্ট করা ফলাফলগুলি সম্ভাব্য উপযোগী কারণ তারা একটি একক আর্কিটেকচারের পরিবর্তে একাধিক মডেল ব্যাকবোন কভার করে। যাইহোক, উত্সটি এই ফলাফলগুলিকে শুধুমাত্র প্রিপ্রিন্টে করা দাবি হিসাবে প্রতিষ্ঠিত করে। এটি সরবরাহ করা বিমূর্তের চারটি মানদণ্ড চিহ্নিত করে না, প্রশিক্ষণ বা অনুমান গতির পরিমাণ নির্ধারণ করে, মেমরির ব্যবহার বা আর্থিক ব্যয়ের প্রতিবেদন করে, ব্যবহৃত হার্ডওয়্যার বর্ণনা করে, বা কার্যগুলি জুড়ে কীভাবে পরম নির্ভুলতা পরিবর্তিত হয় তা দেখায় না। এটি এটিও প্রতিষ্ঠিত করে না যে পদ্ধতিটি উত্পাদন স্থাপনার জন্য প্রস্তুত বা রিপোর্ট করা ধরে রাখার অনুপাত অন্যান্য ভিডিও মডেলগুলিতে স্থানান্তরিত হবে। সেই কারণে, বিবৃত পরীক্ষামূলক সেটআপের জন্য লেখকদের দ্বারা উপস্থাপিত প্রমাণ হিসাবে ফলাফলগুলি সর্বোত্তমভাবে পড়া হয়। উপলব্ধ বিবরণ পদ্ধতিতে আগ্রহকে সমর্থন করে, যখন যে কোনো ব্যবহারিক সুবিধার আকার এবং সামঞ্জস্য স্থাপন করা যায়।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

কাগজটি একটি arXiv প্রিপ্রিন্ট, এবং উত্সটি স্বাধীন প্রতিলিপি, বিশদ লেটেন্সি বা মেমরি পরিমাপ, বেঞ্চমার্ক নাম, কোড উপলব্ধতা, বা স্থাপনার প্রমাণ প্রদান করে না। ফলো-আপ কাজের ভিডিওর দৈর্ঘ্য, কাজ, কম্প্রেশন লেভেল এবং মডেল ফ্যামিলি জুড়ে রিপোর্ট করা লাভ টিকে থাকে কিনা তা পরীক্ষা করা উচিত।

ফলো-আপ গবেষণার জন্য প্রথম প্রশ্ন হল রিপোর্ট করা নির্ভুলতা ধরে রাখা স্বাধীনভাবে পুনরুত্পাদন করা যেতে পারে কিনা। উত্সটি তিনটি নামযুক্ত ব্যাকবোন এবং চারটি বেঞ্চমার্কের ফলাফলগুলি বর্ণনা করে, তবে বিমূর্তটি ডেটাসেট রচনা, কাজের অসুবিধা, মূল্যায়ন প্রোটোকল, বা পরিসংখ্যানগত প্রকরণ মূল্যায়ন করার জন্য বেঞ্চমার্কের নাম বা পর্যাপ্ত পরীক্ষামূলক বিশদ দেয় না। সমকক্ষ পর্যালোচনা বা একটি সম্পূর্ণ প্রযুক্তিগত পরিদর্শন তুলনাগুলি কতটা শক্তিশালী তা স্পষ্ট করতে সাহায্য করবে। এই ফাঁকগুলি প্রজননযোগ্যতার পাশাপাশি ব্যাখ্যাকে প্রভাবিত করে। বাদ দেওয়া প্রসঙ্গ ব্যতীত, একজন পাঠক একা বিমূর্ত থেকে বলতে পারবেন না যে নির্বাচিত মূল্যায়ন সেটিংস কতটা প্রতিনিধিত্ব করে বা রিপোর্ট করা তুলনাগুলিকে ঘিরে কতটা অনিশ্চয়তা রয়েছে।

দক্ষতা দাবি সরাসরি পরিমাপ করা প্রয়োজন. একটি 10% ধরে রাখার অনুপাত নির্দেশ করে যে কতগুলি ভিজ্যুয়াল টোকেন রয়ে গেছে, কিন্তু এটি নিজেই প্রাচীর-ঘড়ির অনুমান সময়, মেমরি ব্যবহার, শক্তি খরচ বা খরচ 90% হ্রাস করে না। কম্প্রেশন ওভারহেড, শিক্ষক-মডেল প্রশিক্ষণের খরচ, ক্রম দৈর্ঘ্য, হার্ডওয়্যার, ব্যাচের আকার এবং বাস্তবায়নের বিবরণ বাস্তবিক সুবিধাকে প্রভাবিত করতে পারে। সেই পরিমাপগুলি উত্স পাঠে সরবরাহ করা হয় না। ধারণ চিত্রটি ফলস্বরূপ বৃহত্তর দক্ষতার উপসংহার থেকে আলাদা রাখা উচিত। এই উপসংহারগুলি স্থাপনের জন্য পরিমাপের প্রয়োজন হবে যা টোকেন গণনাকে একটি নির্দিষ্ট বাস্তবায়ন এবং কাজের চাপের অধীনে শেষ থেকে শেষ সম্পদ ব্যবহারের সাথে সংযুক্ত করে।

রিপোর্ট করা সেটিংসের বাইরে পদ্ধতিটি পরীক্ষা করাও গুরুত্বপূর্ণ। ভবিষ্যত মূল্যায়ন দীর্ঘ এবং আরও বৈচিত্রপূর্ণ ভিডিও, সূক্ষ্ম-দানাযুক্ত অস্থায়ী যুক্তি, বিরল ঘটনা, একাধিক ভাষা, বিভিন্ন সংকোচন অনুপাত, এবং তিনটি তালিকাভুক্ত ব্যাকবোনের বাইরে মডেল পরিবারগুলি পরীক্ষা করতে পারে। উত্সটি ACM MM 2026-এর জন্য কাজটিকে লেবেল করে, কিন্তু এটি বলে না যে কাগজটি গ্রহণ করা হয়েছে, বা এটি প্রকাশ করা কোড, মডেল অ্যাডাপ্টার বা TBD ব্যবহার করে কোনো পাবলিক পণ্য সনাক্ত করে না। এই ধরনের পরীক্ষা একটি নির্দিষ্ট ব্যাকবোন বা কম্প্রেশন সেটিং এর সাথে আবদ্ধ প্রভাব থেকে পাতন পদ্ধতি থেকে উদ্ভূত পৃথক লাভকেও সাহায্য করবে। ততক্ষণ পর্যন্ত, সরবরাহকৃত প্রমাণ প্রিপ্রিন্ট দ্বারা বর্ণিত সুযোগ এবং অবস্থার মধ্যে সীমাবদ্ধ থাকে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেট্রান্সফরমারএআই প্রশিক্ষণএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?