মাল্টি-হেড সুপ্ত মনোযোগ
মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন (এমএলএ) হল একটি মনোযোগের প্রক্রিয়া, যা ডিপসিক-ভি2-এ চালু করা হয়েছে, যা মেমরি-হাংরি কী-ভ্যালু ক্যাশেকে একটি ছোট ভাগ করা সুপ্ত ভেক্টরে সংকুচিত করে।
ওভারভিউ
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
গভীর ডুব
যখন একটি ট্রান্সফরমার টেক্সট তৈরি করে, তখন এটি একটি 'কেভি ক্যাশে' প্রতিটি অতীত টোকেনের জন্য একটি কী এবং মান ভেক্টর সংরক্ষণ করে। সেই ক্যাশে প্রসঙ্গ দৈর্ঘ্যের সাথে বৃদ্ধি পায় এবং অনুমানের সময় মেমরির ব্যবহারকে প্রাধান্য দেয়। এমএলএ প্রতি টোকেন প্রতি একটি একক নিম্ন-র্যাঙ্কের সুপ্ত ভেক্টর দিয়ে অনেকগুলি পূর্ণ-আকার কী/মান ভেক্টর প্রতিস্থাপন করে, তারপরে প্রজেক্ট করে যেগুলি প্রতি-হেড কী এবং ফ্লাইতে মানগুলিতে ফিরে আসে। যেহেতু শুধুমাত্র কমপ্যাক্ট ল্যাটেন্ট ক্যাশে করা হয়েছে, ডিপসিক-ভি2 রিপোর্ট করেছে যে কেভি-ক্যাশে মেমরি 90% কম হয়েছে বনাম স্ট্যান্ডার্ড মাল্টি-হেড অ্যাটেনশন, দীর্ঘ প্রসঙ্গ এবং বড় ব্যাচের আকার সক্ষম করে। গুরুত্বপূর্ণভাবে, আপ-প্রোজেকশন ম্যাট্রিক্সগুলিকে অন্যান্য ওজনে ভাঁজ করা যেতে পারে, তাই এমএলএ মডেলিং মানের সামান্য বা কোন পরিমাপযোগ্য ক্ষতি ছাড়াই এই কম্প্রেশন অর্জন করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
এমএলএ একটি নিম্ন-র্যাঙ্কের যৌথ সংকোচন সম্পাদন করে: প্রতিটি টোকেনের লুকানো অবস্থা একটি ছোট সুপ্ত ভেক্টরে অনুমান করা হয়, এবং পৃথক আপ-প্রজেকশন ম্যাট্রিক্স প্রতি-হেড কী এবং মানগুলি পুনর্গঠন করে। একটি চতুর কৌশল হল ক্যোয়ারী এবং আউটপুট অনুমানে আপ-প্রজেকশন ওজনগুলিকে 'শোষণ' করা, তাই অনুমানের সময় মডেলটি কখনই সম্পূর্ণ কী/মানগুলিকে বাস্তবায়িত করে না। ঘূর্ণমান অবস্থান এমবেডিংগুলি একটি ডিকপলড কী পাথ দিয়ে পরিচালনা করা হয়, যেহেতু ঘূর্ণন একইভাবে শোষিত হতে পারে না, অবস্থানগত তথ্য সংরক্ষণ করে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
মাল্টি-হেড সুপ্ত মনোযোগের ভবিষ্যত
এমএলএ ডিপসিক-ভি2 এবং ভি3কে স্কেলে পরিবেশন করার জন্য মিতব্যয়ী করে তুলতে সাহায্য করেছে এবং দলগুলি সস্তা দীর্ঘ-প্রসঙ্গ অনুমানের পেছনে ছুটতে কৌশলটি ছড়িয়ে পড়ছে। এমএলএ-শৈলীর সুপ্ত কম্প্রেশন আশা করুন যে স্পার্স মিক্সচার-অফ-বিশেষজ্ঞ স্তর, কোয়ান্টাইজড ক্যাশে এবং ভবিষ্যতের খোলা মডেলগুলিতে অনুমানমূলক ডিকোডিংয়ের সাথে একত্রিত হবে। গবেষকরা আরও অন্বেষণ করছেন যে গুণমান হ্রাসের আগে সুপ্ত মাত্রা কতটা সঙ্কুচিত হতে পারে এবং একই নিম্ন-র্যাঙ্ক ধারণাটি প্রশিক্ষণের সময় মনোযোগ সংকুচিত করতে পারে কিনা, শুধু অনুমান নয়।
বাস্তব-বিশ্ব বাস্তবায়ন
অনুরোধ প্রতি নাটকীয়ভাবে ছোট GPU মেমরি পদচিহ্ন সহ DeepSeek-V2/V3 চ্যাট মডেল পরিবেশন করা
দীর্ঘ-দস্তাবেজ প্রশ্নের উত্তর দেওয়া যেখানে একটি বড় কেভি ক্যাশে অন্যথায় VRAM নিঃশেষ করবে
একটি নির্দিষ্ট GPU-তে অনুমান ব্যাচের আকার বৃদ্ধি করা কারণ প্রতিটি ক্রম শুধুমাত্র একটি ক্ষুদ্র প্রচ্ছন্ন ভেক্টর সঞ্চয় করে
পুনরুদ্ধার-বর্ধিত সহকারীর জন্য কমোডিটি হার্ডওয়্যারে দীর্ঘ প্রসঙ্গ উইন্ডো সক্ষম করা
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
মাল্টি-কোয়েরি মনোযোগ
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Multi-Head Latent Attention?
মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন (এমএলএ) হল একটি মনোযোগের প্রক্রিয়া, যা ডিপসিক-ভি2-এ চালু করা হয়েছে, যা মেমরি-হাংরি কী-ভ্যালু ক্যাশেকে একটি ছোট ভাগ করা সুপ্ত ভেক্টরে সংকুচিত করে। এটি বৃহৎ ভাষার মডেলগুলিকে অনেক কম GPU মেমরির সাথে চলতে দেয় এবং মানকে আদর্শ মনোযোগের কাছাকাছি রাখে।
মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন কমানোর জন্য প্রাথমিক সমস্যা কী?
এমএলএ কেভি ক্যাশে টার্গেট করে, যা প্রসঙ্গ দৈর্ঘ্যের সাথে বৃদ্ধি পায় এবং পাঠ্য তৈরির সময় মেমরিতে প্রাধান্য পায়।
এমএলএ কিভাবে কেভি ক্যাশে সঙ্কুচিত করে?
এমএলএ প্রতি টোকেন প্রতি একটি কমপ্যাক্ট সুপ্ত ভেক্টর ক্যাশে করে এবং আপ-প্রজেকশনের মাধ্যমে এটি থেকে কী এবং মান পুনর্গঠন করে।
কোন মডেল প্রথম মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন চালু করে?
এমএলএ ডিপসিক তার ডিপসিক-ভি2 মডেলে প্রবর্তন করেছিল এবং ডিপসিক-ভি3-এ নিয়ে গিয়েছিল।
রোটারি পজিশন এম্বেডিংয়ের জন্য এমএলএ-র কেন আলাদা 'ডিকপলড' পাথ প্রয়োজন?
ঘূর্ণমান রূপান্তর অন্যান্য ওজন ম্যাট্রিসে শোষিত হতে পারে না, তাই এমএলএ অবস্থানগত তথ্য বহন করার জন্য একটি ছোট ডিকপলড কী উপাদান রাখে।
ডিপসিক-ভি2 এমএলএ বনাম স্ট্যান্ডার্ড মাল্টি-হেড অ্যাটেনশন থেকে মোটামুটি কত কেভি-ক্যাশ মেমরি হ্রাস করেছে?
DeepSeek-V2 কেভি-ক্যাশে মেমরি 90% এর বেশি কাটার রিপোর্ট করেছে, দীর্ঘ প্রসঙ্গ এবং বৃহত্তর ব্যাচগুলি সক্ষম করে।