কেভি ক্যাশে অপ্টিমাইজেশান
কেভি ক্যাশে একটি ট্রান্সফরমার ইতিমধ্যেই গণনা করা কী এবং মানগুলি সংরক্ষণ করে তাই এটি প্রতিটি নতুন টোকেনের জন্য পুনরায় কাজ করে না — তবে এটি গিগাবাইটে বেলুন করতে পারে।
ওভারভিউ
KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.
গভীর ডুব
একটি ট্রান্সফরমারে, প্রতিটি নতুন টোকেন মনোযোগের কী (K) এবং মান (V) এর মাধ্যমে আগের সমস্ত টোকেনগুলিতে উপস্থিত হয়। প্রতিটি ধাপে পুরো সিকোয়েন্সের জন্য K এবং V পুনরায় কম্পিউট করা হবে দ্বিঘাতমূলক এবং অপব্যয়, তাই মডেলগুলি তাদের ক্যাশে করে: কেভি ক্যাশে। নেতিবাচক দিক হল আকার। ক্যাশে ক্রম দৈর্ঘ্য, ব্যাচের আকার, স্তর এবং মাথার সাথে রৈখিকভাবে বৃদ্ধি পায়, তাই একটি দীর্ঘ-প্রসঙ্গ অনুরোধ মডেলের ওজনের চেয়ে বেশি GPU মেমরি গ্রহণ করতে পারে। অপ্টিমাইজেশান বিভিন্ন কোণ থেকে এটিকে মোকাবেলা করে: পেজড মেমরি (ভিএলএলএমের পেজডঅ্যাটেনশন) ফ্র্যাগমেন্টেশন দূর করতে এবং ভাগাভাগি সক্ষম করতে অ-সংলগ্ন ব্লকগুলিতে ক্যাশে সংরক্ষণ করে; কোয়ান্টাইজেশন K এবং V 8-বিট বা 4-বিটে সঞ্চয় করে; এবং গ্রুপড-কোয়েরি অ্যাটেনশন (GQA) এবং মাল্টি-কোয়েরি অ্যাটেনশন (MQA) এর মতো আর্কিটেকচারাল পরিবর্তনগুলি অনেক ক্যোয়ারী হেডকে কম কী/মান হেড শেয়ার করতে দেয়, উৎসে ক্যাশে সাইজ কমিয়ে দেয়।
প্রযুক্তিগত অন্তর্দৃষ্টি
PagedAttention অপারেটিং সিস্টেমগুলি থেকে ভার্চুয়াল-মেমরি পেজিং ধার করে: ক্যাশে একটি লুকআপ টেবিলের মাধ্যমে ম্যাপ করা নির্দিষ্ট-আকারের ব্লকগুলিতে থাকে, তাই অনুরোধগুলি শুধুমাত্র তাদের প্রয়োজনীয় ব্লকগুলি ব্যবহার করে এবং অভিন্ন উপসর্গগুলি (যেমন একটি ভাগ করা সিস্টেম প্রম্পট) একই ব্লকগুলিকে নির্দেশ করতে পারে৷ মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন (এমএলএ), ডিপসিক মডেলগুলিতে ব্যবহৃত, কে এবং ভিকে একটি ছোট ভাগ করা সুপ্ত ভেক্টরে সংকুচিত করে, নির্ভুলতা বজায় রেখে নাটকীয়ভাবে মেমরি কাটে।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
কেভি ক্যাশে অপ্টিমাইজেশানের ভবিষ্যত
কনটেক্সট উইন্ডোগুলি কয়েক হাজার বা লক্ষ লক্ষ টোকেন পর্যন্ত প্রসারিত হওয়ার সাথে সাথে কেভি ক্যাশে পরিবেশনের প্রধান খরচ হয়ে ওঠে। আক্রমনাত্মক ক্যাশে কম্প্রেশন এবং উচ্ছেদ (কম মনোযোগ টোকেন বাদ দেওয়া), ডিফল্ট হিসাবে ক্রস-রিকোয়েস্ট প্রিফিক্স শেয়ারিং, CPU বা NVMe-তে কোল্ড ক্যাশে অফলোড করা এবং MLA এবং GQA-এর মতো আর্কিটেকচারগুলি মানসম্মত হওয়ার প্রত্যাশা করুন। ক্যাশে ম্যানেজমেন্ট ক্রমবর্ধমান স্তর এবং স্মার্ট প্রিফেচিং সহ একটি সম্পূর্ণ মেমরি অনুক্রমের অনুরূপ হবে৷
বাস্তব-বিশ্ব বাস্তবায়ন
vLLM-এর PagedAttention মেমরি ফ্র্যাগমেন্টেশন ছাড়াই KV ব্লক প্যাক করে অনেক সমসাময়িক চ্যাট সেশন পরিবেশন করে
লামা মডেলগুলিতে গোষ্ঠীবদ্ধ-কোয়েরি মনোযোগ কেভি ক্যাশের আকার হ্রাস করে যাতে দীর্ঘ প্রসঙ্গগুলি GPU মেমরিতে ফিট করে
দীর্ঘ-নথির সংক্ষিপ্তকরণের সময় ক্যাশে মেমরিকে মোটামুটি অর্ধেক করতে কেভি ক্যাশে 8-বিট (KV8) এ পরিমাপ করা
প্রিফিক্স ক্যাশিং যা হাজার হাজার API অনুরোধ জুড়ে একটি শেয়ার্ড সিস্টেম প্রম্পটের KV ব্লক পুনরায় ব্যবহার করে
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
কেভি ক্যাশে
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is KV Cache Optimization?
কেভি ক্যাশে একটি ট্রান্সফরমার ইতিমধ্যেই গণনা করা কী এবং মানগুলি সংরক্ষণ করে তাই এটি প্রতিটি নতুন টোকেনের জন্য পুনরায় কাজ করে না — তবে এটি গিগাবাইটে বেলুন করতে পারে। কেভি ক্যাশে অপ্টিমাইজেশান সেই মেমরিকে সঙ্কুচিত করে এবং পরিচালনা করে যাতে মডেলগুলি একবারে আরও ব্যবহারকারীদের কাছে দীর্ঘ প্রসঙ্গ পরিবেশন করে।
কেভি ক্যাশে কি সঞ্চয় করে এবং কেন?
আগের টোকেনগুলি থেকে ক্যাশিং কী এবং মানগুলি প্রতিটি নতুন টোকেনে মনোযোগ গণনা পুনরায় করা এড়ায়, সময় বাঁচায়।
কেন কেভি ক্যাশে একটি মেমরি সমস্যা হতে পারে?
প্রসঙ্গ দৈর্ঘ্য এবং সঙ্গতি সহ ক্যাশে আকারের স্কেল, তাই দীর্ঘ অনুরোধগুলি প্রচুর পরিমাণে GPU মেমরি ব্যবহার করতে পারে।
PagedAttention কি অপারেটিং-সিস্টেম ধারণা ধার করে?
PagedAttention একটি টেবিলের মাধ্যমে ম্যাপ করা অ-সংলগ্ন স্থির-আকারের ব্লকগুলিতে ক্যাশে সংরক্ষণ করে, ঠিক OS পেজিংয়ের মতো।
কিভাবে গ্রুপড-কোয়েরি এবং মাল্টি-কোয়েরি মনোযোগ কেভি ক্যাশের আকার কমিয়ে দেয়?
একাধিক ক্যোয়ারী হেড জুড়ে কী/মান হেড শেয়ার করা মানে সঞ্চয় করার জন্য অনেক কম K এবং V ভেক্টর।
কেভি ক্যাশে উপসর্গ ভাগ করে নেওয়ার একটি সুবিধা কী?
একটি শেয়ার্ড সিস্টেম প্রম্পট একই KV এন্ট্রি তৈরি করে, তাই একাধিক অনুরোধ একই ব্লকগুলিকে নকল করার পরিবর্তে নির্দেশ করতে পারে।