প্রযুক্তিগত গাইড

কেভি ক্যাশে অপ্টিমাইজেশান

কেভি ক্যাশে একটি ট্রান্সফরমার ইতিমধ্যেই গণনা করা কী এবং মানগুলি সংরক্ষণ করে তাই এটি প্রতিটি নতুন টোকেনের জন্য পুনরায় কাজ করে না — তবে এটি গিগাবাইটে বেলুন করতে পারে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

KV cache optimization shrinks and manages that memory so models serve longer contexts to more users at once.

গভীর ডুব

একটি ট্রান্সফরমারে, প্রতিটি নতুন টোকেন মনোযোগের কী (K) এবং মান (V) এর মাধ্যমে আগের সমস্ত টোকেনগুলিতে উপস্থিত হয়। প্রতিটি ধাপে পুরো সিকোয়েন্সের জন্য K এবং V পুনরায় কম্পিউট করা হবে দ্বিঘাতমূলক এবং অপব্যয়, তাই মডেলগুলি তাদের ক্যাশে করে: কেভি ক্যাশে। নেতিবাচক দিক হল আকার। ক্যাশে ক্রম দৈর্ঘ্য, ব্যাচের আকার, স্তর এবং মাথার সাথে রৈখিকভাবে বৃদ্ধি পায়, তাই একটি দীর্ঘ-প্রসঙ্গ অনুরোধ মডেলের ওজনের চেয়ে বেশি GPU মেমরি গ্রহণ করতে পারে। অপ্টিমাইজেশান বিভিন্ন কোণ থেকে এটিকে মোকাবেলা করে: পেজড মেমরি (ভিএলএলএমের পেজডঅ্যাটেনশন) ফ্র্যাগমেন্টেশন দূর করতে এবং ভাগাভাগি সক্ষম করতে অ-সংলগ্ন ব্লকগুলিতে ক্যাশে সংরক্ষণ করে; কোয়ান্টাইজেশন K এবং V 8-বিট বা 4-বিটে সঞ্চয় করে; এবং গ্রুপড-কোয়েরি অ্যাটেনশন (GQA) এবং মাল্টি-কোয়েরি অ্যাটেনশন (MQA) এর মতো আর্কিটেকচারাল পরিবর্তনগুলি অনেক ক্যোয়ারী হেডকে কম কী/মান হেড শেয়ার করতে দেয়, উৎসে ক্যাশে সাইজ কমিয়ে দেয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

PagedAttention অপারেটিং সিস্টেমগুলি থেকে ভার্চুয়াল-মেমরি পেজিং ধার করে: ক্যাশে একটি লুকআপ টেবিলের মাধ্যমে ম্যাপ করা নির্দিষ্ট-আকারের ব্লকগুলিতে থাকে, তাই অনুরোধগুলি শুধুমাত্র তাদের প্রয়োজনীয় ব্লকগুলি ব্যবহার করে এবং অভিন্ন উপসর্গগুলি (যেমন একটি ভাগ করা সিস্টেম প্রম্পট) একই ব্লকগুলিকে নির্দেশ করতে পারে৷ মাল্টি-হেড ল্যাটেন্ট অ্যাটেনশন (এমএলএ), ডিপসিক মডেলগুলিতে ব্যবহৃত, কে এবং ভিকে একটি ছোট ভাগ করা সুপ্ত ভেক্টরে সংকুচিত করে, নির্ভুলতা বজায় রেখে নাটকীয়ভাবে মেমরি কাটে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

কেভি ক্যাশে অপ্টিমাইজেশানের ভবিষ্যত

কনটেক্সট উইন্ডোগুলি কয়েক হাজার বা লক্ষ লক্ষ টোকেন পর্যন্ত প্রসারিত হওয়ার সাথে সাথে কেভি ক্যাশে পরিবেশনের প্রধান খরচ হয়ে ওঠে। আক্রমনাত্মক ক্যাশে কম্প্রেশন এবং উচ্ছেদ (কম মনোযোগ টোকেন বাদ দেওয়া), ডিফল্ট হিসাবে ক্রস-রিকোয়েস্ট প্রিফিক্স শেয়ারিং, CPU বা NVMe-তে কোল্ড ক্যাশে অফলোড করা এবং MLA এবং GQA-এর মতো আর্কিটেকচারগুলি মানসম্মত হওয়ার প্রত্যাশা করুন। ক্যাশে ম্যানেজমেন্ট ক্রমবর্ধমান স্তর এবং স্মার্ট প্রিফেচিং সহ একটি সম্পূর্ণ মেমরি অনুক্রমের অনুরূপ হবে৷

বাস্তব-বিশ্ব বাস্তবায়ন

vLLM-এর PagedAttention মেমরি ফ্র্যাগমেন্টেশন ছাড়াই KV ব্লক প্যাক করে অনেক সমসাময়িক চ্যাট সেশন পরিবেশন করে

লামা মডেলগুলিতে গোষ্ঠীবদ্ধ-কোয়েরি মনোযোগ কেভি ক্যাশের আকার হ্রাস করে যাতে দীর্ঘ প্রসঙ্গগুলি GPU মেমরিতে ফিট করে

দীর্ঘ-নথির সংক্ষিপ্তকরণের সময় ক্যাশে মেমরিকে মোটামুটি অর্ধেক করতে কেভি ক্যাশে 8-বিট (KV8) এ পরিমাপ করা

প্রিফিক্স ক্যাশিং যা হাজার হাজার API অনুরোধ জুড়ে একটি শেয়ার্ড সিস্টেম প্রম্পটের KV ব্লক পুনরায় ব্যবহার করে

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KV Cache Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is KV Cache Optimization?

কেভি ক্যাশে একটি ট্রান্সফরমার ইতিমধ্যেই গণনা করা কী এবং মানগুলি সংরক্ষণ করে তাই এটি প্রতিটি নতুন টোকেনের জন্য পুনরায় কাজ করে না — তবে এটি গিগাবাইটে বেলুন করতে পারে। কেভি ক্যাশে অপ্টিমাইজেশান সেই মেমরিকে সঙ্কুচিত করে এবং পরিচালনা করে যাতে মডেলগুলি একবারে আরও ব্যবহারকারীদের কাছে দীর্ঘ প্রসঙ্গ পরিবেশন করে।

কেভি ক্যাশে কি সঞ্চয় করে এবং কেন?

আগের টোকেনগুলি থেকে ক্যাশিং কী এবং মানগুলি প্রতিটি নতুন টোকেনে মনোযোগ গণনা পুনরায় করা এড়ায়, সময় বাঁচায়।

কেন কেভি ক্যাশে একটি মেমরি সমস্যা হতে পারে?

প্রসঙ্গ দৈর্ঘ্য এবং সঙ্গতি সহ ক্যাশে আকারের স্কেল, তাই দীর্ঘ অনুরোধগুলি প্রচুর পরিমাণে GPU মেমরি ব্যবহার করতে পারে।

PagedAttention কি অপারেটিং-সিস্টেম ধারণা ধার করে?

PagedAttention একটি টেবিলের মাধ্যমে ম্যাপ করা অ-সংলগ্ন স্থির-আকারের ব্লকগুলিতে ক্যাশে সংরক্ষণ করে, ঠিক OS পেজিংয়ের মতো।

কিভাবে গ্রুপড-কোয়েরি এবং মাল্টি-কোয়েরি মনোযোগ কেভি ক্যাশের আকার কমিয়ে দেয়?

একাধিক ক্যোয়ারী হেড জুড়ে কী/মান হেড শেয়ার করা মানে সঞ্চয় করার জন্য অনেক কম K এবং V ভেক্টর।

কেভি ক্যাশে উপসর্গ ভাগ করে নেওয়ার একটি সুবিধা কী?

একটি শেয়ার্ড সিস্টেম প্রম্পট একই KV এন্ট্রি তৈরি করে, তাই একাধিক অনুরোধ একই ব্লকগুলিকে নকল করার পরিবর্তে নির্দেশ করতে পারে।