প্রযুক্তিগত গাইড

পেজড অ্যাটেনশন এবং ভিএলএলএম

PagedAttention হল একটি মেমরি-ম্যানেজমেন্ট কৌশল যা একটি বড় সংলগ্ন অংশের পরিবর্তে ছোট পুনঃব্যবহারযোগ্য ব্লকগুলিতে একটি ভাষা মডেলের মনোযোগ ক্যাশে সংরক্ষণ করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

গভীর ডুব

যখন একটি ভাষা মডেল পাঠ্য তৈরি করে, তখন এটি দেখা প্রতিটি টোকেনের জন্য একটি 'কেভি ক্যাশে' (কী এবং মান ভেক্টর) রাখে যাতে পরবর্তী টোকেনটি সম্পূর্ণ প্রসঙ্গে উপস্থিত হতে পারে। প্রথাগতভাবে প্রতিটি অনুরোধ তার সর্বোচ্চ সম্ভাব্য দৈর্ঘ্যের জন্য GPU মেমরির আকারের একটি বড় সংলগ্ন স্ল্যাব সংরক্ষিত করে, যখন ক্রমগুলি ছোট বা দৈর্ঘ্যে বৈচিত্র্যময় ছিল তখন বিপুল পরিমাণ অপচয় হয়। PagedAttention, UC Berkeley থেকে 2023 vLLM কাগজে প্রবর্তিত, অপারেটিং সিস্টেমগুলি থেকে ভার্চুয়াল মেমরি পেজিংয়ের ধারণাটি ধার করে: এটি KV ক্যাশেকে নির্দিষ্ট-আকারের ব্লকগুলিতে বিভক্ত করে যা মেমরিতে যে কোনও জায়গায় থাকতে পারে এবং চাহিদা অনুযায়ী বরাদ্দ করা যেতে পারে। একটি লুকআপ টেবিল লজিক্যাল টোকেন পজিশন ফিজিক্যাল ব্লকে ম্যাপ করে। এটি প্রায় মেমরি ফ্র্যাগমেন্টেশন দূর করে এবং ব্লকগুলিকে ভাগ করতে দেয়, উদাহরণস্বরূপ একই প্রম্পট থেকে একাধিক আউটপুট জুড়ে।

প্রযুক্তিগত অন্তর্দৃষ্টি

কেভি ক্যাশে নির্দিষ্ট-আকারের পৃষ্ঠাগুলিতে বিভক্ত করা হয়েছে, প্রতিটিতে নির্দিষ্ট সংখ্যক টোকেনের জন্য কী এবং মান রয়েছে। একটি প্রতি-ক্রম ব্লক টেবিল বাস্তব পৃষ্ঠার অবস্থানে যৌক্তিক অবস্থান ম্যাপ করে, তাই একটি সিকোয়েন্সের ক্যাশে সংলগ্ন হতে হবে না। যেহেতু অভিন্ন উপসর্গগুলি (একটি ভাগ করা সিস্টেম প্রম্পট, বা বীম-সার্চ শাখাগুলি) অনুলিপি-অন-রাইটের মাধ্যমে একই ভৌত পৃষ্ঠাগুলিকে নির্দেশ করতে পারে, মেমরি সদৃশের পরিবর্তে পুনরায় ব্যবহার করা হয়, 60% থেকে কয়েক শতাংশ পর্যন্ত বর্জ্য হ্রাস করে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

PagedAttention এবং vLLM এর ভবিষ্যত

vLLM একটি ডিফল্ট ওপেন-সোর্স ইনফারেন্স ব্যাকবোনে পরিণত হয়েছে, এবং PagedAttention-এর ধারনাগুলি এখন বেশিরভাগ পরিবেশনকারী স্ট্যাক জুড়ে প্রদর্শিত হয়। আরও গভীর উপসর্গ ক্যাশিং (ব্যবহারকারীদের জুড়ে ক্যাশে সিস্টেমের প্রম্পট পুনঃব্যবহার করা), পৃথক মেশিনে বিচ্ছিন্ন প্রিফিল এবং ডিকোড, বুদ্ধিমান উচ্ছেদ নীতি, এবং কোয়ান্টাইজেশন এবং অনুমানমূলক ডিকোডিংয়ের সাথে শক্ত একীকরণের প্রত্যাশা করুন। যেহেতু কনটেক্সট উইন্ডোগুলি লক্ষ লক্ষ টোকেনে পরিণত হয়, দক্ষ পৃষ্ঠাযুক্ত KV ব্যবস্থাপনা সাশ্রয়ী মূল্যের পরিবেশন বজায় রাখার জন্য আরও বেশি কেন্দ্রীয় হয়ে ওঠে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি ওপেন-সোর্স LLM API হোস্ট করা যেখানে vLLM উচ্চ থ্রুপুটে একটি GPU থেকে অনেক সমসাময়িক চ্যাট ব্যবহারকারীদের পরিবেশন করে

প্রিফিক্স ক্যাশিংয়ের মাধ্যমে হাজার হাজার অনুরোধ জুড়ে একটি দীর্ঘ সিস্টেম প্রম্পট শেয়ার করা যাতে এটি একবার প্রক্রিয়া করা হয়, বারবার নয়

চলমান বিম অনুসন্ধান বা একাধিক নমুনা সম্পন্ন সমাপ্তি যা কপি-অন-রাইটের মাধ্যমে সাধারণ প্রম্পটের জন্য কেভি ব্লকগুলি ভাগ করে

ফ্র্যাগমেন্টেশন থেকে GPU মেমরি বর্জ্য কাটা যাতে একজন প্রদানকারী একই হার্ডওয়্যারে আরও একযোগে সেশন প্যাক করতে পারে

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

ডিফারেনশিয়াল প্রাইভেসি

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is PagedAttention and vLLM?

PagedAttention হল একটি মেমরি-ম্যানেজমেন্ট কৌশল যা একটি বড় সংলগ্ন অংশের পরিবর্তে ছোট পুনঃব্যবহারযোগ্য ব্লকগুলিতে একটি ভাষা মডেলের মনোযোগ ক্যাশে সংরক্ষণ করে। এটি ভিএলএলএমকে শক্তি দেয়, একটি ওপেন-সোর্স পরিবেশনকারী ইঞ্জিন যা নাটকীয়ভাবে একটি একক GPU কতগুলি অনুরোধ পরিচালনা করতে পারে তা বাড়িয়ে তোলে৷

পাঠ্য তৈরির সময় 'কেভি ক্যাশে' কী সঞ্চয় করে?

কেভি ক্যাশে প্রতিটি পূর্ববর্তী টোকেনের জন্য কী এবং মান ভেক্টর ধারণ করে, মডেলটিকে প্রতিটি ধাপে পুনরায় গণনা না করে সম্পূর্ণ প্রসঙ্গে উপস্থিত হতে দেয়।

কোন অপারেটিং-সিস্টেম ধারণা পেজডঅ্যাটেনশনকে অনুপ্রাণিত করেছে?

PagedAttention ভার্চুয়াল মেমরি পেজিং ধার করে: কেভি ক্যাশে স্থির আকারের পৃষ্ঠাগুলিতে বিভক্ত করা হয় যা একটি ব্লক টেবিল দ্বারা ম্যাপ করা যে কোনও জায়গায় থাকতে পারে।

প্রথাগত কেভি ক্যাশে বরাদ্দের সাথে কোন সমস্যা PagedAttention সমাধান করে?

প্রতি অনুরোধে একটি বড় সংলগ্ন স্ল্যাব সংরক্ষণ করা, সর্বোচ্চ দৈর্ঘ্যের জন্য মাপ, বিপুল পরিমাণ GPU মেমরি নষ্ট করে। পেজিং চাহিদা অনুযায়ী ছোট ব্লক বরাদ্দ করে, বর্জ্য কমিয়ে দেয়।

PagedAttention কিভাবে একটি সাধারণ প্রম্পটের জন্য একাধিক আউটপুট মেমরি শেয়ার করতে দেয়?

অভিন্ন উপসর্গ (শেয়ার করা প্রম্পট বা বিম-সার্চ শাখা) একই ভৌত KV পৃষ্ঠাগুলিকে উল্লেখ করে, শুধুমাত্র যখন একটি শাখা বিচ্ছিন্ন হয় তখনই অনুলিপি করা হয়।

ভিএলএলএম এবং পেজডঅ্যাটেনশন মূলত কোথায় তৈরি হয়েছিল?

vLLM এবং PagedAttention অ্যালগরিদম 2023 সালের একটি কাগজে UC বার্কলে থেকে বেরিয়ে এসেছে এবং দ্রুত একটি বহুল ব্যবহৃত ওপেন-সোর্স সার্ভিং ইঞ্জিনে পরিণত হয়েছে।