ডিস্যাগ্রিগেটেড প্রিফিল এবং ডিকোড সার্ভিং
একটি পরিবেশনকারী আর্কিটেকচার যা বৃহৎ ভাষা মডেল অনুমানকে দুটি পৃথক পর্যায়ে বিভক্ত করে-প্রিফিল এবং ডিকোড-এবং সেগুলিকে GPU-এর বিভিন্ন পুলে চালায়।
ওভারভিউ
It matters because these two phases have opposite hardware appetites, and forcing them onto the same machines wastes capacity and hurts latency.
গভীর ডুব
যখন একটি LLM উত্তর দেয়, এটি দুটি পর্যায়ে কাজ করে। প্রিফিল একবারে পুরো প্রম্পটটি পড়ে এবং কী-মান (KV) ক্যাশে তৈরি করে; এটি একটি বড়, সমান্তরাল, কম্পিউট-বাউন্ড বার্স্ট যা GPU-এর গণিত ইউনিটগুলিকে পরিপূর্ণ করে। ডিকোড তারপরে একবারে একটি করে টোকেন তৈরি করে, প্রতিটি ধাপ পুরো কেভি ক্যাশে পড়ে—একটি মেমরি-ব্যান্ডউইথ-বাউন্ড, হালকাভাবে গণনা করা ট্রিকল। একসাথে চালান, একটি দীর্ঘ প্রিফিল প্রত্যেকের ডিকোড (হেড-অফ-লাইন ব্লকিং) স্টল করে এবং দুটি ব্যাচ করা হস্তক্ষেপ তৈরি করে। ডিস্যাগ্রিগেশন একটি জিপিইউ পুলে প্রিফিল রাখে এবং অন্যটিতে ডিকোড করে, এনভিলিঙ্ক বা ইনফিনিব্যান্ডের মতো দ্রুত আন্তঃসংযোগের মাধ্যমে তাদের মধ্যে কেভি ক্যাশে স্থানান্তর করে। প্রতিটি পুল স্বাধীনভাবে টিউন করা হয় এবং স্কেল করা হয়, গুডপুট উন্নত করে, টেইল লেটেন্সি মসৃণ করে এবং অপারেটরদেরকে একই সাথে টাইম-টু-ফার্স্ট-টোকেন এবং সময়-প্রতি-আউটপুট-টোকেন লক্ষ্যে আঘাত করতে দেয়।
প্রযুক্তিগত অন্তর্দৃষ্টি
দুটি পর্যায় তাদের বাধার মধ্যে পৃথক। প্রিফিল সমান্তরালভাবে সমস্ত প্রম্পট টোকেন প্রক্রিয়া করে, তাই এর FLOPs প্রম্পট দৈর্ঘ্যের সাথে স্কেল করে এবং এটি টেনসর কোরগুলিকে সর্বাধিক করে। ডিকোড অটোরিগ্রেসিভ: প্রতিটি নতুন টোকেনের জন্য একটি ফরোয়ার্ড পাস প্রয়োজন যা HBM থেকে সম্পূর্ণ কেভি ক্যাশে পুনরায় পাঠ করে, তাই থ্রুপুট মেমরি ব্যান্ডউইথ দ্বারা গেট করা হয়, গণনা নয়। ডিস্যাগ্রিগেশন প্রতিটি পুলের জন্য সাইজিং, ব্যাচিং এবং এমনকি বিভিন্ন সমান্তরালতা বেছে নেওয়ার মাধ্যমে এটিকে কাজে লাগায়, তারপর প্রিফিল কর্মীদের থেকে কেভি ক্যাশে কর্মীদের ডিকোড করার জন্য পাঠানো হয়।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
ডিস্যাগ্রিগেটেড প্রিফিল এবং ডিকোড সার্ভিংয়ের ভবিষ্যত
প্রোডাকশন স্ট্যাকগুলিতে ডিফল্ট হয়ে যাওয়ার আশা করুন। ডিস্টসার্ভ, স্প্লিটওয়াইজ এবং মুনকেকের মতো সিস্টেমগুলি এটিকে জনপ্রিয় করেছে এবং ভিএলএলএম এবং এনভিআইডিআইএ ডায়নামো এখন বিচ্ছিন্ন মোডগুলি প্রেরণ করে। গবেষণা KV-ক্যাশে স্থানান্তর অপ্টিমাইজেশান, ক্যাশে পুলিং এবং অনুরোধ জুড়ে পুনঃব্যবহার, স্থানান্তরিত ট্র্যাফিকের অধীনে প্রিফিল/ডিকোড অনুপাতের গতিশীল পুনঃভারসাম্য, এবং প্রিফিক্স ক্যাশিং এবং খণ্ডিত প্রিফিলের সাথে কঠোর সংহতকরণকে ঠেলে দিচ্ছে। যেহেতু কনটেক্সট উইন্ডোগুলি লক্ষ লক্ষ টোকেনে পরিণত হয়, এই পর্যায়গুলিকে আলাদা করা খরচ-কার্যকর, কম লেটেন্সি পরিবেশনের জন্য ক্রমবর্ধমান অপরিহার্য হয়ে ওঠে৷
বাস্তব-বিশ্ব বাস্তবায়ন
একটি চ্যাট সহকারী দীর্ঘ নথিকে একটি গণনা-ভারী প্রিফিল ক্লাস্টারে প্রম্পট করে, তারপর টাইপিং লেটেন্সি মসৃণ রাখতে একটি মেমরি-অপ্টিমাইজড ডিকোড ক্লাস্টার থেকে উত্তরগুলি স্ট্রিম করে৷
NVIDIA Dynamo এবং vLLM অপারেটরদের আলাদা প্রিফিল এবং ডিকোড কর্মী গোষ্ঠী স্থাপন করতে দেয় যাতে দীর্ঘ প্রম্পটগুলির একটি বিস্ফোরণ চলমান প্রজন্মকে স্থির না করে।
মুনকেক (মুনশট এআই-এর কিমি দ্বারা ব্যবহৃত) প্রিফিল এবং ডিকোড আলাদা করে এবং স্কেলে অপ্রয়োজনীয় প্রম্পট পুনর্গণনা কাটতে একটি বিতরণ করা কেভি-ক্যাশ পুল যোগ করে।
একটি কোড-সম্পূর্ণতা পরিষেবা ছোট প্রম্পটগুলির জন্য একটি ছোট প্রিফিল পুল এবং একটি বড় ডিকোড পুল উত্সর্গ করে, যেহেতু বেশিরভাগ খরচ অনেকগুলি আউটপুট টোকেন স্ট্রিমিং থেকে আসে।
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Disaggregated Prefill and Decode Serving quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
KServe এবং Kubernetes-এ মডেল পরিবেশন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Disaggregated Prefill and Decode Serving?
একটি পরিবেশনকারী আর্কিটেকচার যা বৃহৎ ভাষা মডেল অনুমানকে দুটি পৃথক পর্যায়ে বিভক্ত করে-প্রিফিল এবং ডিকোড-এবং সেগুলিকে GPU-এর বিভিন্ন পুলে চালায়। এটি গুরুত্বপূর্ণ কারণ এই দুটি পর্যায়ের হার্ডওয়্যারের ক্ষুধা বিপরীত, এবং একই মেশিনে জোর করে তাদের ক্ষমতা নষ্ট করে এবং লেটেন্সি ক্ষতি করে।
বিভিন্ন GPU পুলগুলিতে প্রিফিল এবং ডিকোড আলাদা করার মূল হার্ডওয়্যার কারণ কী?
প্রিফিল পুরো প্রম্পটটিকে সমান্তরালভাবে প্রসেস করে এবং কম্পিউটকে স্যাচুরেট করে, যখন ডিকোড কেভি ক্যাশে প্রতিটি ধাপে পড়ে এবং মেমরি ব্যান্ডউইথ দ্বারা সীমিত - বিপরীত ক্ষুধা যা পৃথক, স্বাধীনভাবে টিউন করা পুলকে সমর্থন করে।
প্রিফিল কর্মীদের থেকে কর্মীদের ডিকোড করার জন্য কোন ডেটা কাঠামো স্থানান্তর করতে হবে?
প্রম্পটের জন্য প্রিফিল কেভি ক্যাশে তৈরি করে; জেনারেট করা চালিয়ে যাওয়ার জন্য ডিকোডের সেই ক্যাশে প্রয়োজন, তাই ক্যাশে ডিকোড পুলের সাথে দ্রুত ইন্টারকানেক্টের মাধ্যমে পাঠানো হয়।
ভাগ করা-জিপিইউ সেটআপে কোন সমস্যাটি বিশেষভাবে হ্রাস করে?
শেয়ার্ড জিপিইউতে একটি দীর্ঘ প্রিফিল বার্স্ট চলমান ডিকোড পদক্ষেপগুলিকে ব্লক করতে পারে; তাদের আলাদা করা সেই হস্তক্ষেপ রোধ করে এবং লেজের লেটেন্সি স্থিতিশীল করে।
কেন প্রিফিল আক্রমনাত্মকভাবে ব্যাচ করা যেতে পারে কিন্তু বিভিন্ন টিউনিং থেকে ডিকোড সুবিধা?
প্রিফিল সমস্ত প্রম্পট টোকেন একসাথে প্রক্রিয়া করে, তাই বড় ব্যাচগুলি টেনসর কোরগুলিকে ভালভাবে খাওয়ায়; ডিকোড একবারে একটি টোকেন তৈরি করে এবং মেমরি দ্বারা গেট করা হয়, তাই এটি ভিন্নভাবে স্কেল করে।
বিচ্ছিন্ন পুলগুলির মধ্যে কেভি ক্যাশে সরানোর জন্য কোন আন্তঃসংযোগগুলি সাধারণত ব্যবহৃত হয়?
উচ্চ-ব্যান্ডউইথ, NVLink (ইন্টার-নোড) এবং InfiniBand (ইন্টার-নোড) এর মতো কম-বিলম্বিত লিঙ্কগুলির প্রয়োজন যাতে KV-ক্যাশে স্থানান্তর নতুন বাধা হয়ে না যায়।