প্রযুক্তিগত গাইড

MoE পরিবেশনের জন্য বিশেষজ্ঞ সমান্তরালতা

বিশেষজ্ঞ সমান্তরালতা একটি মিক্সচার-অফ-এক্সপার্টস মডেলের অনেকগুলি ফিড-ফরোয়ার্ড 'বিশেষজ্ঞদের' বিভিন্ন GPU জুড়ে বিভক্ত করে যাতে প্রতিটি ডিভাইসে প্যারামিটারের একটি স্লাইস থাকে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

গভীর ডুব

একটি মিক্সচার-অফ-এক্সপার্টস (MoE) স্তর একটি বড় ফিড-ফরোয়ার্ড নেটওয়ার্ককে অনেক ছোট (বিশেষজ্ঞ) এবং একটি রাউটার দিয়ে প্রতিস্থাপন করে যা প্রতি টোকেন প্রতি টপ-কে (প্রায়ই 1 বা 2) বিশেষজ্ঞ বেছে নেয়। বিশেষজ্ঞ সমান্তরালতা (EP) বিভিন্ন বিশেষজ্ঞদের বিভিন্ন GPU-তে রাখে। অনুমানে, রাউটার সিদ্ধান্ত নেয় কোন বিশেষজ্ঞদের প্রতিটি টোকেনের প্রয়োজন, তারপর একটি সর্ব-টু-অল যোগাযোগ পদক্ষেপ তাদের নির্বাচিত বিশেষজ্ঞদের ধরে থাকা GPU-তে টোকেনগুলিকে শাফেল করে, FFN চালায়, এবং ফলাফলগুলিকে এলোমেলো করে দেয়৷ এটি একটি মডেলের বিশাল মোট প্যারামিটার (স্পার্স) থাকতে দেয় যখন টোকেন প্রতি একটি ছোট ভগ্নাংশ সক্রিয় করে (নিম্ন FLOPs)। Mixtral 8x7B, DeepSeek-V3, এবং GPT-OSS এর মতো মডেলগুলি এটি ব্যবহার করে। কঠিন অংশগুলি বিশেষজ্ঞদের জুড়ে ভারসাম্য বজায় রাখা এবং দুটি ব্যয়বহুল অল-টু-অল হপস প্রতি স্তর।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল মেকানিক হল প্রতি MoE স্তরের জন্য দুটি অল-টু-অল সমষ্টি: প্রেরণ (তাদের বিশেষজ্ঞদের কাছে টোকেন পাঠান) এবং একত্রিত করুন (আউটপুট ফিরে সংগ্রহ করুন)। যেহেতু রাউটিং ডেটা-নির্ভর, প্রতিটি বিশেষজ্ঞকে আঘাতকারী টোকেনের সংখ্যা পরিবর্তিত হয়, যার ফলে লোড ভারসাম্যহীনতা এবং 'স্ট্র্যাগলার' হয়। সার্ভিং সিস্টেমগুলি জিইএমএমগুলিকে (ম্যাট্রিক্স গুণিত করে) অভিন্ন রাখতে সক্ষমতার কারণ, বিশেষজ্ঞ বাফার এবং টোকেন ড্রপিং বা প্যাডিং যুক্ত করে এবং প্রায়ই বিলম্ব লুকানোর জন্য বিশেষজ্ঞ গণনার মাধ্যমে সর্বোপরি যোগাযোগকে ওভারল্যাপ করে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

MoE পরিবেশনের জন্য বিশেষজ্ঞ সমান্তরালতার ভবিষ্যত

রাউটিং এবং হার্ডওয়্যারের আরও কঠোর সহ-ডিজাইন আশা করুন: ফিউজড ডিসপ্যাচ-কম্পিউট-কম্বাইন কার্নেল, গোষ্ঠীবদ্ধ GEMM যা অনেক বিশেষজ্ঞকে ব্যাচ করে এবং NVLink/InfiniBand-অল-টু-অল-সচেতন। DeepSeek-এর সহায়ক-ক্ষতি-মুক্ত ব্যালেন্সিং এবং নোড-সীমিত রাউটিং-এর মতো কৌশলগুলি ক্রস-নোড ট্র্যাফিক হ্রাস করে। বিচ্ছিন্ন পরিবেশন 'বিশেষজ্ঞ' GPU গুলিকে মনোযোগী GPU গুলি থেকে আলাদা করে দেবে, এবং সূক্ষ্ম টপ-কে সহ বৃহত্তর বিশেষজ্ঞ গণনা (শতশত) প্রতি-টোকেন খরচ সমতল রেখে MoE কে চরম স্পর্সিটির দিকে ঠেলে দেবে।

বাস্তব-বিশ্ব বাস্তবায়ন

প্রতিটি ডিভাইসে তার 8 বিশেষজ্ঞের মধ্যে 2-4 জনকে রেখে 2-4 GPU জুড়ে Mixtral 8x7B পরিবেশন করা হচ্ছে

DeepSeek-V3 নোড-সীমিত রাউটিং ব্যবহার করে একটি টোকেনের বিশেষজ্ঞরা কতগুলি নোড স্প্যান করে তা ক্যাপ করে, ইন্টার-নোড অল-টু-অল কাটে

একটি একক 8-GPU নোডে 200B+ স্পারস মডেল হোস্ট করতে vLLM বা SGLang বিশেষজ্ঞ-সমান্তরাল মোড ব্যবহার করে

একটি হাইব্রিড ইপি + টিপি স্থাপনায় মনোযোগ স্তরে টেনসর সমান্তরালতার সাথে বিশেষজ্ঞ সমান্তরালতার সংমিশ্রণ

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

ডিস্যাগ্রিগেটেড প্রিফিল এবং ডিকোড সার্ভিং

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Expert Parallelism for MoE Serving?

বিশেষজ্ঞ সমান্তরালতা একটি মিক্সচার-অফ-এক্সপার্টস মডেলের অনেকগুলি ফিড-ফরোয়ার্ড 'বিশেষজ্ঞদের' বিভিন্ন GPU জুড়ে বিভক্ত করে যাতে প্রতিটি ডিভাইসে প্যারামিটারের একটি স্লাইস থাকে। ট্রিলিয়ন-প্যারামিটার MoE মডেলগুলিকে সস্তায় পরিবেশন করার মূল চাবিকাঠি, যেহেতু শুধুমাত্র কিছু বিশেষজ্ঞ টোকেন প্রতি চালান।

বিশেষজ্ঞ সমান্তরালতা জিপিইউ জুড়ে কি বিতরণ করে?

বিশেষজ্ঞ সমান্তরালতা বিভিন্ন বিশেষজ্ঞদের (একটি MoE স্তরের FFN সাব-নেটওয়ার্ক) বিভিন্ন GPU-তে রাখে, তাই প্রতিটি ডিভাইসে বিশেষজ্ঞদের একটি উপসেট থাকে।

কোন যোগাযোগ প্যাটার্ন MoE বিশেষজ্ঞ সমান্তরাল কেন্দ্রীয়?

প্রতিটি MoE স্তরের সাধারণত তাদের বিশেষজ্ঞদের কাছে টোকেন পাঠানোর জন্য একটি অল-টু-অল এবং আউটপুটগুলিকে একত্রিত করার জন্য আরেকটি অল-টু-অল প্রয়োজন।

বিশাল মোট প্যারামিটার থাকা সত্ত্বেও কেন MoE প্রতি-টোকেন গণনা কম রাখে?

একটি রাউটার শুধুমাত্র টপ-কে বিশেষজ্ঞদের (প্রায়শই 1-2) প্রতি টোকেন সক্রিয় করে, তাই মডেলটিতে মোট অনেক বিশেষজ্ঞ থাকা সত্ত্বেও FLOPগুলি ছোট থাকে।

রাউটিং ডেটা-নির্ভর হওয়ার কারণে কী সমস্যা দেখা দেয়?

যেহেতু রাউটারের পছন্দগুলি ইনপুটের উপর নির্ভর করে, তাই কিছু বিশেষজ্ঞ অন্যদের তুলনায় অনেক বেশি টোকেন পান, যা লোড ভারসাম্যহীনতা এবং স্ট্রাগলার তৈরি করে।

বিশেষজ্ঞ ম্যাট্রিক্স গুণিতক আকারে অভিন্ন রাখার একটি সাধারণ কৌশল কী?

পরিবেশন করা স্ট্যাকগুলি প্রতি-বিশেষজ্ঞের ক্ষমতা (একটি সর্বাধিক টোকেন গণনা) এবং এর বাইরে প্যাড বা ড্রপ টোকেন সেট করে যাতে প্রতিটি বিশেষজ্ঞের GEMM এর একটি অনুমানযোগ্য আকৃতি থাকে৷