প্রযুক্তিগত গাইড

মিক্সট্রাল এবং স্পারস মডেল

Mixtral হল Mistral AI-এর ওপেন মিক্সচার-অফ-বিশেষজ্ঞ মডেল যা ছোট-মডেলের গতিতে বড়-মডেলের গুণমান সরবরাহ করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

গভীর ডুব

Mixtral 8x7B, 2023 সালের শেষের দিকে Mistral AI দ্বারা প্রকাশিত, খোলা মডেলগুলিতে স্পার্স মিক্সচার-অফ-এক্সপার্টস (MoE) পদ্ধতিকে জনপ্রিয় করেছে। এটিতে প্রতি স্তরে আটটি পৃথক 'বিশেষজ্ঞ' ফিড-ফরোয়ার্ড নেটওয়ার্ক রয়েছে, প্রায় 47 বিলিয়ন মোট প্যারামিটার সহ, তবে একটি হালকা ওজনের রাউটার প্রতিটি টোকেনের জন্য মাত্র দুইজন বিশেষজ্ঞ নির্বাচন করে। ফলস্বরূপ, প্রতি টোকেন প্রতি মাত্র 13 বিলিয়ন প্যারামিটার সক্রিয় থাকে, তাই অনুমানগুলি 13B ঘন মডেলের মতো দ্রুত চলে এবং অনেক বড়গুলির সাথে তুলনীয় গুণমানে পৌঁছায়। মিক্সট্রাল অনেক বেঞ্চমার্কে GPT-3.5 এবং Llama 2 70B-এর সাথে মিলেছে বা বিট করছে যখন পরিবেশন করা দ্রুত এবং সস্তা। Mistral পরে Mixtral 8x22B প্রকাশ করে। মডেলটি Apache 2.0-এর অধীনে প্রকাশ্যে লাইসেন্সপ্রাপ্ত, ওপেন-সোর্স সম্প্রদায়ে দ্রুত গ্রহণ এবং সূক্ষ্ম-টিউনিংকে ত্বরান্বিত করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

একটি বিরল MoE স্তরে, ঘন ফিড-ফরোয়ার্ড ব্লকটি N বিশেষজ্ঞ নেটওয়ার্ক এবং একটি ছোট গেটিং নেটওয়ার্ক (রাউটার) দ্বারা প্রতিস্থাপিত হয়। প্রতিটি টোকেনের জন্য, রাউটার স্কোর গণনা করে এবং টপ-কে বিশেষজ্ঞদের বাছাই করে (মিক্সট্রালে শীর্ষ-২), শুধুমাত্র তাদের মাধ্যমে টোকেন রাউটিং করে। তাদের আউটপুট ওজনযুক্ত এবং সমষ্টি করা হয়। যেহেতু বেশিরভাগ বিশেষজ্ঞ টোকেন প্রতি নিষ্ক্রিয় থাকেন, মডেলটি মেমরিতে অনেক পরামিতি ধারণ করে তবুও অনেক কম গণনা করে। ট্রেড-অফ: সমস্ত বিশেষজ্ঞদের অবশ্যই VRAM-এ লোড করতে হবে যদিও শুধুমাত্র কিছু দৌড়ায়।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

মিক্সট্রাল এবং স্পারস মডেলের ভবিষ্যত

Sparse MoE এখন সীমান্ত AI এর কেন্দ্রবিন্দু। আরও উন্মুক্ত MoE রিলিজ, অনেক ছোট বিশেষজ্ঞের সাথে সূক্ষ্ম-দানাযুক্ত রাউটিং এবং ভাগ করা বা হাইব্রিড বিশেষজ্ঞ ডিজাইনের প্রত্যাশা করুন যা দক্ষতা আরও উন্নত করে। যেহেতু মডেলগুলি ট্রিলিয়ন মোট প্যারামিটারের দিকে স্কেল করে, অনুমানকে সাশ্রয়ী রাখার জন্য স্পার্সিটি প্রধান লিভার। গবেষণা MoE এর দুর্বল দাগ, বিশেষজ্ঞদের জুড়ে লোডের ভারসাম্য, মেমরি ওভারহেড এবং প্রশিক্ষণের স্থিতিশীলতা মোকাবেলা করছে, যখন হার্ডওয়্যার এবং পরিবেশন স্ট্যাক ক্রমবর্ধমানভাবে বিশেষজ্ঞ রাউটিং এর জন্য বিশেষভাবে অপ্টিমাইজ করে।

বাস্তব-বিশ্ব বাস্তবায়ন

অনেক ছোট ঘন মডেলের খরচ এবং গতিতে একটি উচ্চ-মানের চ্যাটবট পরিবেশন করা

ব্যবহার ফি ছাড়া বাণিজ্যিক পণ্যের জন্য Apache-2.0 লাইসেন্সকৃত মডেলের স্ব-হোস্টিং

কোডিং, সংক্ষিপ্তকরণ, বা বহুভাষিক কাজের জন্য Mixtral-এ স্বতন্ত্র আচরণের সূক্ষ্ম সুর করা

একটি একক মাল্টি-জিপিইউ সার্ভারে দ্রুত অনুমান চালানো যেখানে একটি 70B ঘন মডেল খুব ধীর হবে

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

মডেল এবং পাইপলাইন সমান্তরালতা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Mixtral and Sparse Models?

Mixtral হল Mistral AI-এর ওপেন মিক্সচার-অফ-বিশেষজ্ঞ মডেল যা ছোট-মডেলের গতিতে বড়-মডেলের গুণমান সরবরাহ করে। এটির মতো স্পার্স মডেলগুলি টোকেন প্রতি তাদের প্যারামিটারের একটি ভগ্নাংশ সক্রিয় করে, সামর্থ্যের ত্যাগ ছাড়াই গণনা কাটে।

Mixtral 8x7B-তে, কতজন বিশেষজ্ঞ প্রতিটি পৃথক টোকেন প্রক্রিয়া করেন?

মিক্সট্রাল টপ-২ রাউটিং ব্যবহার করে: একটি রাউটার প্রতিটি টোকেন প্রক্রিয়া করার জন্য আট বিশেষজ্ঞের মধ্যে দুজনকে বেছে নেয়।

কোন কম্পোনেন্ট সিদ্ধান্ত নেয় কোন বিশেষজ্ঞদের কাছে টোকেন পাঠানো হবে?

একটি ছোট গেটিং নেটওয়ার্ক, যাকে রাউটার বলা হয়, বিশেষজ্ঞদের স্কোর করে এবং কোনটি প্রতিটি টোকেন পরিচালনা করবে তা নির্বাচন করে।

যদিও Mixtral 8x7B এর মোট 47B প্যারামিটার রয়েছে, মোটামুটিভাবে প্রতি টোকেন কতজন সক্রিয়?

কারণ প্রতি টোকেনে মাত্র দুইজন বিশেষজ্ঞ চালান, মোটামুটি 13 বিলিয়ন প্যারামিটার সক্রিয়, যা এটিকে অনেক ছোট মডেলের গতি দেয়।

Mixtral এর মত স্পার্স MoE মডেলের মূল ট্রেড-অফ কি?

MoE টোকেন প্রতি কম্পিউট সংরক্ষণ করে কিন্তু তবুও সমস্ত বিশেষজ্ঞকে VRAM-এ রাখা প্রয়োজন, মেমরির চাহিদা বাড়ায়।

কোন লাইসেন্সের অধীনে মিস্ট্রাল এআই মিক্সট্রাল প্রকাশ করেছে, উন্মুক্ত দত্তক গ্রহণের জন্য?

Mixtral অনুমতিপ্রাপ্ত Apache 2.0 লাইসেন্সের অধীনে মুক্তি পেয়েছিল, বিনামূল্যে বাণিজ্যিক ব্যবহার এবং সূক্ষ্ম-টিউনিংয়ের অনুমতি দেয়।