মাল্টি-কোয়েরি মনোযোগ
মাল্টি-কোয়েরি অ্যাটেনশন (MQA) হল ট্রান্সফরমার মনোযোগের উপর একটি মেমরি-সেভিং টুইস্ট যা সমস্ত মনোযোগের মাথায় এক সেট কী এবং মান শেয়ার করে।
ওভারভিউ
It dramatically speeds up text generation by shrinking the memory the model must shuffle around.
গভীর ডুব
স্ট্যান্ডার্ড মাল্টি-হেড মনোযোগ প্রতিটি মাথাকে তার নিজস্ব প্রশ্ন, কী, এবং মান অনুমান দেয়। জেনারেশনের সময়, অতীতের সমস্ত টোকেনের জন্য কী এবং মানগুলি অবশ্যই ক্যাশে করা এবং প্রতিটি ধাপে পুনরায় লোড করা উচিত — এই কেভি ক্যাশে প্রধান বাধা হয়ে দাঁড়ায়, যেহেতু মেমরি থেকে এটি পড়া গণিতের চেয়ে ধীর। 2019 সালে Noam Shazeer দ্বারা প্রস্তাবিত মাল্টি-কোয়েরি অ্যাটেনশন, মাথা পিছু আলাদা ক্যোয়ারী প্রজেকশন রাখে কিন্তু কী এবং মানগুলিকে একক শেয়ার করা হেডে ভেঙে দেয়। এটি হেডের সংখ্যার সমান একটি গুণক দ্বারা কেভি ক্যাশে সঙ্কুচিত করে, কখনও কখনও 8x থেকে 64x ছোট। ফলাফল হল অনেক দ্রুত অটোরিগ্রেসিভ ডিকোডিং এবং একটি হালকা মেমরি ফুটপ্রিন্ট, শুধুমাত্র একটি শালীন মানের ডিপ সহ। একটি মধ্যম স্থল, গোষ্ঠীবদ্ধ-কোয়েরি মনোযোগ, বাণিজ্য বন্ধের ভারসাম্য বজায় রাখে।
প্রযুক্তিগত অন্তর্দৃষ্টি
MQA-তে, ক্যোয়ারী ওজনগুলি এখনও H পৃথক ক্যোয়ারী ভেক্টর তৈরি করে, তবে একটি একক কী অভিক্ষেপ এবং একক মান অভিক্ষেপ সমস্ত মাথা জুড়ে ভাগ করা হয়। প্রতিটি মাথা একই কী এবং মানগুলির বিরুদ্ধে নিজস্ব ক্যোয়ারী ব্যবহার করে মনোযোগ গণনা করে। কারণ ক্যাশ করা K এবং V টেনসরগুলি আর মাথার সংখ্যার সাথে স্কেল করে না, ডিকোডিংয়ের সময় মেমরি ব্যান্ডউইথ দ্রুত হ্রাস পায় — এবং ব্যান্ডউইথ, গণনা নয়, যা আধুনিক এক্সিলারেটরগুলিতে গেট জেনারেশনের গতি বাড়িয়ে দেয়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
মাল্টি-কোয়েরি মনোযোগের ভবিষ্যত
MQA প্রতিষ্ঠিত করেছে যে আপনি সামান্য ক্ষতির সাথে অপ্রয়োজনীয় কী/মূল্যের মাথা ছাঁটাই করতে পারেন, এবং সেই অন্তর্দৃষ্টি এখন প্রায় প্রতিটি দ্রুত-অনুমান এলএলএমকে আকার দেয়। ক্ষেত্রটি মূলত গ্রুপড-কোয়েরি অ্যাটেনশন (GQA) তে একত্রিত হয়েছে, যা Llama 2/3 এবং আরও অনেকগুলিতে ব্যবহৃত হয়েছে, যা বেশিরভাগ গতি বজায় রেখে গুণমান পুনরুদ্ধার করতে একটির পরিবর্তে কয়েকটি KV গ্রুপ ব্যবহার করে। ভবিষ্যত কাজ এই ধারণাগুলিকে কেভি-ক্যাশে কম্প্রেশন, কোয়ান্টাইজেশন এবং বহু-সুপ্ত মনোযোগের সাথে মিশ্রিত করে যাতে দীর্ঘ প্রসঙ্গ এবং সস্তা পরিবেশন করা যায়।
বাস্তব-বিশ্ব বাস্তবায়ন
চ্যাট অ্যাসিস্ট্যান্টগুলিতে টোকেন-বাই-টোকেন প্রজন্মের গতি বাড়ানো যেখানে কেভি ক্যাশে, কাঁচা গণনা নয়, থ্রুপুট সীমাবদ্ধ করে।
Google এর PaLM, যা দক্ষ বড়-স্কেল অনুমান সক্ষম করতে বহু-কোয়েরি মনোযোগ ব্যবহার করে।
প্রতি-অনুরোধ KV ক্যাশে মেমরি সঙ্কুচিত করে একটি GPU-তে অনেক সমসাময়িক ব্যবহারকারীদের পরিবেশন করা হচ্ছে।
Llama 2 70B এবং Llama 3-এ গোষ্ঠীবদ্ধ-কোয়েরি মনোযোগ, সম্পূর্ণ-মনোযোগ গুণের সাথে MQA-এর গতির ভারসাম্য রক্ষাকারী সরাসরি বংশধর।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
দলবদ্ধ-কোয়েরি মনোযোগ
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Multi-Query Attention?
মাল্টি-কোয়েরি অ্যাটেনশন (MQA) হল ট্রান্সফরমার মনোযোগের উপর একটি মেমরি-সেভিং টুইস্ট যা সমস্ত মনোযোগের মাথায় এক সেট কী এবং মান শেয়ার করে। এটি নাটকীয়ভাবে মেমরিকে সঙ্কুচিত করে টেক্সট জেনারেশনের গতি বাড়ায় যা মডেলের চারপাশে এলোমেলো করতে হবে।
মাল্টি-কোয়েরি অ্যাটেনশন সমস্ত মনোযোগের মাথা জুড়ে কী ভাগ করে?
MQA মাথা পিছু আলাদা প্রশ্ন রাখে কিন্তু সব মাথা জুড়ে একটি মূল অভিক্ষেপ এবং একটি মান অভিক্ষেপ শেয়ার করে।
অটোরিগ্রেসিভ জেনারেশনের সময় MQA যে প্রাথমিক বাধা দেয় তা কী?
বড় কেভি ক্যাশে পুনরায় লোড করা প্রতিটি ধাপ ব্যান্ডউইথ-বাউন্ড; MQA ডিকোডিং গতি বাড়াতে সেই ক্যাশে সঙ্কুচিত করে।
মোটামুটি কোন ফ্যাক্টর দ্বারা MQA কেভি ক্যাশে সঙ্কুচিত করে?
যেহেতু কী এবং মানগুলি H হেড থেকে একটিতে ভেঙে যায়, তাই ক্যাশে প্রায় হেড গণনা দ্বারা সঙ্কুচিত হয়।
MQA ব্যবহার করার প্রধান ট্রেড-অফ কি?
কী এবং মান শেয়ার করা প্রতিনিধিত্বমূলক ক্ষমতাকে কিছুটা কমিয়ে দেয়, যার ফলে বড় গতি লাভের বিনিময়ে একটি ছোট মানের হ্রাস ঘটে।
স্ট্যান্ডার্ড মাল্টি-হেড অ্যাটেনশন এবং MQA এর মধ্যে কোন বৈকল্পিকটি বসে?
গ্রুপড-কোয়েরি অ্যাটেনশন (GQA) গুণমান এবং গতির ভারসাম্য বজায় রেখে একটির পরিবর্তে বেশ কয়েকটি কেভি গ্রুপ ব্যবহার করে।