প্রযুক্তিগত গাইড

বড় মডেলের জন্য টেনসর সমান্তরালতা

একাধিক GPU জুড়ে একটি একক নিউরাল-নেটওয়ার্ক স্তরের মধ্যে গণিতকে বিভক্ত করার একটি উপায় যাতে একটি ডিভাইসের জন্য খুব বড় একটি মডেল এখনও চলতে পারে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

এটা গুরুত্বপূর্ণ কারণ ফ্রন্টিয়ার মডেলের শত শত বিলিয়ন প্যারামিটার রয়েছে যা কোনো একক GPU একাই যথেষ্ট দ্রুত ধরে রাখতে বা গণনা করতে পারে না।

গভীর ডুব

টেনসর সমান্তরালতা (যাকে ইন্ট্রা-লেয়ার মডেল প্যারালেলিজমও বলা হয়) পৃথক ডিভাইসে সম্পূর্ণ স্তর রাখার পরিবর্তে জিপিইউ জুড়ে স্বতন্ত্র ওজন ম্যাট্রিক্সকে ভাগ করে। একটি ট্রান্সফরমারে, বড় ম্যাট্রিক্সের গুণন—মনোযোগ অনুমান এবং ফিড-ফরোয়ার্ড MLP—বিভক্ত হয়: উদাহরণস্বরূপ, MLP-এর প্রথম ওজন ম্যাট্রিক্সটি কলাম এবং দ্বিতীয়টি সারি দ্বারা বিভক্ত, তাই প্রতিটি GPU একটি স্লাইস গণনা করে এবং একটি একক অল-রিডুস ফলাফলগুলিকে একত্রিত করে। প্রতিটি জিপিইউ একটি সাবসেট পরিচালনা করে মনোযোগ বিভক্ত করা হয়। যেহেতু প্রতিটি GPU একই সাথে প্রতিটি স্তরের অংশ করে, তাই টেনসর সমান্তরালতা প্রতি-GPU মেমরিকে হ্রাস করে এবং গণনার গতি বাড়ায়, তবে এটি প্রতিটি স্তরের GPU-এর মধ্যে ঘন ঘন, উচ্চ-ব্যান্ডউইথ যোগাযোগের দাবি করে। এই কারণেই এটি সাধারণত NVLink দ্বারা সংযুক্ত একটি নোডের মধ্যে সীমাবদ্ধ থাকে এবং খুব বড় প্রশিক্ষণ এবং পরিবেশন কাজের জন্য পাইপলাইন এবং ডেটা সমান্তরালতার সাথে মিলিত হয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

মেগাট্রন-এলএম দ্বারা জনপ্রিয় এই কৌশলটি পার্টিশনের মাত্রা নির্বাচন করছে যাতে যোগাযোগ ন্যূনতম হয়। প্রথম MLP ম্যাট্রিক্স কলাম অনুযায়ী বিভক্ত করা প্রতিটি GPU-কে কোনো সিঙ্ক ছাড়াই স্থানীয়ভাবে ননলিনিয়ারিটি প্রয়োগ করতে দেয়; দ্বিতীয় সারি-ভিত্তিক বিভক্ত করার অর্থ হল আউটপুটগুলির আংশিক ফলাফলের যোগফলের জন্য শুধুমাত্র একটি অল-রিডুস প্রয়োজন। প্রতিটি স্তর এইভাবে মোটামুটিভাবে দুটি অল-রিডুস (ফরওয়ার্ড) এবং দুটি (পেছনগামী) বহন করে। যেহেতু এই সমষ্টিগুলি প্রতিটি স্তরে ঘটে, তাই লেটেন্সি প্রাধান্য পায়—তাই টেনসর সমান্তরালতা ধীর আন্তঃ-নোড নেটওয়ার্কের পরিবর্তে এনভিলিঙ্কের মতো দ্রুত ইন্ট্রা-নোড লিঙ্কগুলির পিছনে থাকে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

বড় মডেলের জন্য টেনসর সমান্তরালতার ভবিষ্যত

টেনসর সমান্তরালতা ভিত্তিগত রয়ে গেছে কিন্তু ক্রমবর্ধমানভাবে '3D সমান্তরালতা' (টেনসর + পাইপলাইন + ডেটা) এ মিশ্রিত হচ্ছে এবং মিক্সচার-অফ-এক্সপার্টস মডেলের জন্য বিশেষজ্ঞ সমান্তরালতার সাথে মিলিত হচ্ছে। মেগাট্রন-এলএম, ডিপস্পিড এবং ভিএলএলএম-এর মতো ফ্রেমওয়ার্কগুলি শার্ডিংকে স্বয়ংক্রিয় করে। GPU আন্তঃসংযোগ (NVLink, NVSwitch) এবং অপটিক্যাল কাপড় দ্রুততর হওয়ার সাথে সাথে নোড-সীমার সীমা শিথিল হয়, বিস্তৃত টেনসর-সমান্তরাল গোষ্ঠীগুলিকে অনুমতি দেয়। একটি প্রদত্ত ক্লাস্টার টপোলজির জন্য যোগাযোগকে ন্যূনতম করতে তীক্ষ্ণ মাত্রা এবং গোষ্ঠীর আকার বাছাই করে আরও স্মার্ট স্বয়ং-সমান্তরকরণের প্রত্যাশা করুন।

বাস্তব-বিশ্ব বাস্তবায়ন

Megatron-LM ব্যবহার করে একটি NVLink-সংযুক্ত নোডে 8টি GPU জুড়ে প্রতিটি স্তরের ওজন ম্যাট্রিক্স শার্ড করে একটি 175B-প্যারামিটার মডেলের প্রশিক্ষণ।

tensor_parallel_size=4 সহ vLLM-এ একটি 70B-প্যারামিটার চ্যাট মডেল পরিবেশন করা হচ্ছে যাতে ওজনগুলি চারটি GPU জুড়ে ফিট হয় এবং রিয়েল টাইমে সাড়া দেয়।

বিভক্ত ট্রান্সফরমার মনোযোগ জিপিইউ জুড়ে থাকে তাই প্রতিটি ডিভাইস একটি উপসেট গণনা করে, তারপর পরবর্তী স্তরের জন্য আউটপুটগুলিকে একত্রিত করে।

বড় GPU ক্লাস্টারগুলিতে ট্রিলিয়ন-প্যারামিটার মডেলগুলিকে প্রশিক্ষণের জন্য নোডের মধ্যে টেনসর সমান্তরালতা এবং নোড জুড়ে পাইপলাইন সমান্তরালতার সমন্বয়।

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

মডেল এবং পাইপলাইন সমান্তরালতা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

বড় মডেলের জন্য টেনসর সমান্তরালতা কি?

একাধিক GPU জুড়ে একটি একক নিউরাল-নেটওয়ার্ক স্তরের মধ্যে গণিতকে বিভক্ত করার একটি উপায় যাতে একটি ডিভাইসের জন্য খুব বড় একটি মডেল এখনও চলতে পারে। এটা গুরুত্বপূর্ণ কারণ ফ্রন্টিয়ার মডেলের শত শত বিলিয়ন প্যারামিটার রয়েছে যা কোনো একক GPU একাই যথেষ্ট দ্রুত ধরে রাখতে বা গণনা করতে পারে না।

জিপিইউ জুড়ে টেনসর সমান্তরালতা কী বিভক্ত?

টেনসর (ইন্ট্রা-লেয়ার) সমান্তরালতা একটি স্তরের অভ্যন্তরে ওজন ম্যাট্রিক্সগুলিকে ছোট করে, তাই প্রতিটি GPU একই স্তরের অংশ গণনা করে - পাইপলাইন সমান্তরালতা থেকে আলাদা, যা সম্পূর্ণ স্তরগুলিকে বিভিন্ন GPU-তে রাখে।

মেগাট্রন-স্টাইলের এমএলপি বিভাজনে, যোগাযোগ কমানোর জন্য দুটি ওজন ম্যাট্রিক্স কীভাবে বিভাজিত হয়?

প্রথম ম্যাট্রিক্সকে কলাম দ্বারা বিভক্ত করা প্রতিটি GPU-কে স্থানীয়ভাবে অরৈখিকতা প্রয়োগ করতে দেয়; দ্বিতীয়টিকে সারি দ্বারা বিভক্ত করার অর্থ হল একটি একক সমস্ত-কমানোর যোগফল আংশিক আউটপুট—সমন্বয়কে কম করা।

কেন টেনসর সমান্তরালতা সাধারণত একটি একক নোডের মধ্যে রাখা হয়?

প্রতিটি স্তর যৌথ যোগাযোগকে ট্রিগার করে (সমস্ত-কমায়), তাই ভারী, লেটেন্সি-সংবেদনশীল ট্র্যাফিক ধীর আন্তঃ-নোড নেটওয়ার্কের পরিবর্তে এনভিলিঙ্কের মতো দ্রুত ইন্ট্রা-নোড লিঙ্কের দাবি করে।

কিভাবে মনোযোগ প্রক্রিয়া সাধারণত টেনসর সমান্তরাল অধীনে সমান্তরাল হয়?

অ্যাটেনশন হেডগুলি স্বাধীন, তাই সেগুলি GPU গুলিতে বিতরণ করা হয়—প্রতিটি ডিভাইস কিছু হেড গণনা করে এবং আউটপুটগুলি একত্রিত হয়।

কোন সমষ্টিগত অপারেশন সাধারণত টেনসর সমান্তরালে আংশিক ফলাফলকে একত্রিত করে?

প্রতিটি জিপিইউতে গণনা করা আংশিক আউটপুটগুলির সমস্ত-কমানোর যোগফল যাতে তারা স্তরের ফলাফলে একমত হয়; এটি ফরওয়ার্ড এবং ব্যাকওয়ার্ড পাসে প্রতি স্তরে একাধিকবার ঘটে।