টেনসর কোর
টেনসর কোর হল আধুনিক এনভিআইডিএ জিপিইউ-এর মধ্যে বিশেষায়িত হার্ডওয়্যার ইউনিট যা ম্যাট্রিক্স গুন-এন্ড-সঞ্চয়কারী ক্রিয়াকলাপগুলি অত্যন্ত দ্রুত করে।
ওভারভিউ
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
গভীর ডুব
2017 সালে ভোল্টা আর্কিটেকচারের সাথে প্রবর্তিত, টেনসর কোর হল ডেডিকেটেড সার্কিট যেগুলি স্ট্যান্ডার্ড CUDA কোরে প্রতিটি গুন করার পরিবর্তে একটি একক অপারেশনে একটি ছোট ম্যাট্রিক্স গুন এবং একটি যোগ (D = A x B + C) গণনা করে। যেহেতু একটি নিউরাল নেটওয়ার্কের কার্যত প্রতিটি স্তর ম্যাট্রিক্স গুণে হ্রাস করে, এটি প্রকৃতপক্ষে গণিত AI এর প্রয়োজনের সাথে মেলে। প্রতিটি GPU প্রজন্ম তারা যা পরিচালনা করে তা প্রসারিত করেছে: ভোল্টা 4x4 FP16 টাইলস করেছে, যখন পরে অ্যাম্পিয়ার, হপার এবং ব্ল্যাকওয়েল আর্কিটেকচারগুলি TF32, BF16, INT8, FP8 এবং FP4 এর মতো নিম্ন-নির্ভুলতা বিন্যাস যুক্ত করেছে। নিম্ন নির্ভুলতা মানে প্রতি ঘড়িতে আরও বেশি সংখ্যা প্রক্রিয়া করা হয়, সঠিকতা গ্রহণযোগ্য রেখে প্রশিক্ষণ এবং অনুমানের জন্য নাটকীয়ভাবে থ্রুপুট বৃদ্ধি করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
একটি টেনসর কোর দুটি ছোট ম্যাট্রিক্সকে গুণ করে এবং একটি মিশ্রিত ধাপে ফলাফল সংগ্রহ করে, এই সত্যটি কাজে লাগিয়ে যে একই ইনপুট মানগুলি অনেকগুলি আউটপুট উপাদান জুড়ে পুনরায় ব্যবহার করা হয়। এটি সাধারণত কম নির্ভুলতায় ইনপুট পড়ে (FP16, BF16, বা FP8) কিন্তু রাউন্ডিং ত্রুটি সীমিত করতে উচ্চ নির্ভুলতায় (প্রায়শই FP32) চলমান সমষ্টি জমা করে। cuBLAS এবং cuDNN-এর মতো সফ্টওয়্যার লাইব্রেরি এবং PyTorch-এর মতো ফ্রেমওয়ার্কগুলি এই ছোট ব্লকগুলিতে স্বয়ংক্রিয়ভাবে বড় ম্যাট্রিক্স টাইল করে যাতে মডেলগুলি ম্যানুয়াল কোডিং ছাড়াই গতি পায়৷
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
টেনসর কোরের ভবিষ্যত
টেনসর কোরগুলি সর্বদা-নিম্ন নির্ভুলতার দিকে অগ্রসর হতে থাকে: Hopper FP8 যোগ করেছে এবং ব্ল্যাকওয়েল হার্ডওয়্যার-পরিচালিত স্কেলিং সহ 4-বিট FP4 প্রবর্তন করেছে, অনুমান-ভারী কাজের চাপের জন্য প্রতিটি ধাপে থ্রুপুটকে প্রায় দ্বিগুণ করে। স্প্যার্সিটি (শূন্য ওজন এড়িয়ে যাওয়া), মাইক্রোস্কেলিং ফরম্যাট যা সংখ্যার ছোট ব্লকের সাথে স্কেল ফ্যাক্টর সংযুক্ত করে এবং মেমরি সিস্টেমের সাথে গভীর একীকরণের জন্য কঠোর সমর্থন আশা করুন যাতে কোরগুলি খাওয়ানো থাকে। মডেলগুলি বাড়ার সাথে সাথে, ম্যাট্রিক্স ইঞ্জিন, কাঁচা ঘড়ির গতি নয়, AI হার্ডওয়্যার পারফরম্যান্সের জন্য কেন্দ্রীয় যুদ্ধক্ষেত্র হিসাবে রয়ে গেছে।
বাস্তব-বিশ্ব বাস্তবায়ন
GPT-শৈলীর ট্রান্সফরমারের মতো বৃহৎ ভাষার মডেলের প্রশিক্ষণ দেওয়া, যেখানে BF16 বা FP8-এ টেনসর কোরে প্রতি ধাপে কোটি কোটি ম্যাট্রিক্স গুণন চালানো হয়।
GPU প্রতি আরও ব্যবহারকারীদের পরিবেশন করতে INT8 বা FP8 কোয়ান্টাইজেশন ব্যবহার করে চ্যাটবট এবং ইমেজ জেনারেটরের জন্য রিয়েল-টাইম ইনফারেন্স চালানো।
ভিডিও গেমগুলিতে NVIDIA DLSS ত্বরান্বিত করা, যেখানে একটি নিউরাল নেটওয়ার্ক টেনসর কোর প্রতিটি ফ্রেম ব্যবহার করে নিম্ন-রেজোলিউশনের ফ্রেমগুলিকে উচ্চতর করে।
বৈজ্ঞানিক কম্পিউটিং যেমন প্রোটিন-ফোল্ডিং (আলফাফোল্ড) এবং আবহাওয়ার মডেলগুলিকে দ্রুত করা যা ম্যাট্রিক্স-ভারী নিউরাল ওয়ার্কলোড হিসাবে পুনর্নির্মাণ করা হয়েছে।
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
বড় মডেলের জন্য টেনসর সমান্তরালতা
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Tensor Cores?
টেনসর কোর হল আধুনিক এনভিআইডিএ জিপিইউ-এর মধ্যে বিশেষায়িত হার্ডওয়্যার ইউনিট যা ম্যাট্রিক্স গুন-এন্ড-সঞ্চয়কারী ক্রিয়াকলাপগুলি অত্যন্ত দ্রুত করে। এগুলি প্রধান কারণ একটি একক GPU সাধারণ-উদ্দেশ্য কম্পিউটের অনুমতির চেয়ে দ্রুত বড় নিউরাল নেটওয়ার্ক অর্ডারগুলিকে প্রশিক্ষণ এবং চালাতে পারে।
কোন মূল গাণিতিক ক্রিয়াকলাপ টেনসর কোরগুলিকে ত্বরান্বিত করার জন্য বিশেষভাবে ডিজাইন করা হয়েছে?
টেনসর কোরগুলি এক ধাপে একটি ফিউজড ম্যাট্রিক্স গুণন প্লাস সঞ্চয় করে, যা ঠিক সেই অপারেশন যা নিউরাল নেটওয়ার্ক স্তরগুলিকে প্রাধান্য দেয়।
কোন NVIDIA GPU আর্কিটেকচার প্রথম টেনসর কোর চালু করেছিল?
FP16 4x4 ম্যাট্রিক্স অপারেশনের মাধ্যমে 2017 সালে টেনসর কোর ভল্টা আর্কিটেকচারের সাথে আত্মপ্রকাশ করে।
কেন টেনসর কোরগুলি প্রায়শই FP16 বা FP8 এর মতো কম নির্ভুলতা ব্যবহার করে?
সংখ্যা প্রতি কম বিট ব্যবহার করার অর্থ হল প্রতিটি চক্রের হার্ডওয়্যারের মাধ্যমে আরও মান প্রবাহিত হয়, শুধুমাত্র একটি ছোট, সাধারণত সহনীয়, নির্ভুলতা হারানোর সাথে গতি বৃদ্ধি করে।
নির্ভুলতা রক্ষা করার জন্য, টেনসর কোরগুলি সাধারণত চলমান যোগফল (সঞ্চয়) এর জন্য কোন নির্ভুলতা ব্যবহার করে?
ইনপুটগুলি কম নির্ভুলতা হতে পারে, কিন্তু রাউন্ডিং ত্রুটিগুলির বিল্ডআপকে সীমিত করতে সঞ্চয়কারী সাধারণত FP32 এর মতো উচ্চ নির্ভুলতায় চলে।
PyTorch এর মত দৈনন্দিন এআই ফ্রেমওয়ার্ক কিভাবে টেনসর কোর ব্যবহার করে?
অন্তর্নিহিত লাইব্রেরিগুলি স্বয়ংক্রিয়ভাবে টেনসর-কোর-আকারের টাইলগুলিতে বড় ম্যাট্রিক্স অপারেশনগুলিকে ভেঙে দেয়, তাই ফ্রেমওয়ার্কগুলি ম্যানুয়াল কোডিং ছাড়াই গতি পায়।