প্রযুক্তিগত গাইড

টেনসরআরটি এবং ইনফারেন্স ইঞ্জিন

TensorRT হল NVIDIA-এর লাইব্রেরি যা প্রশিক্ষিত নিউরাল নেটওয়ার্কগুলিকে অত্যন্ত অপ্টিমাইজ করা ইঞ্জিনে কম্পাইল করে যা NVIDIA GPU-তে অনেক দ্রুত চলে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It matters because the same model can run 2-6x quicker and cheaper at inference time without changing what it predicts.

গভীর ডুব

একটি অনুমান ইঞ্জিন একটি প্রশিক্ষিত মডেল নেয় এবং টার্গেট হার্ডওয়্যারে দ্রুততম কার্যকর করার জন্য এটি পুনর্লিখন করে। TensorRT বিভিন্ন ধাপের মাধ্যমে NVIDIA GPU-এর জন্য এটি করে। এটি লেয়ার ফিউশন সঞ্চালন করে, মেমরি ট্র্যাফিক কাটাতে কনভোলিউশন, বায়াস-অ্যাড এবং ReLU-কে একক GPU কার্নেলে একত্রিত করে। এটি নির্ভুলতা সংরক্ষণের সময় FP32 থেকে FP16 বা INT8 (এবং হপারে FP8) তে নেমে যথার্থ ক্রমাঙ্কন প্রয়োগ করে। এটি কার্নেল অটো-টিউনিং চালায়, আপনার সঠিক জিপিইউতে প্রতিটি স্তরের অনেকগুলি বাস্তবায়নের বেঞ্চমার্ক করে এবং দ্রুততম বাছাই করে। ফলাফল হল একটি সিরিয়ালাইজড 'ইঞ্জিন' ফাইল যা একটি GPU আর্কিটেকচারে সুর করা হয়েছে। টেনসরআরটি-এলএলএম পেজড কেভি-ক্যাশে, ইন-ফ্লাইট ব্যাচিং এবং বড় ভাষার মডেলের জন্য টেনসর সমান্তরালতার সাথে এটিকে প্রসারিত করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

সবচেয়ে বড় স্পিডআপ দুটি কৌশল থেকে আসে। কার্নেল ফিউশন দ্রুত রেজিস্টার এবং শেয়ার্ড মেমরিতে মধ্যবর্তী ফলাফল রেখে GPU গ্লোবাল মেমরি ধীর করার জন্য রাউন্ড-ট্রিপগুলিকে দূর করে। INT8-এ কোয়ান্টাইজেশন চারটি মান প্যাক করে যেখানে একটি FP32 বসে, টেনসর কোরে পাটিগণিত থ্রুপুট চারগুণ করে, কিন্তু প্রতি-টেনসর স্কেলিং ফ্যাক্টরগুলি গণনা করার জন্য এটির একটি ক্রমাঙ্কন ডেটাসেটের প্রয়োজন যাতে হ্রাস করা সাংখ্যিক পরিসর নির্ভুলতা নষ্ট না করে। ইঞ্জিনটি হার্ডওয়্যার-নির্দিষ্ট কারণ অটো-টিউনিং সেই GPU-এর সঠিক কোর এবং মেমরি লেআউটের জন্য সর্বোত্তম কার্নেলে বেক করে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

টেনসরআরটি এবং ইনফারেন্স ইঞ্জিনের ভবিষ্যত

অনুমান ইঞ্জিনগুলি নিম্ন নির্ভুলতার দিকে অগ্রসর হচ্ছে (FP8, FP4, এবং মিশ্র স্কিম) এবং LLM-নির্দিষ্ট বৈশিষ্ট্য যেমন অনুমানমূলক ডিকোডিং এবং স্মার্ট কেভি-ক্যাশে পেজিং। TensorRT-LLM এবং vLLM-এর মতো প্রতিযোগীরা বিচ্ছিন্ন প্রিফিল/ডিকোড এবং ক্রমাগত ব্যাচিং-এ একত্রিত হচ্ছে। কড়া কম্পাইলার ইন্টিগ্রেশন (টর্চ-টেনসরআরটি, ওএনএনএক্স), কম ম্যানুয়াল ক্যালিব্রেশন সহ স্বয়ংক্রিয় পরিমাপ, এবং দৈত্য মডেলগুলি সস্তায় পরিবেশন করার জন্য বিশেষজ্ঞদের রাউটিং-এর জন্য বিস্তৃত সমর্থন আশা করুন কেন্দ্রীয় খরচ যুদ্ধে পরিণত হবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি YOLO অবজেক্ট-ডিটেকশন মডেলকে একটি TensorRT INT8 ইঞ্জিনে রূপান্তর করা হচ্ছে যাতে এটি একটি রোবট বা স্মার্ট ক্যামেরায় একটি NVIDIA জেটসনে রিয়েল টাইমে চলে

একটি চ্যাটবট ব্যাকএন্ডে H100 GPU-তে টোকেন-প্রতি-সেকেন্ডে সর্বাধিক করার জন্য ইন-ফ্লাইট ব্যাচিং ব্যবহার করে TensorRT-LLM-এর সাথে একটি লামা বা মিস্ট্রাল মডেল পরিবেশন করা

একটি লাইভ-ক্যাপশনিং পরিষেবাতে ট্রান্সক্রিপশন লেটেন্সি কমাতে FP16 নির্ভুলতার সাথে একটি স্পিচ-রিকগনিশন মডেল অপ্টিমাইজ করা

কম GPU খরচে প্রতি সেকেন্ডে লক্ষাধিক অনুরোধগুলি পরিচালনা করতে একটি মিশ্রিত TensorRT ইঞ্জিনে একটি সুপারিশ-র্যাঙ্কিং নেটওয়ার্ক কম্পাইল করা হচ্ছে

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TensorRT and Inference Engines quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

এআই ইনফারেন্স অপ্টিমাইজেশান

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is TensorRT and Inference Engines?

TensorRT হল NVIDIA-এর লাইব্রেরি যা প্রশিক্ষিত নিউরাল নেটওয়ার্কগুলিকে অত্যন্ত অপ্টিমাইজ করা ইঞ্জিনে কম্পাইল করে যা NVIDIA GPU-তে অনেক দ্রুত চলে। এটি গুরুত্বপূর্ণ কারণ একই মডেল অনুমান সময়ে 2-6x দ্রুত এবং সস্তা চালাতে পারে যা এটি ভবিষ্যদ্বাণী করে তা পরিবর্তন না করে।

TensorRT এর মত একটি অনুমান ইঞ্জিনের প্রাথমিক উদ্দেশ্য কি?

ইনফারেন্স ইঞ্জিনগুলি একটি ইতিমধ্যে-প্রশিক্ষিত মডেল নেয় এবং নির্দিষ্ট হার্ডওয়্যারে সর্বাধিক গতির জন্য এটি পুনরায় লিখতে পারে; তারা মডেল প্রশিক্ষণ না.

কিভাবে স্তর ফিউশন অনুমান গতি বাড়ায়?

ফিউশন কনভ, বায়াস এবং অ্যাক্টিভেশনের মতো ক্রিয়াকলাপগুলিকে একক কার্নেলে একত্রিত করে যাতে মধ্যবর্তী ফলাফলগুলি ধীর গ্লোবাল মেমরিতে ফিরে লেখার পরিবর্তে দ্রুত মেমরিতে থাকে।

কেন INT8 কোয়ান্টাইজেশনের জন্য সাধারণত একটি ক্রমাঙ্কন ডেটাসেটের প্রয়োজন হয়?

ক্রমাঙ্কন প্রতি-টেনসর স্কেল ফ্যাক্টর নির্ধারণ করতে মডেলের মাধ্যমে প্রতিনিধি ডেটা চালায়, তাই সীমিত INT8 পরিসর গুরুত্বপূর্ণ মান বিতরণ সংরক্ষণ করে।

কেন একটি সংকলিত TensorRT ইঞ্জিন সাধারণত একটি GPU আর্কিটেকচারের জন্য নির্দিষ্ট?

অটো-টিউনিং বেঞ্চমার্ক টার্গেট GPU-তে কার্নেল তৈরি করে এবং সর্বোত্তমগুলি নির্বাচন করে, ইঞ্জিনটিকে সেই আর্কিটেকচারের বৈশিষ্ট্যের সাথে আবদ্ধ করে।

TensorRT-LLM-এর কোন বৈশিষ্ট্যটি বিশেষভাবে বড় ভাষার মডেলগুলিকে দক্ষতার সাথে পরিবেশন করতে সাহায্য করে?

টেন্সরআরটি-এলএলএম টেক্সট-জেনারেশন ওয়ার্কলোডগুলিতে থ্রুপুট সর্বাধিক করতে ইন-ফ্লাইট ব্যাচিং এবং পেজড কেভি-ক্যাশের মতো এলএলএম-নির্দিষ্ট অপ্টিমাইজেশান যোগ করে।