প্রযুক্তিগত গাইড

স্মুথকোয়ান্ট এবং অ্যাক্টিভেশন কোয়ান্টাইজেশন

SmoothQuant হল এমন একটি কৌশল যা পুনরায় প্রশিক্ষণ ছাড়াই ওজন এবং সক্রিয়করণ উভয়ের জন্য বৃহৎ ভাষার মডেলকে 8-বিট পূর্ণসংখ্যা পর্যন্ত সংকুচিত করা সম্ভব করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

গভীর ডুব

আপনি যখন একটি মডেলকে 16-বিট ফ্লোট থেকে 8-বিট পূর্ণসংখ্যাতে সঙ্কুচিত করেন, তখন ওজনগুলি সহজেই সংকুচিত হয় কিন্তু সক্রিয়করণ সমস্যা হয়: নির্দিষ্ট চ্যানেলগুলি বাকিগুলির চেয়ে 10 থেকে 100 গুণ বড় মান বহন করে এবং তাদের একটি মোটা পূর্ণসংখ্যা গ্রিডে জোর করে নির্ভুলতা নষ্ট করে৷ SmoothQuant, Xiao et al দ্বারা প্রবর্তিত। 2022 সালে, পর্যবেক্ষণ করে যে ওজনগুলি মসৃণ এবং পরিমাপ করা সহজ যখন সক্রিয়করণগুলি স্পাইকি। সুতরাং এটি গাণিতিকভাবে অসুবিধা স্থানান্তরিত করে: এটি প্রতি-চ্যানেল স্কেল দ্বারা সক্রিয়করণ চ্যানেলগুলিকে ভাগ করে এবং একই স্কেল দ্বারা সংশ্লিষ্ট ওজনকে গুণ করে। দুটি অপারেশন বাতিল করে, মডেল আউটপুট অপরিবর্তিত রেখে, কিন্তু এখন উভয় টেনসর বন্ধুত্বপূর্ণ পরিসরে বসে। ফলাফল হল W8A8 (8-বিট ওজন এবং অ্যাক্টিভেশন) অনুমান-এর কাছাকাছি-শূন্য নির্ভুলতা হ্রাস এবং মোটামুটি 2x গতি এবং মেমরি সঞ্চয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল কৌশল হল একটি প্রতি-চ্যানেল স্মুথিং ফ্যাক্টর s হিসাবে গণনা করা হয় s = max(|X|)^alpha/max(|W|)^(1-alpha)। অ্যাক্টিভেশন 1/s দ্বারা স্কেল করা হয় এবং s দ্বারা ওজন করা হয়, তাই ম্যাট্রিক্স পণ্য XW সংরক্ষিত হয়। যেহেতু স্কেলিং পূর্ববর্তী স্তরের ওজন বা একটি ফিউজড অপারেশনে অফলাইনে শোষিত হয়, এটি শূন্য রানটাইম খরচ যোগ করে। আলফা হাইপারপ্যারামিটার (প্রায়শই 0.5) নিয়ন্ত্রণ করে কতটা বাইরের বোঝা সক্রিয়করণ থেকে ওজনে স্থানান্তরিত হয়।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

স্মুথকোয়ান্ট এবং অ্যাক্টিভেশন কোয়ান্টাইজেশনের ভবিষ্যত

SmoothQuant প্রতিষ্ঠিত করেছে যে অ্যাক্টিভেশন আউটলায়ারগুলি অনিবার্য নয় বরং স্থানান্তরযোগ্য, এবং সেই ধারণাটি এখন INT8 এবং FP8 পরিবেশনকে আন্ডারপিন করে। প্রতি-গ্রুপ কোয়ান্টাইজেশন, শেখা স্কেলিং, এবং 4-বিট অ্যাক্টিভেশন গবেষণা (যেমন আউটলিয়ার-সচেতন পদ্ধতি) এর মতো সূক্ষ্ম-দানাযুক্ত স্কিমগুলির সাথে মসৃণ করার আশা করুন। FP8 হার্ডওয়্যার (হপার, ব্ল্যাকওয়েল) পরিপক্ক হওয়ার সাথে সাথে মসৃণ-শৈলীর ভারসাম্য কম্পাইলার এবং ইনফারেন্স-ইঞ্জিন পাইপলাইনে বেক হতে থাকবে তাই কোয়ান্টাইজেশন প্রায় বিনামূল্যে থাকবে।

বাস্তব-বিশ্ব বাস্তবায়ন

মেমরি এবং ম্যাট্রিক্স-গুণক খরচ উভয় অর্ধেক করে কম GPU-তে W8A8-এ একটি 70B-প্যারামিটার LLM পরিবেশন করা

NVIDIA হপার/ব্ল্যাকওয়েল টেনসর কোরে INT8 অনুমান সক্ষম করা যা স্থানীয়ভাবে 8-বিট পূর্ণসংখ্যা গণিতকে ত্বরান্বিত করে

খরচ-সীমাবদ্ধ ক্লাউড এন্ডপয়েন্টে চ্যাট মডেল স্থাপন করা যেখানে থ্রুপুট দ্বিগুণ করা সরাসরি প্রতি-টোকেন বিল কেটে দেয়

অন-ডিভাইস স্পিচ বা অনুবাদের জন্য ট্রান্সফরমার এনকোডার কম্প্রেস করা যেখানে 8-বিট কার্নেল দ্রুত এবং শীতল চলে

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অ্যাক্টিভেশন স্টিয়ারিং এবং রিপ্রেজেন্টেশন ইঞ্জিনিয়ারিং

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is SmoothQuant and Activation Quantization?

SmoothQuant হল এমন একটি কৌশল যা পুনরায় প্রশিক্ষণ ছাড়াই ওজন এবং সক্রিয়করণ উভয়ের জন্য বৃহৎ ভাষার মডেলকে 8-বিট পূর্ণসংখ্যা পর্যন্ত সংকুচিত করা সম্ভব করে। এটি গুরুত্বপূর্ণ কারণ বড় মডেলগুলিতে সক্রিয়করণে চরম আউটলিয়ার থাকে যা সাধারণত কম-নির্ভুলতার গণিতকে নষ্ট করে দেয় এবং স্মুথকোয়ান্ট তাদের নিয়ন্ত্রণ করে।

কম-নির্ভুলতা অনুমানে স্মুথকোয়ান্ট বিশেষভাবে কোন সমস্যাটির সমাধান করে?

SmoothQuant নির্দিষ্ট অ্যাক্টিভেশন চ্যানেলে প্রদর্শিত বৃহৎ আউটলিয়ার মানগুলিকে লক্ষ্য করে, যা অন্যথায় যখন অ্যাক্টিভেশনগুলি 8 বিটে পরিমাপ করা হয় তখন সঠিকতা নষ্ট করে।

কিভাবে SmoothQuant অ্যাক্টিভেশনকে কোয়ান্টাইজ করা সহজ করে তোলে?

এটি প্রতি-চ্যানেল স্কেল দ্বারা অ্যাক্টিভেশন চ্যানেলগুলিকে বিভক্ত করে এবং সেই স্কেল দ্বারা মিলিত ওজনকে গুণ করে, তাই পণ্যটি অপরিবর্তিত থাকে তবে উভয় টেনসরই পরিমাপ করা সহজ হয়।

W8A8 স্বরলিপি মানে কি?

W8A8 ওজন (W) এবং অ্যাক্টিভেশন (A) উভয়ের জন্য 8-বিট কোয়ান্টাইজেশনকে বোঝায়, স্মুথকোয়্যান্ট ন্যূনতম নির্ভুলতা হ্রাসের সাথে সক্ষম করে।

কেন SmoothQuant এর স্কেলিং মূলত কোন রানটাইম ওভারহেড যোগ করে না?

মসৃণ স্কেলগুলি পূর্ববর্তী স্তরের ওজন বা সময়ের আগে একটি ফিউজড অপে ভাঁজ করা হয়, তাই অনুমানে কোনও অতিরিক্ত গণনা ঘটে না।

SmoothQuant এ আলফা হাইপারপ্যারামিটার কি ভূমিকা পালন করে?

আলফা (সাধারণত 0.5) স্মুথিং ফ্যাক্টরকে ভারসাম্য বজায় রাখে, স্থির করে যে পরিমাণ নির্ধারণের অসুবিধা কতটা সক্রিয়করণ থেকে সরানো হবে এবং ওজনের উপরে।