কোয়ান্টাইজেশন
কোয়ান্টাইজেশন একটি AI মডেলকে সংকুচিত করে তার সংখ্যাগুলিকে কম নির্ভুলতায় সংরক্ষণ করে, তাই একটি মডেল যার জন্য একটি ডেটা-সেন্টার GPU প্রয়োজন তা কখনও কখনও ল্যাপটপ বা ফোনে চলতে পারে।
ওভারভিউ
It is the main trick that makes large language models cheap and fast enough to deploy widely.
গভীর ডুব
একটি নিউরাল নেটওয়ার্ক হল বেশিরভাগ সংখ্যার বিশাল স্তূপ যাকে ওজন বলা হয়, সাধারণত 16- বা 32-বিট ফ্লোটিং-পয়েন্ট মান হিসাবে সংরক্ষণ করা হয়। কোয়ান্টাইজেশন কম বিট, সাধারণত 8-বিট (INT8) বা এমনকি 4-বিট পূর্ণসংখ্যা ব্যবহার করে সেই ওজনগুলিকে পুনরায় সংরক্ষণ করে। 16-বিট থেকে 4-বিট-এ যাওয়া মেমরিকে মোটামুটি চারগুণ কমিয়ে দেয়, তাই একটি 70-বিলিয়ন-প্যারামিটার মডেল যার 16-বিটে প্রায় 140GB প্রয়োজন তা 4-বিটে মোটামুটি 35GB ফিট হতে পারে। ছোট সংখ্যাগুলিও মেমরির মাধ্যমে দ্রুত চলে যা সাধারণত প্রজন্মের গতি বাড়ায়। ক্যাচ হল নির্ভুলতা: মানগুলির একটি বিস্তৃত পরিসরকে কয়েকটি স্তরে চেপে ধরলে রাউন্ডিং ত্রুটি দেখা দেয়। ভাল পদ্ধতিগুলি সাবধানতার সাথে স্কেলিং ফ্যাক্টরগুলি বেছে নিয়ে এবং সবচেয়ে সংবেদনশীল ওজনগুলিকে রক্ষা করে সেই ক্ষতি কমিয়ে দেয়, তাই সম্পদের একটি ভগ্নাংশ ব্যবহার করার সময় মডেলটি প্রায় অভিন্ন আচরণ করে৷
প্রযুক্তিগত অন্তর্দৃষ্টি
ওজনের প্রতিটি গ্রুপ একটি স্কেল ফ্যাক্টর পায় যা একটি ছোট পূর্ণসংখ্যার উপর বাস্তব মান ম্যাপ করে; স্কেল দ্বারা ফিরে গুন করা প্রায় মূল সংখ্যা পুনর্গঠন. জিপিটিকিউ এবং এডব্লিউকিউ-এর মতো প্রশিক্ষণ-পরবর্তী কোয়ান্টাইজেশন পদ্ধতিগুলি একটি ছোট ক্রমাঙ্কন ডেটাসেট বিশ্লেষণ করে সিদ্ধান্ত নেয় কোন ওজন সবচেয়ে গুরুত্বপূর্ণ এবং আউটপুট ত্রুটি কমানোর জন্য স্কেল সেট করে, সবকিছু অন্ধভাবে গোল করার পরিবর্তে। অ্যাক্টিভেশনগুলি প্রায়শই উচ্চ নির্ভুলতায় রাখা হয় কারণ সেগুলি রানটাইমে বেশি পরিবর্তিত হয়। ফলাফলটি এমন একটি মডেল যা 4-বিট পূর্ণসংখ্যা সঞ্চয় করে কিন্তু ফলাফলগুলি সম্পূর্ণ-নির্ভুল সংস্করণের খুব কাছাকাছি গণনা করে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
কোয়ান্টাইজেশনের ভবিষ্যত
অপ্টিমাইজেশনের পরিবর্তে কোয়ান্টাইজেশন ডিফল্ট হওয়ার প্রত্যাশা করুন। হার্ডওয়্যার বিক্রেতারা নেটিভ 4-বিট এবং এমনকি নিম্ন-বিট সমর্থন যোগ করছে, এবং কৌশলগুলি যেমন কোয়ান্টাইজেশন-সচেতন প্রশিক্ষণ বেক সহনশীলতা শুরু থেকেই মডেলটিতে কম নির্ভুলতার জন্য, সঠিকতা হ্রাস আরও কমিয়েছে। 2-বিট এবং 1-বিট (বাইনারী) উপস্থাপনাগুলিতে গবেষণা সক্রিয়, ফোন এবং এমবেডেড চিপগুলিতে সক্ষম মডেলগুলি চালানোর লক্ষ্যে। অন-ডিভাইস এবং প্রাইভেট এআই বাড়ার সাথে সাথে ক্লাউডে ডেটা না পাঠিয়ে স্থানীয়ভাবে সহকারী চালানোর ক্ষেত্রে দক্ষ কোয়ান্টাইজড মডেলগুলি কেন্দ্রীয় হবে।
বাস্তব-বিশ্ব বাস্তবায়ন
একাধিক ডেটা-সেন্টার কার্ডের প্রয়োজনের পরিবর্তে 4-বিট GGUF বা GPTQ ফাইলগুলি ব্যবহার করে ভোক্তা GPU-তে স্থানীয়ভাবে লামার মতো একটি চ্যাট মডেল চালানো।
ফোনে অন-ডিভাইস সহকারী, যেখানে 8-বিট বা 4-বিট মডেলগুলি বক্তৃতা এবং পাঠ্য বৈশিষ্ট্যগুলিকে নেটওয়ার্ক সংযোগ ছাড়াই চলতে দেয়।
একটি INT8 মডেল পরিবেশন করে, প্রতিটি GPU-তে আরও অনুরোধ ফিট করে গ্রাহক-সমর্থন বটের জন্য ক্লাউড ইনফারেন্স খরচ কমানো।
এজ ডিভাইস যেমন স্মার্ট ক্যামেরা বা আইওটি সেন্সরগুলি কমপ্যাক্ট কোয়ান্টাইজড ভিশন-ভাষা মডেলগুলি শক্ত মেমরির সীমার মধ্যে চালায়।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
অবশিষ্ট ভেক্টর কোয়ান্টাইজেশন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Quantization?
কোয়ান্টাইজেশন একটি AI মডেলকে সংকুচিত করে তার সংখ্যাগুলিকে কম নির্ভুলতায় সংরক্ষণ করে, তাই একটি মডেল যার জন্য একটি ডেটা-সেন্টার GPU প্রয়োজন তা কখনও কখনও ল্যাপটপ বা ফোনে চলতে পারে। এটি হল প্রধান কৌশল যা বৃহৎ ভাষার মডেলগুলিকে সস্তা এবং ব্যাপকভাবে মোতায়েন করার জন্য যথেষ্ট দ্রুত করে তোলে।
কোয়ান্টাইজেশন প্রাথমিকভাবে একটি নিউরাল নেটওয়ার্ক সম্পর্কে কি পরিবর্তন করে?
কোয়ান্টাইজেশন মডেলের ওজনগুলিকে কম সংখ্যাসূচক নির্ভুলতায় পুনঃসংরক্ষণ করে, যেমন 16- বা 32-বিট ফ্লোটের পরিবর্তে 8-বিট বা 4-বিট পূর্ণসংখ্যা।
16-বিট থেকে 4-বিটে ওজন সরানোর মাধ্যমে মোটামুটি কত মেমরি সংরক্ষণ করা হয়?
4 বিট হল 16 বিটের এক চতুর্থাংশ, তাই ওজন সঞ্চয়স্থান প্রায় এক চতুর্থাংশে নেমে আসে, প্রায় 4x হ্রাস।
আক্রমনাত্মক পরিমাপকরণের প্রধান ক্ষতি কী?
কম স্তরের সাথে মানগুলি উপস্থাপন করা রাউন্ডিং ত্রুটির পরিচয় দেয়, যা সাবধানে পরিচালিত না হলে আউটপুট গুণমানকে হ্রাস করতে পারে।
GPTQ এবং AWQ এর মত পদ্ধতিগুলি কিসের জন্য একটি ছোট ক্রমাঙ্কন ডেটাসেট ব্যবহার করে?
এই প্রশিক্ষণ-পরবর্তী পদ্ধতিগুলি স্কেলিং ফ্যাক্টর সেট করতে এবং সংবেদনশীল ওজন রক্ষা করতে কয়েকটি নমুনা ইনপুট বিশ্লেষণ করে, আউটপুটগুলিকে আসলটির কাছাকাছি রেখে।
কেন কোয়ান্টাইজেশন প্রায়শই একটি মডেলকে দ্রুত করে তোলে, শুধু ছোট নয়?
নিম্ন-নির্ভুলতা মানগুলি লোড এবং সরাতে কম মেমরি ব্যান্ডউইথ নেয়, যা প্রায়শই প্রজন্মের সময় বাধা হয়ে দাঁড়ায়, তাই অনুমানের গতি বাড়ে।