ভাষা এআই গাইড

কোয়ান্টাইজেশন

কোয়ান্টাইজেশন একটি AI মডেলকে সংকুচিত করে তার সংখ্যাগুলিকে কম নির্ভুলতায় সংরক্ষণ করে, তাই একটি মডেল যার জন্য একটি ডেটা-সেন্টার GPU প্রয়োজন তা কখনও কখনও ল্যাপটপ বা ফোনে চলতে পারে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It is the main trick that makes large language models cheap and fast enough to deploy widely.

গভীর ডুব

একটি নিউরাল নেটওয়ার্ক হল বেশিরভাগ সংখ্যার বিশাল স্তূপ যাকে ওজন বলা হয়, সাধারণত 16- বা 32-বিট ফ্লোটিং-পয়েন্ট মান হিসাবে সংরক্ষণ করা হয়। কোয়ান্টাইজেশন কম বিট, সাধারণত 8-বিট (INT8) বা এমনকি 4-বিট পূর্ণসংখ্যা ব্যবহার করে সেই ওজনগুলিকে পুনরায় সংরক্ষণ করে। 16-বিট থেকে 4-বিট-এ যাওয়া মেমরিকে মোটামুটি চারগুণ কমিয়ে দেয়, তাই একটি 70-বিলিয়ন-প্যারামিটার মডেল যার 16-বিটে প্রায় 140GB প্রয়োজন তা 4-বিটে মোটামুটি 35GB ফিট হতে পারে। ছোট সংখ্যাগুলিও মেমরির মাধ্যমে দ্রুত চলে যা সাধারণত প্রজন্মের গতি বাড়ায়। ক্যাচ হল নির্ভুলতা: মানগুলির একটি বিস্তৃত পরিসরকে কয়েকটি স্তরে চেপে ধরলে রাউন্ডিং ত্রুটি দেখা দেয়। ভাল পদ্ধতিগুলি সাবধানতার সাথে স্কেলিং ফ্যাক্টরগুলি বেছে নিয়ে এবং সবচেয়ে সংবেদনশীল ওজনগুলিকে রক্ষা করে সেই ক্ষতি কমিয়ে দেয়, তাই সম্পদের একটি ভগ্নাংশ ব্যবহার করার সময় মডেলটি প্রায় অভিন্ন আচরণ করে৷

প্রযুক্তিগত অন্তর্দৃষ্টি

ওজনের প্রতিটি গ্রুপ একটি স্কেল ফ্যাক্টর পায় যা একটি ছোট পূর্ণসংখ্যার উপর বাস্তব মান ম্যাপ করে; স্কেল দ্বারা ফিরে গুন করা প্রায় মূল সংখ্যা পুনর্গঠন. জিপিটিকিউ এবং এডব্লিউকিউ-এর মতো প্রশিক্ষণ-পরবর্তী কোয়ান্টাইজেশন পদ্ধতিগুলি একটি ছোট ক্রমাঙ্কন ডেটাসেট বিশ্লেষণ করে সিদ্ধান্ত নেয় কোন ওজন সবচেয়ে গুরুত্বপূর্ণ এবং আউটপুট ত্রুটি কমানোর জন্য স্কেল সেট করে, সবকিছু অন্ধভাবে গোল করার পরিবর্তে। অ্যাক্টিভেশনগুলি প্রায়শই উচ্চ নির্ভুলতায় রাখা হয় কারণ সেগুলি রানটাইমে বেশি পরিবর্তিত হয়। ফলাফলটি এমন একটি মডেল যা 4-বিট পূর্ণসংখ্যা সঞ্চয় করে কিন্তু ফলাফলগুলি সম্পূর্ণ-নির্ভুল সংস্করণের খুব কাছাকাছি গণনা করে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

কোয়ান্টাইজেশনের ভবিষ্যত

অপ্টিমাইজেশনের পরিবর্তে কোয়ান্টাইজেশন ডিফল্ট হওয়ার প্রত্যাশা করুন। হার্ডওয়্যার বিক্রেতারা নেটিভ 4-বিট এবং এমনকি নিম্ন-বিট সমর্থন যোগ করছে, এবং কৌশলগুলি যেমন কোয়ান্টাইজেশন-সচেতন প্রশিক্ষণ বেক সহনশীলতা শুরু থেকেই মডেলটিতে কম নির্ভুলতার জন্য, সঠিকতা হ্রাস আরও কমিয়েছে। 2-বিট এবং 1-বিট (বাইনারী) উপস্থাপনাগুলিতে গবেষণা সক্রিয়, ফোন এবং এমবেডেড চিপগুলিতে সক্ষম মডেলগুলি চালানোর লক্ষ্যে। অন-ডিভাইস এবং প্রাইভেট এআই বাড়ার সাথে সাথে ক্লাউডে ডেটা না পাঠিয়ে স্থানীয়ভাবে সহকারী চালানোর ক্ষেত্রে দক্ষ কোয়ান্টাইজড মডেলগুলি কেন্দ্রীয় হবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একাধিক ডেটা-সেন্টার কার্ডের প্রয়োজনের পরিবর্তে 4-বিট GGUF বা GPTQ ফাইলগুলি ব্যবহার করে ভোক্তা GPU-তে স্থানীয়ভাবে লামার মতো একটি চ্যাট মডেল চালানো।

ফোনে অন-ডিভাইস সহকারী, যেখানে 8-বিট বা 4-বিট মডেলগুলি বক্তৃতা এবং পাঠ্য বৈশিষ্ট্যগুলিকে নেটওয়ার্ক সংযোগ ছাড়াই চলতে দেয়।

একটি INT8 মডেল পরিবেশন করে, প্রতিটি GPU-তে আরও অনুরোধ ফিট করে গ্রাহক-সমর্থন বটের জন্য ক্লাউড ইনফারেন্স খরচ কমানো।

এজ ডিভাইস যেমন স্মার্ট ক্যামেরা বা আইওটি সেন্সরগুলি কমপ্যাক্ট কোয়ান্টাইজড ভিশন-ভাষা মডেলগুলি শক্ত মেমরির সীমার মধ্যে চালায়।

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অবশিষ্ট ভেক্টর কোয়ান্টাইজেশন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Quantization?

কোয়ান্টাইজেশন একটি AI মডেলকে সংকুচিত করে তার সংখ্যাগুলিকে কম নির্ভুলতায় সংরক্ষণ করে, তাই একটি মডেল যার জন্য একটি ডেটা-সেন্টার GPU প্রয়োজন তা কখনও কখনও ল্যাপটপ বা ফোনে চলতে পারে। এটি হল প্রধান কৌশল যা বৃহৎ ভাষার মডেলগুলিকে সস্তা এবং ব্যাপকভাবে মোতায়েন করার জন্য যথেষ্ট দ্রুত করে তোলে।

কোয়ান্টাইজেশন প্রাথমিকভাবে একটি নিউরাল নেটওয়ার্ক সম্পর্কে কি পরিবর্তন করে?

কোয়ান্টাইজেশন মডেলের ওজনগুলিকে কম সংখ্যাসূচক নির্ভুলতায় পুনঃসংরক্ষণ করে, যেমন 16- বা 32-বিট ফ্লোটের পরিবর্তে 8-বিট বা 4-বিট পূর্ণসংখ্যা।

16-বিট থেকে 4-বিটে ওজন সরানোর মাধ্যমে মোটামুটি কত মেমরি সংরক্ষণ করা হয়?

4 বিট হল 16 বিটের এক চতুর্থাংশ, তাই ওজন সঞ্চয়স্থান প্রায় এক চতুর্থাংশে নেমে আসে, প্রায় 4x হ্রাস।

আক্রমনাত্মক পরিমাপকরণের প্রধান ক্ষতি কী?

কম স্তরের সাথে মানগুলি উপস্থাপন করা রাউন্ডিং ত্রুটির পরিচয় দেয়, যা সাবধানে পরিচালিত না হলে আউটপুট গুণমানকে হ্রাস করতে পারে।

GPTQ এবং AWQ এর মত পদ্ধতিগুলি কিসের জন্য একটি ছোট ক্রমাঙ্কন ডেটাসেট ব্যবহার করে?

এই প্রশিক্ষণ-পরবর্তী পদ্ধতিগুলি স্কেলিং ফ্যাক্টর সেট করতে এবং সংবেদনশীল ওজন রক্ষা করতে কয়েকটি নমুনা ইনপুট বিশ্লেষণ করে, আউটপুটগুলিকে আসলটির কাছাকাছি রেখে।

কেন কোয়ান্টাইজেশন প্রায়শই একটি মডেলকে দ্রুত করে তোলে, শুধু ছোট নয়?

নিম্ন-নির্ভুলতা মানগুলি লোড এবং সরাতে কম মেমরি ব্যান্ডউইথ নেয়, যা প্রায়শই প্রজন্মের সময় বাধা হয়ে দাঁড়ায়, তাই অনুমানের গতি বাড়ে।