QLoRA এবং 4-বিট ফাইন-টিউনিং
QLoRA হল একটি কৌশল যা আপনাকে একক ভোক্তা GPU-তে হিমায়িত মডেলটিকে প্রতি ওজনে মাত্র 4 বিটে সংরক্ষণ করে একটি বিশাল ভাষার মডেলকে সূক্ষ্ম-টিউন করতে দেয়।
ওভারভিউ
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
গভীর ডুব
সাধারণত, একটি বড় মডেলকে ফাইন-টিউন করার অর্থ হল প্রতিটি ওজন 16-বিট নির্ভুলতায় লোড করা এবং সেগুলিকে আপডেট করা, যা প্রচুর মেমরির দাবি করে। QLoRA দুটি ধারণাকে একত্রিত করে। প্রথমত, এটি পূর্ব-প্রশিক্ষিত মডেলটিকে হিমায়িত করে এবং এটিকে 4 বিটে কমিয়ে দেয়, মেমরি মোটামুটি চারগুণ কমিয়ে দেয়। দ্বিতীয়ত, এটি LoRA ব্যবহার করে: দৈত্যাকার ওজন ম্যাট্রিক্স আপডেট করার পরিবর্তে, এটি তাদের পাশাপাশি ছোট প্রশিক্ষনযোগ্য নিম্ন-র্যাঙ্ক অ্যাডাপ্টার ম্যাট্রিক্স ইনজেকশন করে, তাই মাত্র কয়েক মিলিয়ন প্যারামিটার আপডেট করা হয়। 4-বিট বেস স্থির থাকে যখন গ্রেডিয়েন্টগুলি শুধুমাত্র ছোট অ্যাডাপ্টারের মাধ্যমে প্রবাহিত হয়। Dettmers এবং সহকর্মীদের দ্বারা 2023 সালে প্রবর্তিত, QLoRA দেখিয়েছে যে একটি 48GB GPU-তে একটি 65B মডেলের ফাইন-টিউনিং সম্পূর্ণ 16-বিট ফাইন-টিউনিংয়ের গুণমানের সাথে মেলে।
প্রযুক্তিগত অন্তর্দৃষ্টি
QLoRA তিনটি কৌশল চালু করেছে। NF4 (4-বিট নরমালফ্লোট) হল একটি ডেটা টাইপ যা স্নায়ু ওজনের বেল-বক্ররেখা বন্টনের জন্য অপ্টিমাইজ করা হয়েছে, যা প্লেইন int4 এর চেয়ে ভাল নির্ভুলতা দেয়। ডাবল কোয়ান্টাইজেশন কোয়ান্টাইজেশন কনস্ট্যান্টকে সংকুচিত করে, অতিরিক্ত মেমরি সংরক্ষণ করে। পেজড অপ্টিমাইজাররা GPU-CPU ইউনিফাইড মেমরি ব্যবহার করে দীর্ঘ সিকোয়েন্সের সময় স্পাইক শোষণ করতে, মেমরির বাইরের ক্র্যাশ রোধ করে। ফরোয়ার্ড এবং ব্যাকওয়ার্ড পাসের সময়, 4-বিট ওজনকে 16-বিট ঠিক সময়ে ম্যাট্রিক্স গুণনের জন্য ডিকোয়ান্টাইজ করা হয়, তারপর বাতিল করা হয়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
QLoRA এবং 4-বিট ফাইন-টিউনিং এর ভবিষ্যত
4-বিট ফাইন-টিউনিং স্ট্যান্ডার্ড অনুশীলনে পরিণত হয়েছে, এবং গবেষণা এখন 2-বিট এবং 1-বিট (ত্রিনারি) উপস্থাপনা সহ আরও কম নির্ভুলতার দিকে ঠেলে দেয়। AWQ, GPTQ, এবং HQQ এর মতো নতুন কোয়ান্টাইজেশন স্কিমগুলি সঠিকতাকে আরও পরিমার্জিত করে, যখন QA-LoRA-এর মতো কৌশলগুলি অ্যাডাপ্টারগুলিকে একত্রিত করার পরেও মডেলটিকে পরিমাপ করে রাখা লক্ষ্য করে। ওপেন-ওয়েট মডেলগুলি বাড়ার সাথে সাথে, টুলিংয়ের আশা করুন যা শৌখিনদের একটি একক গেমিং GPU-তে 70B-প্লাস মডেলগুলিকে রুটিন হয়ে উঠতে দেয়, কাস্টমাইজেশনকে গণতন্ত্রীকরণ করে৷
বাস্তব-বিশ্ব বাস্তবায়ন
একটি স্টার্টআপ একটি 48GB GPU-তে একটি 70B Llama মডেলকে ফাইন-টিউন করে যাতে একটি সার্ভার ক্লাস্টার ভাড়া না নিয়ে নিজস্ব ব্র্যান্ডের ভয়েসে গ্রাহক-সহায়ক সহকারী তৈরি করা যায়।
একজন ভোক্তা RTX 4090 সহ একজন গবেষক রাতারাতি একটি বিশেষ মেডিকেল প্রশ্ন-উত্তর ডেটাসেটের জন্য একটি উন্মুক্ত মডেলকে অভিযোজিত করে।
একজন বিকাশকারী বিভিন্ন কাজের জন্য কয়েক ডজন ছোট, অদলবদলযোগ্য LoRA অ্যাডাপ্টার তৈরি করে, সবগুলি মেমরিতে লোড করা একটি 4-বিট বেস মডেল ভাগ করে।
একজন শৌখিন ব্যক্তি তাদের ব্যক্তিগত চ্যাট লগে একটি মডেলকে ফাইন-টিউন করে যাতে ফ্রি Colab-গ্রেড হার্ডওয়্যার ব্যবহার করে একটি নির্দিষ্ট লেখার শৈলী অনুকরণ করা যায়।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
প্রত্যাখ্যান স্যাম্পলিং ফাইন-টিউনিং
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA হল একটি কৌশল যা আপনাকে একক ভোক্তা GPU-তে হিমায়িত মডেলটিকে প্রতি ওজনে মাত্র 4 বিটে সংরক্ষণ করে একটি বিশাল ভাষার মডেলকে সূক্ষ্ম-টিউন করতে দেয়। এটি হার্ডওয়্যারে 65B-প্যারামিটার মডেলগুলিকে কাস্টমাইজ করা সম্ভব করেছে যা আগে শুধুমাত্র সেই আকারের একটি ভগ্নাংশ মডেলগুলি পরিচালনা করতে পারত।
QLoRA এর '4-বিট' অংশের পিছনে মূল স্মৃতি-সংরক্ষণের ধারণা কী?
QLoRA হিমায়িত পূর্ব-প্রশিক্ষিত ওজনগুলিকে প্রতি মান 4 বিটে সংরক্ষণ করে, 16-বিটের তুলনায় মেমরি মোটামুটি চারগুণ কমিয়ে দেয়।
QLoRA ফাইন-টিউনিংয়ের সময়, কোন প্যারামিটারগুলি আসলে গ্রেডিয়েন্ট ডিসেন্ট দ্বারা আপডেট হয়?
বেস মডেল হিমায়িত হয়; শুধুমাত্র ইনজেকশন করা নিম্ন-র্যাঙ্ক অ্যাডাপ্টার ম্যাট্রিক্স গ্রেডিয়েন্ট আপডেট পায়, যা পরামিতির একটি ক্ষুদ্র ভগ্নাংশ মাত্র।
QLoRA প্রসঙ্গে NF4 কি?
NF4 (NormalFloat 4-bit) হল একটি ডাটা টাইপ যা প্লেইন int4-এর চেয়ে ভাল নির্ভুলতার জন্য নিউরাল নেটওয়ার্ক ওজনের বেল-বক্ররেখা বন্টনের চারপাশে ডিজাইন করা হয়েছে।
QLoRA ঠিকানায় 'পেজড অপ্টিমাইজার' কি সমস্যা করে?
পেজড অপ্টিমাইজাররা GPU-CPU ইউনিফাইড মেমরি ব্যবহার করে মেমরির স্পাইক শোষণ করতে, দীর্ঘ ইনপুটগুলিতে প্রশিক্ষণের সময় মেমরির বাইরের ক্র্যাশ প্রতিরোধ করে।
প্রশিক্ষণের সময় 4-বিট ওজনগুলি কখন উচ্চ নির্ভুলতায় রূপান্তরিত হয়?
4-বিট ওজন প্রতিটি ম্যাট্রিক্স গুন করার জন্য 16-বিট নির্ভুলতার জন্য ডিকোয়ান্টাইজ করা হয়, তারপর মেমরি বাঁচানোর জন্য উচ্চ-নির্ভুলতা কপিটি ফেলে দেওয়া হয়।