دليل اللغة AI

QLoRA وضبط دقيق 4 بت

QLoRA هي تقنية تتيح لك ضبط نموذج لغة ضخم على وحدة معالجة رسومات مستهلكة واحدة عن طريق تخزين النموذج المجمد في 4 بتات فقط لكل وزن.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.

الغوص العميق

عادةً ما يعني الضبط الدقيق لنموذج كبير تحميل كل الأوزان بدقة 16 بت وتحديثها جميعًا، الأمر الذي يتطلب ذاكرة هائلة. تجمع QLoRA بين فكرتين. أولاً، يقوم بتجميد النموذج المُدرب مسبقًا وتكميمه إلى 4 بتات، مما يؤدي إلى خفض الذاكرة أربعة أضعاف تقريبًا. ثانيًا، يستخدم LoRA: بدلاً من تحديث مصفوفات الوزن العملاقة، فإنه يقوم بحقن مصفوفات محولات صغيرة منخفضة الرتبة قابلة للتدريب بجانبها، لذلك يتم تحديث بضعة ملايين فقط من المعلمات. تظل قاعدة 4 بت ثابتة بينما تتدفق التدرجات فقط من خلال المحولات الصغيرة. أظهر QLoRA، الذي تم تقديمه في عام 2023 بواسطة Dettmers وزملائه، أن الضبط الدقيق لنموذج 65B على وحدة معالجة رسومات واحدة بسعة 48 جيجابايت يمكن أن يتطابق مع جودة الضبط الدقيق الكامل لـ 16 بت.

البصيرة الفنية

قدمت QLoRA ثلاث حيل. NF4 (4 بت NormalFloat) هو نوع بيانات مُحسّن لتوزيع منحنى الجرس للأوزان العصبية، مما يوفر دقة أفضل من int4 العادي. يضغط التكميم المزدوج ثوابت التكميم نفسها، مما يوفر ذاكرة إضافية. تستخدم أدوات التحسين المقسمة إلى صفحات ذاكرة موحدة لوحدة معالجة الرسومات (GPU) ووحدة المعالجة المركزية (CPU) لامتصاص الارتفاعات أثناء التسلسلات الطويلة، مما يمنع حدوث أعطال بسبب نفاد الذاكرة. أثناء التمرير للأمام والخلف، يتم تجزئة الأوزان ذات 4 بت إلى 16 بت في الوقت المناسب لتتضاعف المصفوفة، ثم يتم التخلص منها.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل QLoRA والضبط الدقيق لـ 4 بت

لقد أصبح الضبط الدقيق لـ 4 بت ممارسة قياسية، وتتجه الأبحاث الآن نحو دقة أقل، بما في ذلك تمثيل 2 بت و1 بت (الثلاثي). تعمل أنظمة التكميم الأحدث مثل AWQ وGPTQ وHQQ على تحسين الدقة بشكل أكبر، بينما تهدف تقنيات مثل QA-LoRA إلى الحفاظ على النموذج كميًا حتى بعد دمج المحولات. مع نمو النماذج ذات الوزن المفتوح، توقع أن تصبح الأدوات التي تتيح للهواة ضبط النماذج التي تزيد عن 70 مليارًا على وحدة معالجة رسومات ألعاب واحدة روتينية، مما يضفي طابعًا ديمقراطيًا على التخصيص.

التنفيذ في العالم الحقيقي

تقوم إحدى الشركات الناشئة بضبط نموذج 70B Llama على وحدة معالجة رسومات واحدة بسعة 48 جيجابايت لإنشاء مساعد دعم العملاء بصوت علامتها التجارية الخاصة دون استئجار مجموعة خوادم.

يقوم باحث يستخدم مستهلكًا واحدًا RTX 4090 بتكييف نموذج مفتوح لمجموعة بيانات متخصصة للإجابة على الأسئلة الطبية بين عشية وضحاها.

يقوم المطور بإنشاء العشرات من محولات LoRA الصغيرة القابلة للتبديل لمهام مختلفة، وكلها تشترك في نموذج أساسي واحد 4 بت يتم تحميله في الذاكرة.

يقوم أحد الهواة بضبط النموذج في سجلات الدردشة الشخصية الخاصة به لتقليد أسلوب كتابة معين باستخدام أجهزة مجانية من فئة Colab.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the QLoRA and 4-Bit Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

رفض أخذ العينات صقل

الأسئلة المتداولة

What is QLoRA and 4-Bit Fine-Tuning?

QLoRA هي تقنية تتيح لك ضبط نموذج لغة ضخم على وحدة معالجة رسومات مستهلكة واحدة عن طريق تخزين النموذج المجمد في 4 بتات فقط لكل وزن. لقد جعل تخصيص نماذج ذات معلمات 65B أمرًا ممكنًا على الأجهزة التي لم يكن بإمكانها في السابق التعامل إلا مع جزء صغير من هذا الحجم.

ما هي الفكرة الأساسية لتوفير الذاكرة وراء الجزء "4 بت" من QLoRA؟

يقوم QLoRA بتخزين الأوزان المجمدة المُدربة مسبقًا بمعدل 4 بتات لكل قيمة، مما يؤدي إلى خفض الذاكرة بمقدار أربعة أضعاف تقريبًا مقارنة بـ 16 بت.

أثناء الضبط الدقيق لـ QLoRA، ما هي المعلمات التي يتم تحديثها فعليًا عن طريق نزول التدرج؟

تم تجميد النموذج الأساسي. فقط مصفوفات المحولات ذات الرتبة المنخفضة المحقونة هي التي تتلقى تحديثات متدرجة، وهي مجرد جزء صغير من المعلمات.

ما هو NF4 في سياق QLoRA؟

NF4 (NormalFloat 4-bit) هو نوع بيانات مصمم حول توزيع منحنى الجرس لأوزان الشبكة العصبية للحصول على دقة أفضل من int4 العادي.

ما هي المشكلة التي يواجهها "أدوات تحسين الصفحات" في عنوان QLoRA؟

تستخدم أدوات التحسين المقسمة إلى صفحات ذاكرة موحدة لوحدة معالجة الرسومات (GPU) ووحدة المعالجة المركزية (CPU) لاستيعاب طفرات الذاكرة، مما يمنع حدوث أعطال في الذاكرة أثناء التدريب على المدخلات الطويلة.

متى يتم تحويل أوزان 4 بت مرة أخرى إلى دقة أعلى أثناء التدريب؟

يتم تجزئة الأوزان ذات 4 بت إلى دقة 16 بت بسرعة لكل مصفوفة تتضاعف، ثم يتم التخلص من النسخة ذات الدقة الأعلى لحفظ الذاكرة.