دليل اللغة AI

طبقات المحول للنقل

طبقات المحول عبارة عن وحدات صغيرة قابلة للتدريب يتم إدخالها في نموذج مُدرب مسبقًا، مما يتيح لك تكييفه مع المهام الجديدة عن طريق تحديث نسبة قليلة فقط من المعلمات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

They make fine-tuning cheap, modular, and easy to swap.

الغوص العميق

المحولات، التي شاعها هولسبي وآخرون. (2019) لنقل التعلم في البرمجة اللغوية العصبية، معالجة مشكلة مكلفة: الضبط الدقيق الكامل يقوم بتحديث كل وزن في نموذج كبير وينتج نسخة جديدة كاملة لكل مهمة. يقوم المحول بدلاً من ذلك بإدخال شبكات عنق الزجاجة الصغيرة في كل كتلة محول، وعادةً ما يكون إسقاطًا لأسفل إلى بُعد منخفض، وعدم خطية، وإسقاطًا خلفيًا لأعلى، ملفوفًا في اتصال متبقي. أثناء التدريب، تظل الأوزان الأصلية المدربة مجمدة؛ يتم تعلم المحولات فقط (غالبًا ما تكون أقل من 5% من إجمالي المعلمات). وينتج عن ذلك جودة ضبط شبه كاملة على معايير مثل GLUE مع تدريب معلمات أقل بكثير. نظرًا لأن كل مهمة لها مهايئ صغير خاص بها، يمكنك تخزين نموذج أساسي واحد بالإضافة إلى العديد من وحدات المهام خفيفة الوزن، وتبديلها أو حتى تكديسها. تعد المحولات عضوًا أساسيًا في عائلة الضبط الدقيق (PEFT) ذات كفاءة المعلمة، جنبًا إلى جنب مع LoRA وضبط البادئة.

البصيرة الفنية

يعرض محول عنق الزجاجة الكلاسيكي حالة مخفية ذات أبعاد d وصولاً إلى بُعد أصغر بكثير m، ويطبق عدم خطية، ثم يُسقط مرة أخرى حتى d، مع اتصال تخطي بحيث يبدأ بالقرب من الهوية. وبما أن m أصغر بكثير من d، تكون المعلمات المضافة صغيرة جدًا. نظرًا لتجميد النموذج الأساسي، تتدفق التدرجات فقط من خلال أوزان المحول، مما يؤدي إلى خفض ذاكرة المُحسِّن. تكلفة وقت التشغيل الرئيسية هي زمن انتقال إضافي صغير لكل طبقة، والذي تقلله أساليب مثل LoRA عن طريق دمج الأوزان المستفادة مرة أخرى في المصفوفات الأساسية.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل طبقات المحول للنقل

أصبحت المحولات ومجموعة أدوات PEFT الأوسع الآن معيارًا قياسيًا لتخصيص النماذج الكبيرة بتكلفة معقولة، خاصة عندما تكون أحجام النماذج بالونًا. توقع نموًا في تكوين المحول (الجمع بين محولات المهام أو اللغة بشكل نمطي، كما هو الحال في المحول Hub)، والتوجيه بين العديد من المحولات عند الاستدلال، والتخصيص على الجهاز حيث يقوم محول صغير بتخصيص نموذج أساسي مشترك لكل مستخدم. تهيمن متغيرات LoRA بشكل متزايد من حيث الكفاءة المطلقة، ولكن الفكرة الأساسية، وهي تجميد النموذج العملاق وتدريب مكون إضافي صغير، أصبحت الآن أساسية لكيفية توسيع نطاق التخصيص.

التنفيذ في العالم الحقيقي

إضافة محول خاص باللغة بحيث يمكن تخصيص نموذج واحد متعدد اللغات للغة السواحلية، على سبيل المثال، دون إعادة تدريب الشبكة بأكملها.

الحفاظ على نموذج أساسي واحد بالإضافة إلى العشرات من المحولات الصغيرة لكل عميل في منتج SaaS، وتبديل المحول المناسب لكل طلب.

ضبط نموذج لتصنيف المشاعر من خلال تدريب محول بنسبة قليلة فقط، ثم الحفاظ على القاعدة مشتركة لمهام أخرى.

تكديس محول المهام أعلى محول المجال (على سبيل المثال، محول النص القانوني بالإضافة إلى محول التلخيص) لإعادة الاستخدام المعياري.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adapter Layers for Transfer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

T5 ونقل النص إلى نص

الأسئلة المتداولة

What is Adapter Layers for Transfer?

طبقات المحول عبارة عن وحدات صغيرة قابلة للتدريب يتم إدخالها في نموذج مُدرب مسبقًا، مما يتيح لك تكييفه مع المهام الجديدة عن طريق تحديث نسبة قليلة فقط من المعلمات. إنها تجعل الضبط الدقيق رخيصًا ومعياريًا وسهل التبديل.

ماذا يحدث للأوزان الأصلية المدربة عند التدريب باستخدام المحولات؟

ضبط المحول يحافظ على تجميد النموذج الأساسي ويتعلم فقط الوحدات الصغيرة المدرجة.

ما هو الهيكل الداخلي النموذجي لمحول عنق الزجاجة؟

يقوم المحول الكلاسيكي بضغط الحالة المخفية إلى بُعد منخفض، ويطبق اللاخطية، ويعرض نسخة احتياطية، ويضيف اتصال تخطي.

ما هو الجزء تقريبًا من المعلمات التي تقوم المحولات بتدريبها عادةً؟

عادةً ما تضيف المحولات وتدرب نسبة قليلة فقط من إجمالي معلمات النموذج، وهو عدد أقل بكثير من الضبط الدقيق الكامل.

لماذا تعتبر المحولات ملائمة لخدمة العديد من المهام؟

نظرًا لأن كل مهمة تحتاج فقط إلى محول صغير، يمكن لنموذج أساسي مشترك واحد أن يخدم العديد من المهام عن طريق تبديل الوحدات خفيفة الوزن.

إلى أي عائلة من التقنيات تنتمي المحولات؟

تعد المحولات طريقة PEFT أساسية، جنبًا إلى جنب مع أساليب مثل LoRA وضبط البادئة.