مزيج من خبراء LoRA
يجمع مزيج خبراء LoRA (MoLE) بين العديد من المحولات الصغيرة المدربة بتكلفة زهيدة مع جهاز توجيه متعلم بحيث يمكن لنموذج أساسي واحد أن يتخصص بمرونة عبر المهام أو الأنماط أو المهارات.
نظرة عامة
It matters because it brings the modularity of Mixture-of-Experts to fine-tuning without retraining huge networks.
الغوص العميق
يقوم LoRA (التكيف منخفض الرتبة) بتجميد أوزان النموذج المُدرب مسبقًا وتدريب مصفوفات صغيرة منخفضة الرتبة تعمل على تحفيز سلوكه، مما يجعل الضبط الدقيق رخيصًا. يقوم Mixture of LoRA Experts بتدريب العديد من هذه المحولات، حيث يلتقط كل منها مهارة أو مجالًا أو مفهومًا مرئيًا مختلفًا، ثم يضيف شبكة بوابة صغيرة تقرر المحولات التي سيتم تنشيطها (ومدى قوتها) لمدخل معين. بدلاً من إجراء ضبط دقيق متجانس واحد، ستحصل على مكتبة من الخبراء القابلين للتأليف. يمكن لجهاز التوجيه مزج الخبراء لكل طبقة ولكل رمز مميز، لذلك قد يسحب استعلام الترميز محول Python بينما تسحب موجه القصة محولًا سرديًا. يؤدي هذا إلى تجنب التداخل والنسيان الكارثي الذي يفرضه تدريب محول واحد على العديد من المهام المختلطة في وقت واحد، ويتيح للفرق إضافة أو إزالة التخصصات دون لمس العمود الفقري المتجمد.
البصيرة الفنية
يقوم كل خبير في LoRA بإدخال دلتا W = B*A، حيث تكون A وB مصفوفتان منخفضتا الرتبة (الرتبة غالبًا 4-64). تنتج وظيفة البوابات أوزانًا على الخبراء، ويتم دمج المخرجات كمجموع مرجح (خلط ناعم) أو تحديد أعلى k (توجيه متناثر). من المهم أن تظل الأوزان الأساسية مجمدة، لذلك يتم تدريب المحولات وجهاز التوجيه فقط. في نماذج صور الانتشار، تتعلم البوابات الهرمية أوزان كل طبقة، بحيث تتشكل LoRAs ذات المفاهيم المتعددة دون أن يتغلب أحدها على الآخرين.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل خليط خبراء LoRA
توقع أسواق المحولات حيث تقوم النماذج بتحميل خبراء LoRA المجتمعيين عند الطلب، بالإضافة إلى أجهزة التوجيه التي تكتشف تلقائيًا الخبراء الذين تحتاجهم المهمة في وقت الاستدلال. تدفع الأبحاث نحو التكوين المتعلم الذي يحل التعارضات بين المحولات، وتخصيص الرتبة الديناميكية لكل خبير، ودمج وزارة التعليم مع نموذج أساسي متناثر وزارة التعليم للتخصص على مستويين. تستفيد عمليات النشر على الجهاز والحافة أكثر من غيرها، نظرًا لأن تبديل محول يبلغ حجمه بضعة ميغابايت أرخص بكثير من شحن نماذج كاملة جديدة.
التنفيذ في العالم الحقيقي
مساعد التعليمات البرمجية الذي يوجه بين خبراء LoRA المنفصلين في Python وSQL وRust اعتمادًا على الملف أو الموجه، مع تجنب التداخل بين اللغات.
يقوم مستخدمو Stable Diffusion بتكديس LoRAs ذات الشخصيات والأنماط المتعددة مع طبقة بوابة بحيث تحافظ الصورة على وجه محدد ونمط فني دون تفجير الألوان أو التفاصيل.
يقوم برنامج الدردشة الآلي الخاص بالمؤسسة بتحميل المحولات لكل قسم (القانونية، والموارد البشرية، والمالية) على نفس النموذج الأساسي المجمد، وتبديلها دون إعادة النشر.
نموذج دعم متعدد اللغات مع خبير LoRA واحد لكل لغة، يتم توجيهه عن طريق لغة الإدخال المكتشفة للحفاظ على طلاقة كل لغة.
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of LoRA Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
مزيج من الخبراء
الأسئلة المتداولة
What is Mixture of LoRA Experts?
يجمع مزيج خبراء LoRA (MoLE) بين العديد من المحولات الصغيرة المدربة بتكلفة زهيدة مع جهاز توجيه متعلم بحيث يمكن لنموذج أساسي واحد أن يتخصص بمرونة عبر المهام أو الأنماط أو المهارات. إنه أمر مهم لأنه يجلب نمطية مزيج الخبراء إلى الضبط الدقيق دون إعادة تدريب الشبكات الضخمة.
ما الذي يشير إليه جزء "LoRA" من خليط خبراء LoRA؟
يرمز LoRA إلى التكيف منخفض الرتبة: فهو يجمد النموذج الأساسي ويدرب مصفوفات مدمجة منخفضة الرتبة تعمل على ضبط السلوك بتكلفة زهيدة.
ما هي وظيفة شبكة البوابات/الموجهات في الوزارة؟
يُنتج جهاز التوجيه أوزانًا مقارنة بخبراء LoRA المتاحين، ويختارها ويمزجها لكل إدخال (وغالبًا لكل طبقة أو رمز مميز).
لماذا غالبًا ما يكون MoLE أفضل من تدريب محول واحد على العديد من المهام المختلطة؟
يتجنب الخبراء المنفصلون النسيان الكارثي وتداخل المهام الذي يحدث عندما يتعين على محول واحد أن يتعلم العديد من المهارات المتضاربة في وقت واحد.
أثناء تدريب MoLE، ما الذي يحدث بشكل عام للأوزان المدربة مسبقًا للنموذج الأساسي؟
يبقى العمود الفقري مجمدا. فقط خبراء LoRA الصغار وشبكة البوابات يتلقون تحديثات متدرجة.
في نماذج صور الانتشار، ما هي المشكلة التي تساعد في حلها البوابات الهرمية/لكل طبقة في MoLE؟
يتعلم البوابات لكل طبقة مدى قوة مساهمة كل محول في كل طبقة، مما يسمح للعديد من مفهوم LoRAs بالدمج دون سيطرة واحدة.