دليل اللغة AI

ضبط التعليمات

ضبط التعليمات هو خطوة التدريب التي تحول توقع النص الأولي إلى نموذج يتبع في الواقع تعليمات مثل "تلخيص هذا" أو "كتابة رد مهذب". وهذا ما يجعل النموذج الأساسي يبدو مفيدًا وقابلاً للتوجيه.

قراءة لمدة دقيقتينآخر تحديث

الغوص العميق

يتم تدريب نموذج اللغة الأساسية فقط للتنبؤ بالرمز المميز التالي على نص الويب، لذلك إذا كتبت سؤالاً، فقد يستمر في طرح المزيد من الأسئلة بدلاً من الإجابة. ضبط التعليمات يصلح هذا. إنه شكل من أشكال الضبط الدقيق الخاضع للإشراف: يتم تدريب النموذج على العديد من أزواج (التعليمات، والاستجابة المثالية) التي تغطي آلاف المهام - الترجمة، والتلخيص، والتصنيف، والأسئلة والأجوبة، والترميز، والمزيد. من خلال رؤية نفس نمط التعليمات ثم الإجابة المفيدة بشكل متكرر، يتعلم النموذج السلوك العام المتمثل في "افعل ما يطلبه المستخدم"، وهذا يعمم على التعليمات التي لم يراها مطلقًا في التدريب. تم إنشاء هذا النهج في عام 2021 تقريبًا من خلال أعمال مثل FLAN وT0 وNatural Instructions، وكان أساسيًا في InstructGPT الخاص بـ OpenAI، والذي قام بضبط GPT-3 على مجموعة منسقة من تعليمات التعليمات. إنه الأساس الذي يقوم عليه معظم مساعدي الدردشة.

البصيرة الفنية

ميكانيكيًا، يعد ضبط التعليمات بمثابة تعلم قياسي تحت الإشراف: تقليل الفرق بين الرموز المميزة المتوقعة للنموذج والإجابة المرجعية، مع تحديث التدرجات للأوزان. وهو يختلف عن RLHF (التعلم المعزز من ردود الفعل البشرية)، والذي يأتي بعد التفضيلات البشرية ويحسنها باستخدام نموذج المكافأة. تتكون الوصفة المعتادة من عدة طبقات: التدريب المسبق، ثم ضبط التعليمات (SFT) لتعليم متابعة المهام، ثم اختياريًا RLHF لتحسين النغمة والمساعدة والسلامة. إن تنوع البيانات له أهمية أكبر من مجرد الحجم، حيث أن التغطية الواسعة للمهام هي التي تدفع التعميم.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل ضبط التعليمات

ويتحول هذا المجال من مجموعات البيانات العملاقة المكتوبة بخط اليد، إلى بيانات اصطناعية جزئيًا عالية الجودة - وأحيانًا مجرد بضعة آلاف من الأمثلة المختارة بعناية - بعد اكتشاف أن جودة البيانات يمكن أن تتفوق على الكمية. توقع المزيد من ضبط التعليمات الخاصة بالمجال (الطبي والقانوني والترميز)، ومجموعات التعليمات متعددة اللغات ومتعددة الوسائط، وخطوط الأنابيب الآلية التي تولد بيانات التعليمات وتصفيتها. سيظل ضبط التعليمات هو الجسر الأساسي بين النموذج الأولي المُدرب مسبقًا والمساعد القابل للاستخدام، مقترنًا بشكل متزايد بتحسين التفضيلات للمحاذاة.

التنفيذ في العالم الحقيقي

تحويل نموذج نمط GPT الأساسي إلى مساعد دردشة يجيب على الأسئلة بدلاً من تكرارها

تم ضبط FLAN-T5 عبر العديد من المهام حتى يتمكن من اتباع التعليمات التي لم يتم التدريب عليها بشكل صريح من قبل

InstructGPT، حيث تم ضبط تعليمات GPT-3 على المطالبات المنسقة لإنتاج استجابات أكثر فائدة بكثير

بناء مساعد داخلي للشركة من خلال الضبط الدقيق لأزواج التعليمات والاستجابة المكتوبة بواسطة فرق الدعم والفرق القانونية

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Instruction Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Instruction Tuning?

ضبط التعليمات هو خطوة التدريب التي تحول توقع النص الأولي إلى نموذج يتبع في الواقع تعليمات مثل "تلخيص هذا" أو "كتابة رد مهذب". وهذا ما يجعل النموذج الأساسي يبدو مفيدًا وقابلاً للتوجيه.

كيف يختلف ضبط التعليمات عن RLHF؟

يتم الإشراف على ضبط التعليمات من خلال التعلم على الاستجابات المستهدفة. يأتي RLHF بعد ذلك ويحسن النموذج وفقًا للتفضيلات البشرية المكتسبة.

ما هي خاصية بيانات ضبط التعليمات التي تحرك قدرة النموذج على اتباع التعليمات الجديدة غير المرئية؟

إن تغطية مجموعة واسعة من المهام يعلم السلوك العام لاتباع التعليمات، والذي يعمم على تعليمات لم يسبق لها مثيل في التدريب.

ما هو الترتيب النموذجي لمراحل التدريب لمساعد الدردشة الحديث؟

يتم أولاً تدريب النماذج مسبقًا على النص الخام، ثم يتم ضبط التعليمات لمتابعة المهام، وغالبًا ما يتم تحسينها باستخدام RLHF لتحقيق النغمة والسلامة.