دليل اللغة AI

قوانين تحجيم شينشيلا

أظهرت قوانين قياس شينشيلا، من DeepMind في عام 2022، أن معظم نماذج اللغات الكبيرة كانت غير مدربة بشكل سيئ: بالنسبة لميزانية حسابية ثابتة، يجب عليك قياس حجم النموذج وبيانات التدريب بنسب متساوية تقريبًا.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

الغوص العميق

قبل شينشيلا، كان الاتجاه هو بناء نماذج أكبر من أي وقت مضى (مثل GPT-3 بمعلمة 175B) مع التدريب على كميات متواضعة نسبيًا من البيانات. قامت DeepMind بتدريب أكثر من 400 نموذج عبر العديد من الأحجام وميزانيات البيانات، ثم قامت بملاءمة المنحنيات التي تتنبأ بالخسارة كدالة للمعلمات والرموز ضمن ميزانية الحوسبة الثابتة (FLOP). النتيجة التي توصلوا إليها: يجب أن يتم قياس المعلمات ورموز التدريب معًا، تقريبًا بنسبة 1 إلى 1، مما يعني ضمنيًا حوالي 20 رمزًا من بيانات التدريب لكل معلمة. ولإثبات ذلك، قاموا بتدريب Chinchilla، وهو نموذج ذو معلمة 70B على 1.4 تريليون رمز، والذي تفوق في الأداء على Gopher الأكبر بكثير ذو المعلمة 280B على الرغم من استخدامه نفس الحوسبة، لأنه تم تدريبه على بيانات أكثر بكثير.

البصيرة الفنية

تأتي القوانين من ملاءمة دالة الخسارة البارامترية L(N, D) حيث N هي المعلمات وD هي الرموز المميزة، بما في ذلك مصطلحات الخسارة غير القابلة للاختزال وحجم النموذج وحجم البيانات. يؤدي تقليل الخسارة الخاضعة لقيود الحوسبة (الحوسبة متناسبة تقريبًا مع N مرات D) إلى نتيجة مفادها أن N وD الأمثل ينموان كقوة حوسبة ذات أسس مماثلة، وبالتالي تظل نسبة الحوسبة المثالية بالقرب من 20 رمزًا مميزًا لكل معلمة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل قوانين تحجيم شينشيلا

حولت شينشيلا المجال من مطاردة أعداد المعلمات إلى تغذية النماذج ببيانات عالية الجودة، وغالبًا ما تتدرب النماذج الحديثة بشكل جيد بعد نقطة "الحساب الأمثل" لجعل الاستدلال أرخص. مع ندرة نصوص الويب عالية الجودة، يتجه الاهتمام إلى تنظيم البيانات، والبيانات الاصطناعية، والعصور المتعددة، والبيانات متعددة الوسائط لمواصلة التوسع. ويستمر الدرس الأساسي: يجب أن تكون البيانات والمعلمات متوازنة، ولم يعد الحجم الأولي وحده هو الهدف.

التنفيذ في العالم الحقيقي

تتفوق Chinchilla ذات المعلمة 70B من DeepMind على 280B Gopher في المعايير باستخدام الحوسبة المتساوية، من خلال التدريب على المزيد من البيانات

توجيه الفرق لتخصيص ما يقرب من 20 رمزًا تدريبيًا لكل معلمة عند التخطيط لنموذج من البداية

تبرير النماذج الأصغر حجمًا والغنية بالبيانات مثل LLaMA والتي تكون أرخص في التشغيل في وقت الاستدلال

تقدير ما إذا كان النموذج المخطط "غير مدرب" وسيستفيد من البيانات الإضافية أكثر من المعلمات الإضافية

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

قوانين التوسع للشبكات العصبية

الأسئلة المتداولة

What is Chinchilla Scaling Laws?

أظهرت قوانين قياس شينشيلا، من DeepMind في عام 2022، أن معظم نماذج اللغات الكبيرة كانت غير مدربة بشكل سيئ: بالنسبة لميزانية حسابية ثابتة، يجب عليك قياس حجم النموذج وبيانات التدريب بنسب متساوية تقريبًا. إنه أمر مهم لأنه أعاد تعريف ما يعنيه حجم النموذج "الأمثل" وأعاد تشكيل كيفية إنفاق المعامل للحوسبة.

ما هي النتيجة المركزية لقوانين تحجيم شينشيلا؟

أظهر شينشيلا أنه بالنسبة لميزانية الحوسبة الثابتة، يجب أن تنمو المعلمات ورموز التدريب معًا، تقريبًا من 1 إلى 1.

ما هو عدد رموز التدريب المميزة تقريبًا لكل معلمة التي اقترحتها شينشيلا لتكون الحساب الأمثل؟

تعمل نسبة الحوسبة المثالية على ما يقرب من 20 رمزًا تدريبيًا لكل معلمة نموذج.

ما هو النموذج الذي تفوقت فيه شينشيلا على الرغم من كونها أصغر حجما؟

لقد تغلبت Chinchilla ذات المعلمة 70B على Gopher الخاص بشركة DeepMind والذي يبلغ 280B باستخدام نفس الحساب، لأنها تدربت على بيانات أكثر بكثير.

ماذا كانت تعني شينشيلا بشأن نماذج مثل GPT-3 في ذلك الوقت؟

كانت العديد من النماذج الكبيرة في تلك الحقبة غير مدربة جيدًا، مما يعني أنها كانت ستؤدي بشكل أفضل مع وجود بيانات أكثر بكثير لعدد المعلمات الخاصة بها.

تقريبًا كيف تم تقريب الحساب في تحليل شينشيلا؟

يتناسب حساب التدريب (FLOPs) تقريبًا مع عدد المعلمات مضروبًا في عدد الرموز المميزة للتدريب.