دليل الأساسيات

شينشيلا حساب التدريب الأمثل

Chinchilla هي إحدى النتائج التي توصلت إليها DeepMind في عام 2022 والتي تفيد بأن معظم نماذج اللغات الكبيرة لم يتم تدريبها بشكل جيد: بالنسبة لميزانية الحوسبة الثابتة، يجب عليك قياس المعلمات والبيانات بشكل متساوٍ تقريبًا، وليس فقط بناء نموذج أكبر.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

أعاد تشكيل كيفية موازنة الصناعة بين حجم النموذج وبيانات التدريب.

الغوص العميق

قامت ورقة Chinchilla التي أعدتها شركة DeepMind بإعادة النظر في القياس وتدريب أكثر من 400 نموذج للعثور على التوازن الحسابي الأمثل. القاعدة الأساسية: يجب أن ينمو حجم النموذج ورموز التدريب بشكل متواصل، أي ما يقرب من 20 رمزًا تدريبيًا لكل معلمة. ولإثبات ذلك، قاموا بتدريب Chinchilla، وهو نموذج مكون من 70 مليار معلمة على 1.4 تريليون رمز، باستخدام نفس الحوسبة التي قام بها Gopher الذي يحتوي على 280 مليار معلمة والتي تم تدريبها على عدد أقل بكثير من الرموز. شينشيلا، على الرغم من كونها أصغر بأربع مرات، تفوقت على Gopher وGPT-3 وغيرهم من العمالقة في كل المعايير تقريبًا. لقد أبطل الدرس الاستنتاج السابق OpenAI الذي كان يفضل الحجم على البيانات، موضحًا أن العديد من النماذج الرئيسية كانت تترك الأداء على الطاولة بسبب كونها كبيرة جدًا وتفتقر إلى البيانات.

البصيرة الفنية

خسارة تناسب شينشيلا مثل L(N,D) = E + A·N^(-α) + B·D^(-β)، مع α وβ بالقرب من 0.34، مما يعني أن المعلمات والبيانات تساهم بشكل متماثل تقريبًا. يؤدي تحسين ذلك في ظل قيد حساب ثابت (حساب ≈ 6·N·D للمحولات) إلى الحصول على نتيجة متساوية القياس. إن النموذج الأصغر حجمًا والغني بالبيانات هو أيضًا أرخص في تشغيله عند الاستدلال، لذا فإن ميزته تتضاعف في النشر، وليس فقط في التدريب.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل تدريب شينشيلا على الحوسبة الأمثل

تتخطى النماذج الحديثة مثل Llama 3 عمدًا نسبة 20 رمزًا لكل معلمة في Chinchilla، حيث تقوم بتدريب النماذج الصغيرة على تريليونات من الرموز المميزة لجعل الاستدلال رخيصًا، وقبول حسابات التدريب دون المستوى الأمثل. ومع تزايد ندرة البيانات الجيدة، يتزايد الاهتمام بالعصور المتكررة، والبيانات الاصطناعية، وتصفية الجودة. وتظل شينشيلا هي النقطة المرجعية، ولكن الأمثل يعتمد بشكل متزايد على تكلفة الاستدلال مدى الحياة، وليس فقط ميزانية التدريب لمرة واحدة.

التنفيذ في العالم الحقيقي

اختيار تدريب نموذج مكون من 7 مليارات معلمة على 2 تريليون رمز بدلاً من نموذج مكون من 30 مليارًا على بيانات قليلة جدًا لنفس الميزانية.

تقدير أن نموذجًا مكونًا من 10 مليارات معلمة يحتاج إلى ما يقرب من 200 مليار رمز للوصول إلى النقطة المثالية للحوسبة.

تبرير نموذج منشور أصغر لخفض تكاليف الاستدلال لكل استعلام مع مطابقة جودة منافس أكبر.

مراجعة النموذج الحالي واستنتاج أنه لم يتم تدريبه جيدًا، ثم التخطيط لعملية تدريب أطول بدلاً من زيادة المعلمات.

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث يساعد تدريب Chinchilla Compute-Optimal Training وأين تكون الطرق الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التدريب في وقت الاختبار

الأسئلة المتداولة

ما هو تدريب شينشيلا الحاسوبي الأمثل؟

Chinchilla هي إحدى النتائج التي توصلت إليها DeepMind في عام 2022 والتي تفيد بأن معظم نماذج اللغات الكبيرة لم يتم تدريبها بشكل جيد: بالنسبة لميزانية الحوسبة الثابتة، يجب عليك قياس المعلمات والبيانات بشكل متساوٍ تقريبًا، وليس فقط بناء نموذج أكبر. لقد أعاد تشكيل كيفية موازنة الصناعة بين حجم النموذج وبيانات التدريب.

ما هي قاعدة شينشيلا الشهيرة للتدريب الأمثل على الحوسبة؟

وجدت DeepMind أن المعلمات والرموز المميزة يجب أن يتم قياسها معًا بحوالي 20 رمزًا مميزًا لكل معلمة لميزانية حسابية معينة.

كيف يمكن مقارنة شينشيلا ذات المعلمة 70B مع غوفر ذات المعلمة 280B؟

بعد تدريبه على عدد أكبر بكثير من الرموز بنفس الحوسبة، تغلب Chinchilla على Gopher الأكبر بكثير في معظم المعايير.

ما هي المشكلة الرئيسية التي كشفت عنها ورقة شينشيلا بشأن النماذج الكبيرة السابقة؟

كانت النماذج مثل GPT-3 وGopher كبيرة جدًا مقارنة ببيانات التدريب الخاصة بها، مما أدى إلى عدم تحقيق الأداء.

ما هو عدد الرموز المميزة التي تقترحها قاعدة شينشيلا تقريبًا لنموذج مكون من 10 مليار معلمة؟

عند 20 رمزًا مميزًا لكل معلمة، فإن 10 مليار معلمة تعني حوالي 200 مليار رمز تدريبي.

إلى جانب كفاءة التدريب، لماذا يعد النموذج الأصغر حجمًا والغني بالبيانات جذابًا في النشر؟

ويعني وجود معلمات أقل انخفاضًا في حساب كل استعلام، وبالتالي يتضاعف التوفير في كل مرة يتم فيها استخدام النموذج.