تحسين الدرجة الثانية وطرق نيوتن
يستخدم التحسين من الدرجة الثانية معلومات الانحناء (مصفوفة هسه للمشتقات الثانية) لاتخاذ خطوات أكثر ذكاءً نحو الحد الأدنى، وليس فقط الميل.
نظرة عامة
It can converge in dramatically fewer iterations than plain gradient descent, but the cost of computing curvature makes it tricky to scale.
الغوص العميق
يعرف الهبوط المتدرج فقط المنحدر عند نقطتك الحالية، لذا فهو يختار حجم خطوة ثابتًا أو مضبوطًا يدويًا ويأمل في الأفضل. تذهب طريقة نيوتن إلى أبعد من ذلك: فهي تنظر أيضًا إلى كيفية تغير الميل (الانحناء)، الذي تم التقاطه بواسطة مصفوفة هسيان، وهي مصفوفة لجميع المشتقات الجزئية الثانية. يقوم التحديث بضرب معكوس هسي بالتدرج، مما يؤدي تلقائيًا إلى إعادة قياس كل اتجاه والهبوط بالقرب من الحد الأدنى للتقريب التربيعي المحلي. للحصول على وعاء تربيعي مثالي، تصل طريقة نيوتن إلى القاع في خطوة واحدة. المصيد صعب: النموذج الذي يحتوي على معلمات N يحتوي على N-by-N Hessian، لذا فإن تخزينه وعكسه يكلف تقريبًا ذاكرة N-squared وحساب N-cubed. وهذا أمر مستحيل بالنسبة للشبكات ذات المليارات من المعلمات، ولهذا السبب يستخدم الممارسون تقديرات تقريبية أرخص.
البصيرة الفنية
تحديث نيوتن الأساسي هو x_new = x - H_inverse مضروبًا في التدرج، حيث H هو الهسي. تتجنب أساليب شبه نيوتن مثل BFGS وL-BFGS حساب H مباشرة عن طريق بناء تقريب جاري لعكسه من اختلافات التدرج المتعاقبة. يخزن L-BFGS فقط آخر عدد قليل من متجهات التدرج والخطوات بدلاً من المصفوفة الكاملة، مما يؤدي إلى قطع الذاكرة من N-squared إلى مضاعف صغير لـ N مع الحفاظ على معظم تسريع التقارب.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل تحسين الدرجة الثانية وطرق نيوتن
بالنسبة للشبكات العصبية العملاقة، تظل أساليب الدرجة الثانية الكاملة غير عملية، لكن التقريبات تكتسب المزيد من الأرض. تقوم أدوات تحسين الأداء مثل K-FAC وشامبو بتقدير الانحناء التقريبي باستخدام بنية كتلة قطرية أو بنية عامل كرونيكر، وتستخدم الأساليب الأحدث مثل Sophia وMuon تقديرات انحناء رخيصة لتسريع التدريب المسبق لنماذج اللغة الكبيرة. توقع استمرار الجهود لالتقاط إشارة انحناء مفيدة بتكلفة تقارب الدرجة الأولى، مما يؤدي إلى تضييق الفجوة بين خطوات آدم وخطوات نيوتن الحقيقية.
التنفيذ في العالم الحقيقي
L-BFGS يناسب الانحدار اللوجستي والنماذج المحدبة الأخرى في scikit-learn، حيث غالبًا ما يتفوق على نزول التدرج البسيط في مجموعات البيانات الصغيرة إلى المتوسطة
تعديل الحزمة في إعادة البناء ثلاثي الأبعاد وSLAM، حيث يقوم Gauss-Newton وLevenberg-Marquardt بتحسين أوضاع الكاميرا ومواضع النقاط
تدريب شبكات عصبية صغيرة تعتمد على الفيزياء حيث يحقق L-BFGS الدقة التي يكافح آدم للوصول إليها
يعمل الشامبو وK-FAC على تسريع التدريب على التعلم العميق على نطاق واسع من خلال تقريب بنية هسيان
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Second-Order Optimization and Newton Methods quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحسين السياسة النسبية للمجموعة
الأسئلة المتداولة
What is Second-Order Optimization and Newton Methods?
يستخدم التحسين من الدرجة الثانية معلومات الانحناء (مصفوفة هسه للمشتقات الثانية) لاتخاذ خطوات أكثر ذكاءً نحو الحد الأدنى، وليس فقط الميل. يمكن أن تتقارب في تكرارات أقل بشكل كبير من النسب التدرج العادي، ولكن تكلفة انحناء الحوسبة تجعل من الصعب قياسها.
ما هي المعلومات التي تستخدمها طريقة نيوتن ولا تستخدمها طريقة الانحدار التدرجي البسيط؟
تعمل طريقة نيوتن على زيادة التدرج بانحناء من خط هيسن، مما يسمح لها بإعادة قياس الاتجاهات وتقريب الحد الأدنى التربيعي المحلي.
للحصول على هدف تربيعي كامل، ما عدد الخطوات التي تحتاجها طريقة نيوتن للوصول إلى الحد الأدنى؟
في المعادلة التربيعية الدقيقة، يساوي النموذج التربيعي المحلي الدالة الحقيقية، لذا فإن خطوة نيوتن واحدة تقفز مباشرة إلى الحد الأدنى.
لماذا تعتبر طريقة نيوتن الكاملة غير عملية بالنسبة للشبكات العصبية ذات المليارات من المعلمات؟
مع المعلمات N، يحتوي Hessian على إدخالات N-squared وعكسها بمقاييس مثل N-cubed، وهو أمر غير ممكن عند مليارات المعلمات.
ما الذي تفعله الأساليب شبه نيوتن مثل BFGS لتجنب تكلفة هسه؟
يقوم BFGS بتحديث تقدير معكوس Hessian بشكل متكرر باستخدام التغييرات في التدرج بين الخطوات، وتجنب الحساب المباشر.
كيف يقلل L-BFGS الذاكرة مقارنة بـ BFGS؟
يشير الحرف 'L' إلى الذاكرة المحدودة: يحتفظ L-BFGS بعدد قليل من المتجهات الحديثة، مما يقلل التخزين من N-squared إلى مضاعف صغير تقريبًا لـ N.