PANDUAN Teknis

Optimasi Orde Kedua dan Metode Newton

Optimalisasi orde kedua menggunakan informasi kelengkungan (matriks Hessian dari turunan kedua) untuk mengambil langkah yang lebih cerdas menuju nilai minimum, bukan hanya kemiringannya saja.

2 min readTerakhir diperbarui

Ikhtisar

It can converge in dramatically fewer iterations than plain gradient descent, but the cost of computing curvature makes it tricky to scale.

Menyelam Lebih Dalam

Penurunan gradien hanya mengetahui kemiringan pada titik Anda saat ini, jadi ia memilih ukuran langkah yang tetap atau disesuaikan dengan tangan dan berharap yang terbaik. Metode Newton lebih jauh lagi: metode ini juga melihat perubahan kemiringan (kelengkungan), yang ditangkap oleh matriks Hessian, yang merupakan matriks dari semua turunan parsial kedua. Pembaruan ini mengalikan kebalikan Hessian dengan gradien, yang secara otomatis mengubah skala setiap arah dan mendekati nilai minimum perkiraan kuadrat lokal. Untuk mangkuk kuadrat sempurna, metode Newton mencapai dasar dalam satu langkah. Hasil tangkapannya sangat brutal: model dengan N parameter memiliki N-by-N Hessian, jadi penyimpanan dan pembalikkannya membutuhkan memori N-kuadrat dan komputasi N-kuadrat. Untuk jaringan dengan miliaran parameter, hal ini tidak mungkin dilakukan, itulah sebabnya praktisi menggunakan perkiraan yang lebih murah.

Wawasan Teknis

Pembaruan inti Newton adalah x_new = x - H_inverse dikalikan gradien, di mana H adalah Hessian. Metode Quasi-Newton seperti BFGS dan L-BFGS menghindari komputasi H secara langsung dengan membuat perkiraan invers dari perbedaan gradien yang berurutan. L-BFGS hanya menyimpan beberapa gradien dan vektor langkah terakhir, bukan seluruh matriks, memotong memori dari N-kuadrat menjadi kelipatan kecil N sambil mempertahankan sebagian besar percepatan konvergensi.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Optimasi Orde Kedua dan Metode Newton

Untuk jaringan saraf raksasa, metode tingkat kedua yang lengkap tetap tidak praktis, tetapi perkiraan mulai diterapkan. Pengoptimal seperti K-FAC dan Shampoo memperkirakan kelengkungan menggunakan struktur blok-diagonal atau faktor Kronecker, dan metode yang lebih baru seperti Sophia dan Muon menggunakan perkiraan kelengkungan yang murah untuk mempercepat pra-pelatihan model bahasa besar. Harapkan upaya berkelanjutan untuk menangkap sinyal kelengkungan yang berguna dengan biaya mendekati orde pertama, mempersempit kesenjangan antara langkah Adam dan langkah Newton yang sebenarnya.

Implementasi Dunia Nyata

L-BFGS menyesuaikan regresi logistik dan model cembung lainnya di scikit-learn, yang sering kali mengalahkan penurunan gradien biasa pada kumpulan data kecil hingga menengah

Penyesuaian bundel dalam rekonstruksi 3D dan SLAM, di mana Gauss-Newton dan Levenberg-Marquardt menyempurnakan pose kamera dan posisi titik

Melatih jaringan saraf kecil berdasarkan informasi fisika tempat L-BFGS mencapai presisi yang sulit dicapai Adam

Shampoo dan K-FAC mempercepat pelatihan pembelajaran mendalam berskala besar dengan memperkirakan struktur Hessian

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Second-Order Optimization and Newton Methods quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Optimasi Kebijakan Relatif Grup

Pertanyaan yang sering diajukan

What is Second-Order Optimization and Newton Methods?

Optimalisasi orde kedua menggunakan informasi kelengkungan (matriks Hessian dari turunan kedua) untuk mengambil langkah yang lebih cerdas menuju nilai minimum, bukan hanya kemiringannya saja. Hal ini dapat menyatu dalam iterasi yang jauh lebih sedikit dibandingkan dengan penurunan gradien biasa, namun biaya komputasi kelengkungan membuatnya sulit untuk diukur.

Informasi apa yang tidak digunakan oleh metode Newton yang tidak dimiliki oleh penurunan gradien biasa?

Metode Newton menambah gradien dengan kelengkungan dari Hessian, memungkinkannya mengubah skala arah dan memperkirakan minimum kuadrat lokal.

Untuk mencapai tujuan kuadrat sempurna, berapa langkah yang diperlukan metode Newton untuk mencapai titik minimum?

Pada kuadrat eksak, model kuadrat lokal sama dengan fungsi sebenarnya, sehingga satu langkah Newton langsung mencapai nilai minimum.

Mengapa metode Newton penuh tidak praktis untuk jaringan saraf dengan miliaran parameter?

Dengan N parameter, Hessian memiliki entri N-kuadrat dan membalikkan skalanya seperti N-kuadrat, yang tidak mungkin dilakukan pada miliaran parameter.

Apa yang dilakukan metode kuasi-Newton seperti BFGS untuk menghindari biaya Hessian?

BFGS memperbarui perkiraan invers Hessian secara berulang menggunakan perubahan gradien antar langkah, menghindari penghitungan langsung.

Bagaimana L-BFGS mengurangi memori dibandingkan dengan BFGS?

'L' adalah singkatan dari memori terbatas: L-BFGS hanya menyimpan segelintir vektor terkini, mengurangi penyimpanan dari N-kuadrat menjadi kelipatan kecil dari N.