HƯỚNG DẪN cơ bản

Giảm dần độ dốc ngẫu nhiên với động lượng

Động lượng là một điều chỉnh để giảm độ dốc, tích lũy giá trị trung bình đang chạy của các độ dốc trong quá khứ, cho phép quá trình tối ưu hóa diễn ra nhanh hơn khi vượt qua các thung lũng và làm giảm dao động.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It is one of the most widely used training tricks in deep learning.

Lặn sâu

Giảm độ dốc ngẫu nhiên đơn giản (SGD) cập nhật các tham số bằng cách bước theo hướng đối diện với độ dốc lô nhỏ hiện tại. Trong những cảnh quan có hình dạng như những khe núi dài và hẹp, nó chạy ngoằn ngoèo qua những bức tường dốc trong khi trườn dọc theo sàn nhà thoai thoải. Động lượng, được phổ biến bởi Polyak và sau đó là Rumelhart và các đồng nghiệp, khắc phục điều này bằng cách duy trì một vectơ vận tốc: mỗi bước trộn gradient mới với một phần (hệ số động lượng, thường là 0,9) của vận tốc trước đó. Các hướng gradient nhất quán củng cố và tăng tốc, trong khi các thành phần dao động bị triệt tiêu một phần. Sự tương tự về mặt vật lý là một quả bóng nặng lăn xuống dốc: nó tạo ra tốc độ theo những hướng ổn định và ít bị chệch hướng bởi những va chạm ồn ào, mang lại sự hội tụ nhanh hơn, mượt mà hơn so với SGD thông thường.

Hiểu biết kỹ thuật

Bản cập nhật giữ vận tốc v được cập nhật dưới dạng v = beta * v + gradient, sau đó các tham số di chuyển theo tốc độ học trừ đi lần v. Với hệ số động lượng beta, bước hiệu quả theo hướng nhất quán được khuếch đại gần đúng theo hệ số 1/(1 - beta); ở mức beta = 0,9 tức là khoảng mười lần. Về mặt toán học, đây là đường trung bình động có trọng số theo cấp số nhân của độ dốc, làm giảm tiếng ồn của lô nhỏ trong khi vẫn duy trì hướng đi xuống chủ đạo.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của việc giảm dần độ dốc ngẫu nhiên với động lượng

Động lượng vẫn là nền tảng: các trình tối ưu hóa thích ứng như Adam và các biến thể của nó nhúng ước tính thời điểm đầu tiên theo kiểu động lượng và SGD với động lượng vẫn là đường cơ sở mạnh thường khái quát hóa tốt hơn các phương pháp thích ứng trên các mô hình tầm nhìn lớn. Nghiên cứu tiếp tục lập kế hoạch động lượng, giảm trọng lượng tách rời và sự tương tác của nó với đào tạo hàng loạt rất lớn. Kỳ vọng động lực sẽ tiếp tục là thành phần cốt lõi khi các trình tối ưu hóa phát triển cho các mô hình ngày càng lớn hơn.

Triển khai trong thế giới thực

Đào tạo các mạng tích chập sâu như ResNet, trong đó SGD với động lượng 0,9 là một công thức tiêu chuẩn.

Làm mịn các ước tính độ dốc nhiễu khi sử dụng các lô nhỏ.

Thoát khỏi cao nguyên địa phương nông bằng cách mang vận tốc qua các vùng bằng phẳng.

Đóng vai trò là thuật ngữ động lượng bên trong các trình tối ưu hóa thích ứng như các biến thể Adam và RMSprop.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu nơi hỗ trợ Stochastic gradient Descent with Momentum và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Gradient Descent with Momentum quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Stochastic Gradient Descent with Momentum?

Động lượng là một điều chỉnh để giảm độ dốc, tích lũy giá trị trung bình đang chạy của các độ dốc trong quá khứ, cho phép quá trình tối ưu hóa diễn ra nhanh hơn khi vượt qua các thung lũng và làm giảm dao động. Đây là một trong những thủ thuật huấn luyện được sử dụng rộng rãi nhất trong học sâu.

Thuật ngữ động lượng tích lũy trong quá trình đào tạo là gì?

Động lượng duy trì một vectơ vận tốc là đường trung bình động có trọng số theo cấp số nhân của độ dốc gần đây, làm trơn hướng cập nhật.

Trong một khe núi dài và hẹp, SGD đồng bằng gặp phải vấn đề gì mà đà giúp khắc phục?

Không có động lượng, SGD dao động theo hướng dốc của khe núi. Động lượng triệt tiêu những dao động này và tăng tốc dọc theo đáy thung lũng thoai thoải.

Sự tương tự vật lý nào thường được sử dụng nhất để mô tả động lượng?

Động lượng được ví như một quả bóng nặng có khả năng tạo ra tốc độ theo những hướng nhất quán và chống lại sự lệch hướng do những va chạm ồn ào.

Động lượng khuếch đại bước hiệu quả theo hướng nhất quán khoảng bao nhiêu khi beta = 0,9?

Hệ số khuếch đại xấp xỉ 1/(1 - beta) và 1/(1 - 0,9) = 10, do đó các hướng nhất quán được tăng tốc lên khoảng 10 lần.

Trình tối ưu hóa hiện đại nào kết hợp ước tính thời điểm đầu tiên theo kiểu động lượng?

Adam kết hợp ước tính độ dốc thời điểm đầu tiên (trung bình) giống như động lượng với ước tính thời điểm thứ hai (phương sai) để chia tỷ lệ thích ứng.