HƯỚNG DẪN cơ bản

Luật mở rộng cho mạng lưới thần kinh

Quy luật chia tỷ lệ là các công thức thực nghiệm cho thấy rằng tổn thất của mạng thần kinh có thể dự đoán được khi bạn tăng kích thước mô hình, kích thước tập dữ liệu và tính toán.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Chúng quan trọng vì chúng cho phép các nhà nghiên cứu dự đoán hiệu suất trước khi chi hàng triệu USD để đào tạo một mô hình khổng lồ.

Lặn sâu

Luật mở rộng quy mô, được phổ biến bởi bài báo năm 2020 của OpenAI bởi Kaplan và các đồng nghiệp, đã phát hiện ra rằng độ mất kiểm tra giảm theo luật lũy thừa trơn theo ba đại lượng: số lượng tham số (N), mã thông báo đào tạo (D) và tổng điện toán (C). Được vẽ trên các trục log-log, tổn thất so với từng yếu tố tạo thành một đường gần như thẳng kéo dài nhiều bậc độ lớn. Các mối quan hệ có dạng Mất ≈ a + b·X^(-c), trong đó X là hệ số tỷ lệ. Điều quan trọng là, nghiên cứu ban đầu đề xuất kích thước mô hình quan trọng hơn dữ liệu, thúc đẩy một cuộc chạy đua hướng tới các mô hình ngày càng lớn hơn như 175 tỷ thông số của GPT-3. Quy luật mở rộng quy mô đã biến việc học sâu từ phỏng đoán thành một môn kỹ thuật có thể dự đoán được, cho phép các nhóm dự đoán kết quả quy mô lớn từ các thử nghiệm nhỏ, rẻ tiền.

Hiểu biết kỹ thuật

Dạng luật lũy thừa có nghĩa là mỗi lần tăng nhân cố định trong tính toán sẽ mang lại mức giảm tổn thất cộng gần như không đổi. Sự mất mát được đo bằng nats hoặc bit trên mỗi token của entropy chéo. Bởi vì số mũ c nhỏ (thường khoảng 0,05-0,1), mức tăng là có thật nhưng giảm dần: tính toán nhân đôi giúp ít hơn nhiều so với nhân đôi đầu tiên. Điều quan trọng là, các định luật này mô tả sự mất mát không thể giảm được, trong đó một số hạng không đổi thể hiện entropy nội tại của dữ liệu mà không mô hình nào có thể đánh bại được.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của luật mở rộng quy mô cho mạng lưới thần kinh

Các nhà nghiên cứu đang mở rộng quy luật mở rộng quy mô vượt ra ngoài việc mất dữ liệu trước khi đào tạo đến độ chính xác của nhiệm vụ xuôi dòng, mô hình đa phương thức và tính toán thời gian suy luận, trong đó các mô hình lý luận dành nhiều suy nghĩ hơn cho mỗi truy vấn. Khi văn bản chất lượng cao trở nên khan hiếm, sự chú ý sẽ chuyển sang chất lượng dữ liệu, dữ liệu tổng hợp và quy luật chia tỷ lệ dữ liệu lặp lại. Một số người cho rằng việc mở rộng quy mô thô đang chạm tới các giới hạn thực tế về tiền bạc, năng lượng và văn bản có sẵn, đẩy lĩnh vực này hướng tới hiệu quả thuật toán và kiến ​​trúc mới thay vì chỉ đơn giản là xây dựng lớn hơn.

Triển khai trong thế giới thực

Dự báo tổn thất cuối cùng của mô hình 70 tỷ tham số theo kế hoạch từ một loạt lần chạy thử nghiệm nhỏ 100 triệu tham số trước khi cam kết ngân sách GPU.

Quyết định thu thập bao nhiêu nghìn tỷ mã thông báo để ngân sách điện toán cố định không bị lãng phí đối với mô hình chưa được đào tạo bài bản.

So sánh hai kiến ​​trúc một cách rẻ tiền bằng cách điều chỉnh các đường cong tỷ lệ của chúng ở quy mô nhỏ thay vì huấn luyện cả hai ở kích thước đầy đủ.

Đặt kỳ vọng về độ chính xác thực tế cho các nhà đầu tư hoặc người đánh giá bằng cách ngoại suy đường cong tổn thất đến mức tính toán mục tiêu.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu giúp Luật mở rộng quy mô cho mạng thần kinh và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mạng thần kinh tích chập

Câu hỏi thường gặp

Luật mở rộng quy mô cho mạng lưới thần kinh là gì?

Quy luật chia tỷ lệ là các công thức thực nghiệm cho thấy rằng tổn thất của mạng thần kinh có thể dự đoán được khi bạn tăng kích thước mô hình, kích thước tập dữ liệu và tính toán. Chúng quan trọng vì chúng cho phép các nhà nghiên cứu dự đoán hiệu suất trước khi chi hàng triệu USD để đào tạo một mô hình khổng lồ.

Trên trục log-log, mất kiểm tra thường hoạt động như thế nào khi tính toán tăng theo luật chia tỷ lệ?

Tổn thất so với tính toán, kích thước mô hình hoặc dữ liệu tạo thành một đường gần như thẳng trên biểu đồ log-log, dấu hiệu của mối quan hệ lũy thừa.

Ba đại lượng nào mà định luật tỉ lệ ban đầu liên quan đến sự mất mát?

Kaplan và cộng sự. đã nghiên cứu sự mất mát như một định luật lũy thừa về số lượng tham số (N), mã thông báo huấn luyện (D) và tổng số điện toán (C).

Tại sao luật mở rộng quy mô lại có giá trị đối với các phòng thí nghiệm AI?

Bằng cách điều chỉnh các đường cong ở quy mô nhỏ, các nhóm dự đoán hiệu suất của mô hình khổng lồ trước khi chi số tiền lớn.

Số hạng không đổi (không thể rút gọn) trong công thức mất quy luật tỉ lệ thể hiện điều gì?

Sự mất mát có phần có thể rút gọn, co lại theo tỷ lệ cộng với mức sàn không thể rút gọn được thiết lập bởi tính ngẫu nhiên vốn có của dữ liệu.

Tại sao mức tăng quy mô được mô tả là 'giảm dần'?

Bởi vì số mũ của định luật lũy thừa nhỏ nên phép tính nhân bằng nhau sẽ tăng hiệu suất giảm tổn thất tuyệt đối nhỏ hơn một cách đều đặn.