Luật thu nhỏ chinchilla
Luật chia tỷ lệ Chinchilla, từ DeepMind vào năm 2022, cho thấy rằng hầu hết các mô hình ngôn ngữ lớn đều chưa được đào tạo kỹ càng: đối với ngân sách tính toán cố định, bạn nên chia tỷ lệ kích thước mô hình và dữ liệu đào tạo theo tỷ lệ gần bằng nhau.
Tổng quan
Điều này quan trọng vì nó đã xác định lại ý nghĩa của kích thước mô hình 'tối ưu' và định hình lại cách các phòng thí nghiệm chi tiêu điện toán.
Lặn sâu
Trước Chinchilla, xu hướng là xây dựng các mô hình ngày càng lớn hơn (như GPT-3 tham số 175B) trong khi đào tạo trên lượng dữ liệu tương đối khiêm tốn. DeepMind đã đào tạo hơn 400 mô hình trên nhiều quy mô và ngân sách dữ liệu, sau đó điều chỉnh các đường cong dự đoán tổn thất dưới dạng hàm của các tham số và mã thông báo trong ngân sách điện toán cố định (FLOP). Phát hiện của họ: các tham số và mã thông báo đào tạo phải mở rộng cùng nhau, tỷ lệ gần đúng là 1 trên 1, ngụ ý khoảng 20 mã thông báo dữ liệu đào tạo cho mỗi tham số. Để chứng minh điều đó, họ đã đào tạo Chinchilla, một mô hình tham số 70B trên 1,4 nghìn tỷ mã thông báo, vượt trội hơn nhiều so với Gopher tham số 280B lớn hơn nhiều mặc dù sử dụng cùng một tính toán vì nó được đào tạo trên nhiều dữ liệu hơn.
Hiểu biết kỹ thuật
Các luật này xuất phát từ việc điều chỉnh hàm mất tham số L(N, D) trong đó N là tham số và D là mã thông báo, bao gồm các thuật ngữ mất mát không thể giảm bớt, kích thước mô hình và kích thước dữ liệu. Việc giảm thiểu tổn thất do ràng buộc tính toán (tính toán gần như tỷ lệ với N nhân D) mang lại kết quả là cả N và D tối ưu đều tăng dưới dạng lũy thừa tính toán với số mũ tương tự nhau, do đó tỷ lệ tính toán-tối ưu duy trì ở mức gần 20 mã thông báo cho mỗi tham số.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của Luật Thu nhỏ Chinchilla
Chinchilla đã chuyển lĩnh vực từ việc theo đuổi số lượng tham số sang mô hình cung cấp dữ liệu chất lượng cao hơn nhiều và các mô hình hiện đại thường đào tạo vượt qua điểm 'tối ưu tính toán' để giúp suy luận rẻ hơn. Khi văn bản web chất lượng cao trở nên khan hiếm, sự chú ý sẽ chuyển sang quản lý dữ liệu, dữ liệu tổng hợp, nhiều kỷ nguyên và dữ liệu đa phương thức để tiếp tục mở rộng quy mô. Bài học cốt lõi vẫn tồn tại: dữ liệu và tham số phải được cân bằng và chỉ kích thước thô không còn là mục tiêu nữa.
Triển khai trong thế giới thực
Chinchilla tham số 70B của DeepMind đánh bại Gopher 280B về điểm chuẩn bằng cách sử dụng tính toán ngang bằng, bằng cách đào tạo trên nhiều dữ liệu hơn
Hướng dẫn các nhóm lập ngân sách khoảng 20 mã thông báo đào tạo cho mỗi tham số khi lập kế hoạch mô hình từ đầu
Chứng minh các mô hình nhỏ hơn, giàu dữ liệu như LLaMA sẽ rẻ hơn khi chạy tại thời điểm suy luận
Ước tính liệu một mô hình được lên kế hoạch có 'được đào tạo chưa đủ' hay không và sẽ được hưởng lợi nhiều hơn từ dữ liệu bổ sung hơn là các tham số bổ sung
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Luật mở rộng cho mạng lưới thần kinh
Câu hỏi thường gặp
Luật thu nhỏ chinchilla là gì?
Luật chia tỷ lệ Chinchilla, từ DeepMind vào năm 2022, cho thấy rằng hầu hết các mô hình ngôn ngữ lớn đều chưa được đào tạo kỹ càng: đối với ngân sách tính toán cố định, bạn nên chia tỷ lệ kích thước mô hình và dữ liệu đào tạo theo tỷ lệ gần bằng nhau. Điều này quan trọng vì nó đã xác định lại ý nghĩa của kích thước mô hình 'tối ưu' và định hình lại cách các phòng thí nghiệm chi tiêu điện toán.
Phát hiện chính của quy luật chia tỷ lệ Chinchilla là gì?
Chinchilla đã chỉ ra rằng đối với ngân sách điện toán cố định, các tham số và mã thông báo đào tạo sẽ tăng trưởng cùng nhau, khoảng 1 trên 1.
Khoảng bao nhiêu mã thông báo đào tạo cho mỗi tham số mà Chinchilla đề xuất là tối ưu về mặt điện toán?
Tỷ lệ tính toán tối ưu tính ra khoảng 20 mã thông báo huấn luyện cho mỗi tham số mô hình.
Mô hình nào Chinchilla vượt trội hơn dù nhỏ hơn nhiều?
Chinchilla tham số 70B đánh bại Gopher tham số 280B của DeepMind bằng cách sử dụng cùng một phép tính vì nó được đào tạo trên nhiều dữ liệu hơn.
Chinchilla đã ám chỉ điều gì về những mẫu xe như GPT-3 vào thời điểm đó?
Nhiều mô hình lớn trong thời đại đó chưa được đào tạo bài bản, có nghĩa là chúng sẽ hoạt động tốt hơn với nhiều dữ liệu hơn cho số lượng tham số của chúng.
Đại khái tính toán được tính gần đúng như thế nào trong phân tích Chinchilla?
Tính toán huấn luyện (FLOP) xấp xỉ tỷ lệ với số lượng tham số nhân với số lượng mã thông báo huấn luyện.