Tinh chỉnh tự phát
Tinh chỉnh tự phát sẽ cải thiện một mô hình bằng cách cho nó cạnh tranh hoặc học hỏi từ các kết quả đầu ra trong quá khứ của chính nó, tạo ra tín hiệu đào tạo của riêng nó.
Tổng quan
It matters because it can push performance beyond the supervised data using little or no extra human labeling.
Lặn sâu
Tự chơi có nguồn gốc sâu xa từ trò chơi AI: AlphaGo Zero và AlphaZero đạt đến lối chơi siêu phàm hoàn toàn bằng cách chơi hàng triệu trò chơi với chính họ mà không có hồ sơ trò chơi của con người. Tinh thần tương tự bây giờ xuất hiện trong việc tinh chỉnh mô hình ngôn ngữ. Trong SPIN (Tự điều chỉnh), mô hình hiện tại tạo ra phản hồi cho các lời nhắc và quá trình đào tạo sẽ thúc đẩy mô hình phân biệt các câu trả lời do chính nó tạo ra với các câu trả lời ban đầu do con người viết ra, coi bản thân nó vừa là người chơi vừa là đối thủ. Qua các lần lặp lại liên tiếp, 'đối thủ' (điểm kiểm tra trước đó) trở nên mạnh hơn, do đó mô hình phải tiếp tục cải tiến, dần dần thu hẹp khoảng cách với phân bổ mục tiêu. Điểm hấp dẫn lớn là tính hiệu quả của dữ liệu: một tập dữ liệu được giám sát cố định có thể được thu thập để đạt được nhiều lợi ích hơn mà không cần thu thập các minh chứng hoặc sở thích mới của con người.
Hiểu biết kỹ thuật
Tinh chỉnh khung SPIN như một trò chơi hai người chơi với kiểu thua DPO: mô hình được đào tạo để chỉ định khả năng phản hồi tham chiếu của con người cao hơn so với phản hồi tự tạo của chính nó từ lần lặp trước. Bởi vì điểm kiểm tra trước đó đưa ra những điểm tiêu cực nên độ khó sẽ tự động tăng lên khi mô hình được cải thiện. Trong các hệ thống chơi trò chơi, tính năng tự chơi được kết hợp với tìm kiếm (ví dụ: MCTS) và mạng giá trị, tạo ra một chương trình giảng dạy vô tận về những đối thủ ngày càng khó hơn mà không cần dữ liệu bên ngoài.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của việc tinh chỉnh tự chơi
Tự chơi là ứng cử viên hàng đầu để phá vỡ bức tường dữ liệu, vì nó tạo ra chương trình giảng dạy của riêng mình thay vì phụ thuộc vào nhãn hiệu khan hiếm của con người. Mong đợi sự tăng trưởng trong các lĩnh vực có thể kiểm chứng như toán học, mã và chứng minh định lý, trong đó trình kiểm tra tự động chấm điểm các nỗ lực tự tạo. Rủi ro bao gồm hack phần thưởng và sụp đổ mô hình do đào tạo với quá nhiều đầu ra tổng hợp, vì vậy các hệ thống trong tương lai có thể sẽ kết hợp tính năng tự phát với tín hiệu nối đất, trình xác minh và phản hồi định kỳ của con người hoặc thế giới thực.
Triển khai trong thế giới thực
AlphaGo Zero và AlphaZero đạt đến trình độ cờ vây, cờ vua và shogi siêu phàm hoàn toàn thông qua việc tự chơi mà không có trò chơi của con người
SPIN tăng điểm chuẩn của LLM bằng cách phân biệt lặp đi lặp lại kết quả đầu ra của chính nó với các câu trả lời tham khảo của con người
Các mô hình toán học và mã hóa tạo ra các nỗ lực giải pháp, sau đó đào tạo về những giải pháp được xác minh bằng trình kiểm tra tự động hoặc bài kiểm tra đơn vị
Các tác nhân đàm phán và đối thoại cải thiện chiến lược bằng cách liên tục chơi cả hai phía của cuộc trò chuyện để chống lại chính họ
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu trong đó tính năng Tự tinh chỉnh sẽ giúp ích và các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Play Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tinh chỉnh
Câu hỏi thường gặp
What is Self-Play Fine-Tuning?
Tinh chỉnh tự phát sẽ cải thiện một mô hình bằng cách cho nó cạnh tranh hoặc học hỏi từ các kết quả đầu ra trong quá khứ của chính nó, tạo ra tín hiệu đào tạo của riêng nó. Điều này quan trọng vì nó có thể đẩy hiệu suất vượt xa dữ liệu được giám sát mà sử dụng ít hoặc không cần gắn nhãn thêm cho con người.
Hệ thống nổi tiếng nào đã đạt đến trình độ chơi cờ vây siêu phàm chỉ bằng cách tự chơi và không có hồ sơ trò chơi của con người?
AlphaGo Zero học hỏi hoàn toàn từ các trò chơi mà nó tự chơi với chính mình, bắt đầu từ trò chơi ngẫu nhiên và vượt qua các phiên bản trước đó được đào tạo về trò chơi của con người.
Trong SPIN, vai trò của “đối thủ” mà người mẫu phải đánh bại là gì?
SPIN coi việc tinh chỉnh như một trò chơi tự chơi trong đó các đầu ra tự tạo của lần lặp trước đóng vai trò là các điểm âm mà mô hình học cách vượt qua.
Lợi thế hiệu quả dữ liệu chính của việc tinh chỉnh tự phát là gì?
Tính năng tự phát tạo ra tín hiệu huấn luyện riêng nên một nhóm được giám sát cố định có thể mang lại những cải tiến hơn nữa mà không cần thu thập các bản trình diễn mới.
Trong mục tiêu đào tạo của SPIN, mô hình được thúc đẩy làm gì?
SPIN sử dụng sự mất mát kiểu DPO để thưởng cho việc phân biệt các câu trả lời tham chiếu của con người (tích cực) với các câu trả lời tự tạo trước đó của mô hình (phủ định).
Tại sao độ khó trong việc tinh chỉnh tính năng tự phát lại tự động tăng lên qua các lần lặp lại?
Vì những điểm tiêu cực của mỗi lần lặp lại đều xuất phát từ một mô hình mạnh hơn trước đó nên mô hình này phải đối mặt với thách thức ngày càng khó khăn hơn nếu không có thiết kế chương trình giảng dạy thủ công.