Νόμοι για την κλιμάκωση των τσιντσιλά
Οι νόμοι κλιμάκωσης Chinchilla, από το DeepMind το 2022, έδειξαν ότι τα περισσότερα μοντέλα μεγάλων γλωσσών δεν ήταν καλά εκπαιδευμένα: για έναν σταθερό υπολογιστικό προϋπολογισμό, θα πρέπει να κλιμακώσετε το μέγεθος του μοντέλου και τα δεδομένα εκπαίδευσης περίπου σε ίση αναλογία.
Επισκόπηση
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Βαθιά κατάδυση
Πριν από το Chinchilla, η τάση ήταν να κατασκευάζονται ολοένα μεγαλύτερα μοντέλα (όπως το GPT-3 με παράμετρο 175B) ενώ εκπαιδεύονταν σε σχετικά μέτριες ποσότητες δεδομένων. Η DeepMind εκπαίδευσε πάνω από 400 μοντέλα σε πολλά μεγέθη και προϋπολογισμούς δεδομένων και, στη συνέχεια, προσάρμοσε καμπύλες που προβλέπουν απώλεια ως συνάρτηση παραμέτρων και διακριτικών βάσει προϋπολογισμού σταθερού υπολογισμού (FLOP). Τα ευρήματά τους: οι παράμετροι και τα κουπόνια εκπαίδευσης θα πρέπει να κλιμακώνονται μαζί, περίπου σε αναλογία 1 προς 1, υποδηλώνοντας περίπου 20 μάρκες δεδομένων εκπαίδευσης ανά παράμετρο. Για να το αποδείξουν, εκπαίδευσαν το Chinchilla, ένα μοντέλο παραμέτρων 70B σε 1,4 τρισεκατομμύρια μάρκες, το οποίο ξεπέρασε τις επιδόσεις του πολύ μεγαλύτερου Gopher με παραμέτρους 280B, παρά τη χρήση του ίδιου υπολογισμού, επειδή εκπαιδεύτηκε σε πολύ περισσότερα δεδομένα.
Τεχνική διορατικότητα
Οι νόμοι προέρχονται από την προσαρμογή μιας παραμετρικής συνάρτησης απώλειας L(N, D) όπου το N είναι παράμετροι και το D είναι διακριτικά, συμπεριλαμβανομένων των όρων μη αναγώγιμης απώλειας, μεγέθους μοντέλου και μεγέθους δεδομένων. Η ελαχιστοποίηση της απώλειας που υπόκειται σε έναν περιορισμό υπολογισμού (ο υπολογισμός είναι χονδρικά ανάλογος με το N επί το D) αποδίδει το αποτέλεσμα ότι τα βέλτιστα N και D αυξάνονται και τα δύο ως υπολογιστική ισχύς με παρόμοιους εκθέτες, οπότε ο λόγος υπολογισμού-βέλτιστου παραμένει κοντά στα 20 tokens ανά παράμετρο.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
Το μέλλον των νόμων για την κλιμάκωση του τσιντσιλά
Το Chinchilla μετατόπισε το πεδίο από την καταδίωξη μετρήσεων παραμέτρων στην τροφοδοσία μοντέλων με πολύ περισσότερα δεδομένα υψηλής ποιότητας και τα σύγχρονα μοντέλα συχνά περνούν πολύ καλά το σημείο «υπολογιστικού βέλτιστου» για να κάνουν τα συμπεράσματα φθηνότερα. Καθώς το κείμενο ιστού υψηλής ποιότητας γίνεται σπάνιο, η προσοχή στρέφεται στην επιμέλεια δεδομένων, τα συνθετικά δεδομένα, τις πολλαπλές εποχές και τα πολυτροπικά δεδομένα για να συνεχιστεί η κλιμάκωση. Το βασικό μάθημα διαρκεί: τα δεδομένα και οι παράμετροι πρέπει να είναι ισορροπημένα και το ακατέργαστο μέγεθος δεν είναι πλέον ο στόχος.
Υλοποίηση σε πραγματικό κόσμο
Το Chinchilla παραμέτρων 70B της DeepMind κερδίζει το Gopher 280B στα σημεία αναφοράς χρησιμοποιώντας ίσους υπολογισμούς, εκπαιδεύοντας σε πολύ περισσότερα δεδομένα
Καθοδήγηση των ομάδων στον προϋπολογισμό περίπου 20 κουπονιών εκπαίδευσης ανά παράμετρο κατά τον σχεδιασμό ενός μοντέλου από την αρχή
Δικαιολογώντας μικρότερα, πλούσια σε δεδομένα μοντέλα όπως το LLaMA που είναι φθηνότερο να εκτελεστούν σε χρόνο συμπερασμάτων
Εκτίμηση εάν ένα σχεδιασμένο μοντέλο είναι «υποεκπαιδευμένο» και θα ωφεληθεί περισσότερο από επιπλέον δεδομένα παρά από επιπλέον παραμέτρους
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Νόμοι κλιμάκωσης για νευρωνικά δίκτυα
Συχνές ερωτήσεις
What is Chinchilla Scaling Laws?
Οι νόμοι κλιμάκωσης Chinchilla, από το DeepMind το 2022, έδειξαν ότι τα περισσότερα μοντέλα μεγάλων γλωσσών δεν ήταν καλά εκπαιδευμένα: για έναν σταθερό υπολογιστικό προϋπολογισμό, θα πρέπει να κλιμακώσετε το μέγεθος του μοντέλου και τα δεδομένα εκπαίδευσης περίπου σε ίση αναλογία. Έχει σημασία γιατί επαναπροσδιόρισε τι σημαίνει «βέλτιστο» μέγεθος μοντέλου και αναμόρφωσε τον τρόπο με τον οποίο τα εργαστήρια ξοδεύουν τους υπολογισμούς.
Ποιο ήταν το κεντρικό εύρημα των νόμων για την κλιμάκωση του Chinchilla;
Ο Chinchilla έδειξε ότι για έναν σταθερό υπολογιστικό προϋπολογισμό, οι παράμετροι και τα κουπόνια εκπαίδευσης θα πρέπει να αυξάνονται μαζί, περίπου 1 προς 1.
Πόσα περίπου κουπόνια εκπαίδευσης ανά παράμετρο πρότεινε ο Chinchilla ότι είναι υπολογιστικά βέλτιστα;
Ο υπολογιστικός-βέλτιστος λόγος λειτουργεί σε περίπου 20 κουπόνια εκπαίδευσης για κάθε παράμετρο μοντέλου.
Ποιο μοντέλο ξεπέρασε το Chinchilla παρόλο που ήταν πολύ μικρότερο;
Το Chinchilla με παραμέτρους 70 Β κέρδισε το Gopher παραμέτρων 280 Β της DeepMind χρησιμοποιώντας τον ίδιο υπολογισμό, επειδή εκπαιδεύτηκε σε πολύ περισσότερα δεδομένα.
Τι υπονοούσε η Chinchilla για μοντέλα όπως το GPT-3 εκείνη την εποχή;
Πολλά μεγάλα μοντέλα εκείνης της εποχής ήταν υποεκπαιδευμένα, που σημαίνει ότι θα είχαν καλύτερη απόδοση με πολύ περισσότερα δεδομένα για τον αριθμό των παραμέτρων τους.
Πώς περίπου προσεγγίστηκε ο υπολογισμός στην ανάλυση Chinchilla;
Το Training Compute (FLOPs) είναι περίπου ανάλογο με τον αριθμό των παραμέτρων πολλαπλασιαζόμενο με τον αριθμό των κουπονιών εκπαίδευσης.