ΟΔΗΓΟΣ Βασικών Αρχών

Τσιντσιλά Υπολογιστική Βέλτιστη Εκπαίδευση

Το Chinchilla είναι ένα εύρημα της DeepMind του 2022 ότι τα περισσότερα μοντέλα μεγάλων γλωσσών ήταν κακώς εκπαιδευμένα: για έναν σταθερό υπολογιστικό προϋπολογισμό θα πρέπει να κλιμακώνετε τις παραμέτρους και τα δεδομένα περίπου εξίσου, όχι απλώς να δημιουργείτε ένα μεγαλύτερο μοντέλο.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Αναμόρφωσε τον τρόπο με τον οποίο ο κλάδος εξισορροπεί το μέγεθος του μοντέλου με τα δεδομένα εκπαίδευσης.

Βαθιά κατάδυση

Το χαρτί Chinchilla της DeepMind επανεξέτασε την κλιμάκωση και εκπαίδευσε πάνω από 400 μοντέλα για να βρει τη βέλτιστη υπολογιστική ισορροπία. Ο εμπειρικός κανόνας της επικεφαλίδας: το μέγεθος του μοντέλου και τα κουπόνια εκπαίδευσης θα πρέπει να αυξάνονται ολοσχερώς, περίπου 20 μάρκες εκπαίδευσης ανά παράμετρο. Για να το αποδείξουν, εκπαίδευσαν το Chinchilla, ένα μοντέλο 70 δισεκατομμυρίων παραμέτρων σε 1,4 τρισεκατομμύρια μάρκες, χρησιμοποιώντας τον ίδιο υπολογισμό με τον Gopher των 280 δισεκατομμυρίων παραμέτρων που εκπαιδεύτηκε σε πολύ λιγότερα token. Το Chinchilla, παρόλο που ήταν τέσσερις φορές μικρότερο, ξεπέρασε τα Gopher, GPT-3 και άλλους γίγαντες σχεδόν σε κάθε σημείο αναφοράς. Το μάθημα ανέτρεψε το προηγούμενο OpenAI συμπέρασμα ότι ευνοούσε το μέγεθος έναντι των δεδομένων, δείχνοντας ότι πολλά μοντέλα ναυαρχίδα αφήνουν την απόδοση στο τραπέζι επειδή ήταν πολύ μεγάλα και υπερβολικά λιγοστά για δεδομένα.

Τεχνική διορατικότητα

Απώλεια προσαρμογής τσιντσιλά ως L(N,D) = E + A·N^(-α) + B·D^(-β), με α και β και τα δύο κοντά στο 0,34, που σημαίνει ότι οι παράμετροι και τα δεδομένα συμβάλλουν σχεδόν συμμετρικά. Η βελτιστοποίηση αυτού υπό έναν σταθερό υπολογιστικό περιορισμό (υπολογισμός ≈ 6·N·D για μετασχηματιστές) αποδίδει το αποτέλεσμα ίσης κλίμακας. Ένα μικρότερο, πλούσιο σε δεδομένα μοντέλο είναι επίσης φθηνότερο στην εκτέλεση συμπερασμάτων, επομένως το πλεονέκτημά του συνδυάζεται στην ανάπτυξη, όχι μόνο στην εκπαίδευση.

Στρατηγικός αντίκτυπος

Σαφέστερες αποφάσεις

Σας βοηθά να διαχωρίσετε σαφείς τεχνικούς ισχυρισμούς από τη γλώσσα μάρκετινγκ.

Κόστος και προϋπολογισμός

Μπορείτε να κάνετε καλύτερες ερωτήσεις εφαρμογής προτού ξοδέψετε χρήματα ή χρόνο.

Ομάδα και ροή εργασίας

Οι ομάδες με κοινή κατανόηση λαμβάνουν καλύτερες αποφάσεις για προϊόντα, πολιτικές και μάθηση.

Το μέλλον της υπολογιστικής εκπαίδευσης τσιντσιλά

Τα σύγχρονα μοντέλα όπως το Llama 3 ξεπερνούν σκοπίμως την αναλογία 20 μάρκες ανά παράμετρο του Chinchilla, εκπαιδεύοντας μικρά μοντέλα σε τρισεκατομμύρια μάρκες για να κάνουν τα συμπεράσματα φθηνά, αποδεχόμενοι υπολογισμούς εκπαίδευσης που δεν είναι βέλτιστοι. Καθώς τα καλά δεδομένα σπανίζουν, αυξάνεται το ενδιαφέρον για επαναλαμβανόμενες εποχές, συνθετικά δεδομένα και φιλτράρισμα ποιότητας. Το τσιντσιλά παραμένει το σημείο αναφοράς, αλλά το βέλτιστο εξαρτάται όλο και περισσότερο από το κόστος συμπερασμάτων διάρκειας ζωής, όχι μόνο από τον προϋπολογισμό της εφάπαξ εκπαίδευσης.

Υλοποίηση σε πραγματικό κόσμο

Επιλέγοντας να εκπαιδεύσετε ένα μοντέλο 7 δισεκατομμυρίων παραμέτρων σε 2 τρισεκατομμύρια μάρκες αντί για ένα μοντέλο 30 δισεκατομμυρίων με πολύ λίγα δεδομένα για τον ίδιο προϋπολογισμό.

Υπολογίζοντας ότι ένα μοντέλο 10 δισεκατομμυρίων παραμέτρων θέλει περίπου 200 δισεκατομμύρια μάρκες για να φτάσει στο βέλτιστο για υπολογισμό γλυκό σημείο.

Δικαιολογώντας ένα μικρότερο αναπτυγμένο μοντέλο για να μειώσει το κόστος συμπερασμάτων ανά ερώτημα ενώ ταυτίζεται με την ποιότητα ενός μεγαλύτερου αντιπάλου.

Έλεγχος ενός υπάρχοντος μοντέλου και συμπέρασμα ότι ήταν υποεκπαιδευμένο, και στη συνέχεια προγραμματισμός μεγαλύτερης διάρκειας εκπαίδευσης αντί για αύξηση παραμέτρων.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Διαφορετικές ομάδες μπορεί να χρησιμοποιούν τον ίδιο όρο με διαφορετικό τρόπο, επομένως ορίστε το πεδίο εφαρμογής νωρίς.

Τα σημεία αναφοράς μπορεί να φαίνονται ισχυρά ενώ η απόδοση στον πραγματικό κόσμο είναι άνιση.

Η αγνόηση της ποιότητας των δεδομένων και των σχεδίων αξιολόγησης δημιουργεί συχνά εύθραυστα αποτελέσματα.

Οδικός Χάρτης Εφαρμογής

1

Ξεκινήστε με έναν ορισμό σε απλή γλώσσα του αποτελέσματος που χρειάζεστε.

2

Επιλέξτε μία μέτρηση επιτυχίας και μία συνθήκη αποτυχίας πριν από τη δοκιμή.

3

Εκτελέστε ένα μικρό πιλότο με αντιπροσωπευτικά δεδομένα, όχι ένα εκλεπτυσμένο σετ επίδειξης.

4

Τεκμηριώστε πού βοηθά το Chinchilla Compute-Optimal Training και πού είναι καλύτερες οι απλούστερες μέθοδοι.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

Τι είναι το Chinchilla Compute-Optimal Training;

Το Chinchilla είναι ένα εύρημα της DeepMind του 2022 ότι τα περισσότερα μοντέλα μεγάλων γλωσσών ήταν κακώς εκπαιδευμένα: για έναν σταθερό υπολογιστικό προϋπολογισμό θα πρέπει να κλιμακώνετε τις παραμέτρους και τα δεδομένα περίπου εξίσου, όχι απλώς να δημιουργείτε ένα μεγαλύτερο μοντέλο. Αναδιαμόρφωσε τον τρόπο με τον οποίο ο κλάδος εξισορροπεί το μέγεθος του μοντέλου έναντι των δεδομένων εκπαίδευσης.

Ποιος είναι ο περίφημος εμπειρικός κανόνας του Chinchilla για υπολογιστική-βέλτιστη εκπαίδευση;

Οι παραμέτρους και τα διακριτικά που βρήκε η DeepMind θα πρέπει να κλιμακώνονται σε περίπου 20 μάρκες ανά παράμετρο για έναν δεδομένο υπολογιστικό προϋπολογισμό.

Πώς συγκρίθηκε το τσιντσιλά με παραμέτρους 70 Β με το Gopher με παραμέτρους 280 Β;

Εκπαιδευμένος σε πολύ περισσότερα διακριτικά με τον ίδιο υπολογισμό, ο Chinchilla κέρδισε το πολύ μεγαλύτερο Gopher στα περισσότερα σημεία αναφοράς.

Ποιο βασικό πρόβλημα αποκάλυψε το χαρτί Chinchilla σχετικά με προηγούμενα μεγάλα μοντέλα;

Μοντέλα όπως το GPT-3 και το Gopher ήταν πολύ μεγάλα σε σχέση με τα δεδομένα προπόνησής τους, αφήνοντας την απόδοση απραγματοποίητη.

Πόσα περίπου μάρκες προτείνει ο κανόνας Chinchilla για ένα μοντέλο 10 δισεκατομμυρίων παραμέτρων;

Σε 20 μάρκες ανά παράμετρο, 10 δισεκατομμύρια παράμετροι συνεπάγονται περίπου 200 δισεκατομμύρια μάρκες εκπαίδευσης.

Εκτός από την αποτελεσματικότητα της εκπαίδευσης, γιατί ένα μικρότερο, πλούσιο σε δεδομένα μοντέλο είναι ελκυστικό στην ανάπτυξη;

Λιγότερες παράμετροι σημαίνουν χαμηλότερο υπολογισμό ανά ερώτημα, επομένως η εξοικονόμηση είναι κάθε φορά που χρησιμοποιείται το μοντέλο.