QLoRA και 4-bit Fine-Tuning
Το QLoRA είναι μια τεχνική που σας επιτρέπει να ρυθμίσετε με ακρίβεια ένα τεράστιο μοντέλο γλώσσας σε μια GPU ενός καταναλωτή, αποθηκεύοντας το παγωμένο μοντέλο σε μόλις 4 bit ανά βάρος.
Επισκόπηση
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
Βαθιά κατάδυση
Κανονικά, η τελειοποίηση ενός μεγάλου μοντέλου σημαίνει φόρτωση κάθε βάρους με ακρίβεια 16 bit και ενημέρωση όλων, κάτι που απαιτεί τεράστια μνήμη. Το QLoRA συνδυάζει δύο ιδέες. Πρώτον, παγώνει το προεκπαιδευμένο μοντέλο και το κβαντίζει σε 4 bit, μειώνοντας τη μνήμη περίπου τέσσερις φορές. Δεύτερον, χρησιμοποιεί LoRA: αντί να ενημερώνει τους γιγάντιους πίνακες βάρους, εγχέει μικροσκοπικούς πίνακες προσαρμογέων χαμηλής κατάταξης που μπορούν να εκπαιδεύονται μαζί τους, έτσι ώστε να ενημερώνονται μόνο μερικά εκατομμύρια παράμετροι. Η βάση 4-bit παραμένει σταθερή ενώ οι διαβαθμίσεις ρέουν μόνο μέσω των μικρών προσαρμογέων. Το QLoRA, το οποίο εισήχθη το 2023 από τον Dettmers και τους συνεργάτες του, έδειξε ότι η λεπτομέρεια ενός μοντέλου 65Β σε μία GPU 48 GB θα μπορούσε να ταιριάζει με την ποιότητα της πλήρους λεπτομέρειας 16 bit.
Τεχνική διορατικότητα
Η QLoRA παρουσίασε τρία κόλπα. Το NF4 (4-bit NormalFloat) είναι ένας τύπος δεδομένων βελτιστοποιημένος για την κατανομή της καμπύλης των νευρικών βαρών, παρέχοντας καλύτερη ακρίβεια από το απλό int4. Η διπλή κβαντοποίηση συμπιέζει τις ίδιες τις σταθερές κβαντισμού, εξοικονομώντας επιπλέον μνήμη. Οι βελτιστοποιητές σελιδοποίησης χρησιμοποιούν ενοποιημένη μνήμη GPU-CPU για να απορροφούν αιχμές κατά τη διάρκεια μεγάλων ακολουθιών, αποτρέποντας σφάλματα εκτός μνήμης. Κατά τη διάρκεια της διέλευσης προς τα εμπρός και προς τα πίσω, τα βάρη των 4 bit αποκβαντοποιούνται σε 16 bit just-in-time για τον πολλαπλασιασμό της μήτρας, και στη συνέχεια απορρίπτονται.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
Το μέλλον του QLoRA και του 4-bit Fine-Tuning
Η λεπτομέρεια των 4 bit έχει γίνει τυπική πρακτική και η έρευνα ωθεί τώρα προς ακόμη χαμηλότερη ακρίβεια, συμπεριλαμβανομένων των αναπαραστάσεων 2 bit και 1 bit (τριμερής). Τα νεότερα σχήματα κβαντοποίησης όπως τα AWQ, GPTQ και HQQ βελτιώνουν περαιτέρω την ακρίβεια, ενώ τεχνικές όπως το QA-LoRA στοχεύουν να διατηρήσουν το μοντέλο κβαντισμένο ακόμη και μετά τη συγχώνευση προσαρμογέων. Καθώς τα μοντέλα ανοιχτού βάρους αναπτύσσονται, περιμένετε εργαλεία που θα επιτρέπουν στους χομπίστες να προσαρμόζουν τα μοντέλα 70B plus σε μια ενιαία GPU gaming για να γίνουν ρουτίνα, εκδημοκρατίζοντας την προσαρμογή.
Υλοποίηση σε πραγματικό κόσμο
Μια startup συντονίζει με ακρίβεια ένα μοντέλο Llama 70B σε μια ενιαία GPU 48 GB για να δημιουργήσει έναν βοηθό υποστήριξης πελατών με τη φωνή της δικής της επωνυμίας χωρίς να νοικιάσει ένα σύμπλεγμα διακομιστών.
Ένας ερευνητής με έναν καταναλωτή RTX 4090 προσαρμόζει ένα ανοιχτό μοντέλο σε ένα εξειδικευμένο σύνολο δεδομένων ιατρικών απαντήσεων σε μια νύχτα.
Ένας προγραμματιστής δημιουργεί δεκάδες μικρούς, ανταλλάξιμους προσαρμογείς LoRA για διαφορετικές εργασίες, όλοι μοιράζονται ένα βασικό μοντέλο 4-bit φορτωμένο στη μνήμη.
Ένας χομπίστας συντονίζει ένα μοντέλο στα προσωπικά του αρχεία καταγραφής συνομιλιών για να μιμηθεί ένα συγκεκριμένο στυλ γραφής χρησιμοποιώντας δωρεάν υλικό ποιότητας Colab.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Βελτιστοποίηση δειγματοληψίας απόρριψης
Συχνές ερωτήσεις
What is QLoRA and 4-Bit Fine-Tuning?
Το QLoRA είναι μια τεχνική που σας επιτρέπει να ρυθμίσετε με ακρίβεια ένα τεράστιο μοντέλο γλώσσας σε μια GPU ενός καταναλωτή, αποθηκεύοντας το παγωμένο μοντέλο σε μόλις 4 bit ανά βάρος. Κατέστησε δυνατή την προσαρμογή μοντέλων παραμέτρων 65Β σε υλικό που προηγουμένως μπορούσε να χειριστεί μοντέλα μόνο ένα κλάσμα αυτού του μεγέθους.
Ποια είναι η βασική ιδέα εξοικονόμησης μνήμης πίσω από το τμήμα «4-bit» του QLoRA;
Το QLoRA αποθηκεύει τα παγωμένα προεκπαιδευμένα βάρη σε 4 bit ανά τιμή, μειώνοντας τη μνήμη περίπου τετραπλασιάζοντας σε σύγκριση με τα 16 bit.
Κατά τη διάρκεια της μικρορύθμισης του QLoRA, ποιες παράμετροι ενημερώνονται στην πραγματικότητα με gradient descent;
Το βασικό μοντέλο είναι παγωμένο. Μόνο οι πίνακες προσαρμογέων χαμηλής κατάταξης που έχουν εγχυθεί λαμβάνουν ενημερώσεις διαβάθμισης, οι οποίες είναι απλώς ένα μικρό κλάσμα παραμέτρων.
Τι είναι το NF4 στο πλαίσιο του QLoRA;
Το NF4 (NormalFloat 4-bit) είναι ένας τύπος δεδομένων που έχει σχεδιαστεί γύρω από την κατανομή καμπύλης καμπάνας των βαρών νευρωνικών δικτύων για καλύτερη ακρίβεια από τον απλό int4.
Ποιο πρόβλημα αντιμετωπίζουν οι "σελιδοποιημένοι βελτιστοποιητές" στο QLoRA;
Οι βελτιστοποιητές σελιδοποίησης χρησιμοποιούν ενοποιημένη μνήμη GPU-CPU για να απορροφούν αιχμές μνήμης, αποτρέποντας σφάλματα εκτός μνήμης κατά τη διάρκεια της εκπαίδευσης σε μεγάλες εισόδους.
Πότε μετατρέπονται τα βάρη των 4 bit σε μεγαλύτερη ακρίβεια κατά τη διάρκεια της προπόνησης;
Τα βάρη των 4 bit αποκβαντοποιούνται σε ακρίβεια 16 bit για κάθε πολλαπλασιασμό μήτρας και, στη συνέχεια, το αντίγραφο μεγαλύτερης ακρίβειας απορρίπτεται για εξοικονόμηση μνήμης.