Κλιμάκωση παραθύρου περιβάλλοντος YaRN
Το YaRN (ακόμη μια επέκταση RoPE) είναι μια τεχνική που επεκτείνει το χρησιμοποιήσιμο παράθυρο περιβάλλοντος ενός μετασχηματιστή πολύ πέρα από αυτό στο οποίο είχε εκπαιδευτεί, με ελάχιστη ρύθμιση.
Επισκόπηση
It matters because it lets existing models handle much longer documents without retraining from scratch.
Βαθιά κατάδυση
Τα περισσότερα σύγχρονα LLM κωδικοποιούν θέσεις λέξεων χρησιμοποιώντας Rotary Position Embeddings (RoPE), οι οποίες λειτουργούν καλά μόνο μέχρι το μήκος που είδε το μοντέλο κατά τη διάρκεια της εκπαίδευσης. Τροφοδοτήστε σε μεγαλύτερη σειρά και το μοντέλο υποβαθμίζεται άσχημα. Το YaRN το επιλύει αναβαθμίζοντας τις συχνότητες περιστροφής του RoPE με τρόπο που να γνωρίζει τη συχνότητα: οι διαστάσεις υψηλής συχνότητας (που καταγράφουν τοπικές, κοντινές σχέσεις) παραμένουν ως επί το πλείστον ανέγγιχτες, ενώ οι διαστάσεις χαμηλής συχνότητας (που καταγράφουν θέση μεγάλης εμβέλειας) παρεμβάλλονται. Προσθέτει επίσης μια ρύθμιση θερμοκρασίας στην προσοχή για να διατηρείται η καλή συμπεριφορά των logit σε μεγάλες αποστάσεις. Το αποτέλεσμα, που αποδεικνύεται σε μοντέλα LLaMA, επεκτείνει το πλαίσιο από 4K σε 64K-128K διακριτικά χρησιμοποιώντας μόνο περίπου το 0,1% των αρχικών δεδομένων εκπαίδευσης και μερικές εκατοντάδες βήματα τελειοποίησης.
Τεχνική διορατικότητα
Το RoPE περιστρέφει τα διανύσματα ερωτήματος και κλειδιών κατά γωνία ανάλογη με τη θέση και μια συχνότητα ανά διάσταση. Η αφελής γραμμική παρεμβολή (Προβολή θέσης) συνθλίβει όλες τις συχνότητες εξίσου, βλάπτοντας τις τοπικές λεπτομέρειες. Αντίθετα, το YaRN εφαρμόζει "NTK-by-parts": παρεμβάλλει μόνο τις διαστάσεις χαμηλής συχνότητας (μεγάλου μήκους κύματος), αφήνει μόνο τις διαστάσεις υψηλής συχνότητας και ράμπες μεταξύ τους. Μια κλιμάκωση της θερμοκρασίας προσοχής αντισταθμίζει τη μετατόπιση της εντροπίας, διατηρώντας την ακρίβεια σε εκτεταμένα μήκη.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
Το μέλλον της κλιμάκωσης παραθύρου περιβάλλοντος του YaRN
Η επέκταση με επίγνωση συχνότητας τύπου YaRN έχει γίνει ένα προεπιλεγμένο συστατικό για την αποστολή μοντέλων μεγάλου πλαισίου. παραλλαγές και διάδοχοι συνεχίζουν να εμφανίζονται καθώς τα εργαστήρια πιέζουν προς τα παράθυρα εκατομμυρίων συμβολαίων. Αναμένετε στενότερη ενσωμάτωση με αποτελεσματική προσοχή, συμπίεση κρυφής μνήμης KV και δυναμική κλιμάκωση που προσαρμόζεται αμέσως ανά αίτημα. Η ευρύτερη τάση είναι η αποσύνδεση του «πόσο καιρό εκπαιδεύτηκε ένα μοντέλο» από το «πόσο καιρό μπορεί να διαβάσει χρήσιμα», καθιστώντας το μακρύ πλαίσιο ένα φτηνό χαρακτηριστικό μετά την εκπαίδευση και όχι μια δαπανηρή αρχιτεκτονική δέσμευση.
Υλοποίηση σε πραγματικό κόσμο
Επέκταση ενός ανοιχτού μοντέλου LLaMA από 4K σε 128K διακριτικά, ώστε να μπορεί να απορροφήσει μια ολόκληρη βάση κώδικα ή ένα μεγάλο συμβόλαιο με ένα πέρασμα
Επιτρέποντας σε ένα chatbot να διατηρεί πολύ μεγάλα ιστορικά συνομιλιών χωρίς να περικόπτει τις προηγούμενες στροφές
Σύνοψη εγγράφων μήκους βιβλίου ή πολύωρων μεταγραφών που υπερβαίνουν το εγγενές παράθυρο του βασικού μοντέλου
Φτηνή προσαρμογή ενός προεκπαιδευμένου μοντέλου για εργασίες ανάκτησης μεγάλου πλαισίου χρησιμοποιώντας μόνο μια μικρή διαδρομή λεπτομέρειας
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Περιβάλλον Windows
Συχνές ερωτήσεις
What is YaRN Context Window Scaling?
Το YaRN (ακόμη μια επέκταση RoPE) είναι μια τεχνική που επεκτείνει το χρησιμοποιήσιμο παράθυρο περιβάλλοντος ενός μετασχηματιστή πολύ πέρα από αυτό στο οποίο είχε εκπαιδευτεί, με ελάχιστη ρύθμιση. Σημασία έχει γιατί επιτρέπει στα υπάρχοντα μοντέλα να χειρίζονται πολύ μεγαλύτερα έγγραφα χωρίς επανεκπαίδευση από την αρχή.
Ποιο σχήμα κωδικοποίησης θέσης τροποποιεί το YaRN για να επεκτείνει το μήκος του περιβάλλοντος;
Το YaRN σημαίνει «Ένα άλλο προέκταση σχοινιού» και λειτουργεί αναβαθμίζοντας τις συχνότητες περιστροφής που χρησιμοποιούνται στις ενσωματώσεις περιστροφικής θέσης.
Πώς αντιμετωπίζει το YaRN τις διαστάσεις RoPE υψηλής συχνότητας έναντι χαμηλής συχνότητας;
Η προσέγγιση «NTK-by-parts» του YaRN διατηρεί τις διαστάσεις υψηλής συχνότητας (τοπικές) ενώ παρεμβάλλει τις διαστάσεις χαμηλής συχνότητας (μεγάλης εμβέλειας) για να αποφευχθεί η πρόκληση βλάβης στις τοπικές λεπτομέρειες.
Ποιο είναι το βασικό πλεονέκτημα απόδοσης του YaRN έναντι της εκπαίδευσης ενός μοντέλου μεγάλου πλαισίου από την αρχή;
Το YaRN μπορεί να επεκτείνει το πλαίσιο χρησιμοποιώντας περίπου το 0,1% των αρχικών δεδομένων εκπαίδευσης και έναν μικρό αριθμό βημάτων λεπτομέρειας, πολύ φθηνότερα από την επανεκπαίδευση.
Εκτός από την επανακλιμάκωση των συχνοτήτων, ποια επιπλέον προσαρμογή εφαρμόζει το YaRN για να διατηρεί σταθερή την προσοχή σε μεγάλη απόσταση;
Το YaRN τροποποιεί τη θερμοκρασία προσοχής για να αντισταθμίσει τη μετατόπιση εντροπίας/λογαριασμού που συμβαίνει όταν οι ακολουθίες γίνονται πολύ μεγαλύτερες.
Τι πρόβλημα προκύπτει εάν τροφοδοτήσετε ένα μοντέλο RoPE σε ακολουθίες πολύ μεγαλύτερες από ό,τι είχε εκπαιδευτεί, χωρίς καμία κλιμάκωση;
Το RoPE γενικεύει ελάχιστα σε μη εμφανείς θέσεις long, επομένως η ποιότητα καταρρέει εκτός εάν οι συχνότητες αναβαθμιστούν.