Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το χαρτί προτείνει αντιστοίχιση ταχύτητας για τη λεπτομέρεια ανταμοιβής κλίμακας για μοντέλα διάχυσης

Οι ερευνητές προτείνουν αντιστοίχιση ταχύτητας με βάση την ανταμοιβή, μια μέθοδο χωρίς τροχιά που ενημερώνει άμεσα τα πεδία ταχύτητας των μοντέλων διάχυσης και, αναφέρουν, επιτυγχάνει συγκρίσιμα ή καλύτερα αποτελέσματα από τις μεθόδους που βασίζονται στην πιθανότητα με χαμηλότερο κόστος εκπαίδευσης.

5 min readRead the primary source
Primary-source image accompanying Paper proposes velocity matching to scale reward fine-tuning for diffusion models
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.23664
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Βελτιστοποίηση
Συνεχής εκπαίδευση σε δεδομένα συγκεκριμένου τομέα για την προσαρμογή ενός προεκπαιδευμένου μοντέλου σε μια συγκεκριμένη εργασία.
Ενισχυτική Μάθηση
Η εκπαίδευση μέσω ανταμοιβής σηματοδοτεί όπου ένας πράκτορας μαθαίνει ενέργειες που μεγιστοποιούν τη μακροπρόθεσμη απόδοση.
Μοντέλο Διάχυσης
Μια αρχιτεκτονική δημιουργίας που μαθαίνει να αντιστρέφει το θόρυβο για να συνθέτει εικόνες, ήχο ή άλλο περιεχόμενο.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Μια ομάδα επτά ερευνητών υπέβαλε ένα έγγραφο arXiv που πρότεινε την αντιστοίχιση ταχύτητας με βάση την ανταμοιβή (RVM), μια μέθοδο για τον ακριβή συντονισμό των μοντέλων διάχυσης προς τις ανθρώπινες προτιμήσεις ή στόχους για συγκεκριμένες εργασίες. Το RVM ενημερώνει απευθείας το πεδίο ταχύτητας του μοντέλου αντί να ανακατασκευάζει πιθανότητες από τροχιές αποθορυβοποίησης ή κατά προσέγγιση πιθανότητες τελικού σημείου.

Η πηγή είναι μια υποβολή arXiv με ημερομηνία 24 Αυγούστου 2026, με τίτλο «Εκμάθηση ενίσχυσης κλίμακας για μοντέλα διάχυσης μέσω αντιστοίχισης ταχύτητας». Οι συγγραφείς παρουσιάζουν τη λεπτομέρεια ανταμοιβής ως έναν τρόπο προσαρμογής των μοντέλων διάχυσης στις ανθρώπινες προτιμήσεις και στόχους που σχετίζονται με την εργασία. Ο κεντρικός ισχυρισμός τους είναι ότι οι υπάρχουσες προσεγγίσεις δανείζονται μηχανισμούς διαβάθμισης πολιτικής που έχουν σχεδιαστεί για αυτοπαλινδρομικά μοντέλα, δημιουργώντας πρόσθετη πολυπλοκότητα, επειδή τα μοντέλα διάχυσης δεν παρέχουν υπολογίσιμες πιθανότητες για τα παραγόμενα δείγματα.

Η προτεινόμενη μέθοδος, η αντιστοίχιση ταχύτητας με βάση την ανταμοιβή, περιγράφεται ως χωρίς τροχιά. Αντί να κατασκευάζει πιθανότητες από στοχαστικές μεταβάσεις αποθορυβοποίησης ή να προσεγγίζει πιθανότητες τελικού σημείου με χαμηλό όριο απόδειξης, το RVM δρα απευθείας στο πεδίο ταχύτητας. According to the paper’s abstract, the update reinforces directions associated with high-reward generations and suppresses directions associated with low-reward generations.

Το RVM περιλαμβάνει έναν προαιρετικό όρο αγκύρωσης που προορίζεται για τον έλεγχο της μετατόπισης από μια ταχύτητα αναφοράς. Οι συγγραφείς λένε επίσης ότι το πλαίσιο μπορεί να ανακτήσει πρόσφατες μεθόδους μικρορύθμισης, συμπεριλαμβανομένων των RAM και DiffusionNFT, ως ειδικές περιπτώσεις. Αυτό καθιστά την πρόταση μια ενοποιητική διατύπωση καθώς και έναν νέο κανόνα ενημέρωσης, αν και η παρεχόμενη πηγή δεν εξηγεί τις ακριβείς παραγώγους ή τις συνθήκες υπό τις οποίες ισχύουν αυτές οι ισοδυναμίες.

Οι ερευνητές αναφέρουν δοκιμές σε διάφορες εργασίες μεγάλης κλίμακας ανταμοιβής-μοντέλου διάχυσης-λεπτής ρύθμισης. Λένε ότι το RVM ήταν ανταγωνιστικό ή ξεπέρασε τις μεθόδους βαθμίδας πολιτικής που βασίζονται σε τροχιά, ενώ απαιτούσε σημαντικά μικρότερο κόστος εκπαίδευσης. Για τη δημιουργία βίντεο, αναφέρουν ότι οι τυπικές ανταμοιβές προτιμήσεων μπορούν να παράγουν οπτικά καθαρές αλλά σχεδόν στατικές εξόδους. εισάγουν μια ανταμοιβή δυναμικής παρακολούθησης και λένε ότι βελτίωσε την κίνηση ενώ παράλληλα βελτιώνει τη συνολική απόδοση του VBench. Δεν περιλαμβάνονται αριθμητικές βαθμολογίες, ονόματα μοντέλων, προϋπολογισμοί εκπαίδευσης ή συγκριτικοί πίνακες στην παρεχόμενη πηγή.

Στοιχεία πηγής: arxiv.org ↗

Γιατί έχει σημασία

Το έγγραφο υποστηρίζει ότι οι άμεσες ενημερώσεις ταχύτητας θα μπορούσαν να απλοποιήσουν και να μειώσουν το κόστος της λεπτομέρειας ανταμοιβής για συστήματα διάχυσης εικόνας και βίντεο μεγάλης κλίμακας. Τα πειράματα βίντεο εντοπίζουν επίσης μια αντιστάθμιση στις τυπικές ανταμοιβές προτιμήσεων: μπορεί να ευνοούν οπτικά καθαρά αποτελέσματα με μικρή κίνηση.

Εάν γενικευθούν οι ισχυρισμοί του άρθρου, η απευθείας βελτιστοποίηση της αναπαράστασης της εγγενούς ταχύτητας ενός μοντέλου διάχυσης θα μπορούσε να καταστήσει τη λεπτομέρεια ανταμοιβής ευκολότερη στην κλίμακα. Η πρακτική σημασία δεν είναι απλώς μια νέα συνάρτηση απώλειας: η μέθοδος στοχεύει τα υπολογιστικά και αλγοριθμικά γενικά έξοδα που σχετίζονται με τη βελτιστοποίηση πολιτικής βάσει πιθανοτήτων. Το χαμηλότερο κόστος εκπαίδευσης θα μπορούσε να καταστήσει πιο προσιτές τις προτιμήσεις ή την προσαρμογή για συγκεκριμένες εργασίες σε ομάδες που εργάζονται με μεγάλες γεννήτριες εικόνας και βίντεο.

Η εργασία εστιάζει επίσης την προσοχή στον σχεδιασμό της ίδιας της ανταμοιβής. Στα πειράματα βίντεο των συγγραφέων, μια ανταμοιβή που έδινε έμφαση στην οπτική καθαριότητα φέρεται να ευνοούσε τα αποτελέσματα με μικρή κίνηση. Η ανταμοιβή δυναμικής παρακολούθησης παρουσιάζεται ως ένας τρόπος για την αποτελεσματικότερη μέτρηση της κίνησης, βελτιώνοντας παράλληλα το συνολικό αποτέλεσμα VBench του χαρτιού. Αυτό δείχνει ότι η βελτίωση ενός συστήματος παραγωγής δεν εξαρτάται μόνο από τον κανόνα ενημέρωσης αλλά και από το τι ζητείται να αποτιμήσει η διαδικασία βελτιστοποίησης.

Ο προαιρετικός όρος αγκύρωσης έχει σημασία επειδή η βελτιστοποίηση ανταμοιβής μπορεί να απομακρύνει ένα μοντέλο από μια συμπεριφορά αναφοράς. Η πηγή λέει ότι τα χειριστήρια αγκύρωσης απομακρύνονται από μια ταχύτητα αναφοράς, αλλά δεν δηλώνει πώς αυτός ο έλεγχος επηρεάζει την ποιότητα, τη διαφορετικότητα, τη σταθερότητα ή τον κίνδυνο υπερβολικής προσαρμογής σε μια ανταμοιβή. Αυτές οι λεπτομέρειες θα καθορίσουν εάν το RVM είναι χρήσιμο για ελεγχόμενη προσαρμογή και όχι μόνο για βελτιστοποίηση συγκριτικής αξιολόγησης.

Το αποτέλεσμα παραμένει ένας ισχυρισμός έρευνας από ένα έγγραφο arXiv, όχι απόδειξη ότι η εκπαίδευση σε μοντέλο διάχυσης έχει αλλάξει σε μεγάλο βαθμό. Η περίληψη που παρέχεται δεν προσδιορίζει τα δοκιμασμένα μοντέλα, τα σύνολα δεδομένων, τα μεγέθη ανταμοιβής, την υπολογιστική εξοικονόμηση, τις στατιστικές διακυμάνσεις ή τις περιπτώσεις αποτυχίας. Επίσης, δεν καθορίζει εάν η μέθοδος λειτουργεί εξίσου καλά για εικόνες, βίντεο και άλλες εφαρμογές διάχυσης ή εάν τα πλεονεκτήματά της εξαρτώνται από συγκεκριμένα σχέδια ανταμοιβής.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Τα κύρια ερωτήματα είναι εάν τα αναφερόμενα πλεονεκτήματα κόστους και ποιότητας της RVM ισχύουν για πειράματα που αναπαράγονται ανεξάρτητα, συναρτήσεις ανταμοιβής, μεγέθη μοντέλων και εργασίες παραγωγής και εάν η μέθοδος μπορεί να αποφύγει τη βελτιστοποίηση για στενές ή παραπλανητικές ανταμοιβές. Η παρεχόμενη πηγή δεν παρέχει αριθμητικά αποτελέσματα, λεπτομέρειες υλοποίησης, υπολογισμούς προϋπολογισμών ή στοιχεία εξωτερικής επικύρωσης.

Η αναπαραγωγή θα πρέπει πρώτα να επικεντρωθεί στη σύγκριση της εργασίας με μεθόδους βαθμίδωσης πολιτικής που βασίζονται σε τροχιά. Οι χρήσιμοι έλεγχοι θα περιλάμβαναν το ίδιο μοντέλο και την ίδια εργασία με τους αντίστοιχους υπολογιστικούς προϋπολογισμούς, επειδή το "ουσιαστικά μειωμένο κόστος εκπαίδευσης" έχει νόημα μόνο όταν η λογιστική περιλαμβάνει όλες τις σχετικές εργασίες κατάρτισης και αξιολόγησης. Η παρεχόμενη πηγή δεν παρέχει αριθμητική αναλογία κόστους, επομένως το μέγεθος του διεκδικούμενου πλεονεκτήματος είναι άγνωστο.

Ο σχεδιασμός ανταμοιβής αξίζει ξεχωριστή αξιολόγηση από την ενημέρωση ταχύτητας. Οι συγγραφείς λένε ότι, μόλις απλοποιηθεί η ενημέρωση της ταχύτητας, η συγκεκριμένη παραλλαγή απώλειας έχει μικρότερη σημασία από τον σχεδιασμό ανταμοιβής και αγκύρωσης. Αυτός ο ισχυρισμός υποδηλώνει ότι οι βελτιώσεις θα μπορούσαν να εξαρτηθούν σε μεγάλο βαθμό από τον τρόπο με τον οποίο επισημαίνονται ή βαθμολογούνται οι γενιές με υψηλή και χαμηλή ανταμοιβή. Επομένως, οι ανεξάρτητες δοκιμές θα πρέπει να διαφοροποιούν τις συναρτήσεις ανταμοιβής και να μετρούν εάν τα κέρδη παραμένουν πέρα ​​από τους επιλεγμένους στόχους του χαρτιού.

Για τη δημιουργία βίντεο, οι παρατηρητές θα πρέπει να ελέγχουν εάν οι ανταμοιβές δυναμικής παρακολούθησης βελτιώνουν την ουσιαστική κίνηση ή απλώς αυξάνουν την ορατή αλλαγή. Η πηγή αναφέρει καλύτερη κίνηση και βελτιωμένο συνολικό αποτέλεσμα VBench, αλλά δεν παρέχει τις υποκείμενες μετρήσεις ούτε περιγράφει τις λειτουργίες αποτυχίας. Η αξιολόγηση θα πρέπει να εξετάζει την οπτική ποιότητα, τη χρονική συνέπεια και την ποικιλομορφία μαζί, συμπεριλαμβανομένων των περιπτώσεων στις οποίες η κίνηση είναι ανεπιθύμητη ή έρχεται σε σύγκρουση με το επιδιωκόμενο περιεχόμενο.

Η ευρύτερη σημασία του χαρτιού θα εξαρτηθεί από τις λεπτομέρειες εφαρμογής και επικύρωσης που δεν υπάρχουν στην παρεχόμενη πηγή. Στα σημαντικά άγνωστα περιλαμβάνονται η ακριβής παραμετροποίηση ταχύτητας, οι ρυθμίσεις αγκύρωσης, η κάλυψη μοντέλων και δεδομένων, η διάρκεια εκπαίδευσης, η αναπαραγωγιμότητα των αναφερόμενων συγκρίσεων και το αν το RVM παραμένει σταθερό καθώς αλλάζουν οι στόχοι ανταμοιβής. Τα έγγραφα παρακολούθησης, ο κώδικας που κυκλοφόρησε και οι ανεξάρτητες επαναλήψεις θα βοηθούσαν να διαπιστωθεί εάν η πρόταση είναι μια γενική μέθοδος κλιμάκωσης ή ένα αποτέλεσμα που συνδέεται με συγκεκριμένα πειράματα.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΕκπαίδευση AIΜετασχηματιστέςΤο μέλλον του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;