Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το σημείο αναφοράς Werewolf διαπιστώνει ότι τα LLM μπορούν να υπερεκτιμήσουν τους αξιόπιστους κατηγόρους

Ένα σημείο αναφοράς 40 διαμορφώσεων LLM ανοιχτού βάρους διαπίστωσε ότι οι κατηγορίες μπορούν να αλλάξουν τις πεποιθήσεις των μοντέλων ακόμα και όταν ο κατήγορος είναι ευθυγραμμισμένος με την αντίπαλη πλευρά.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2609.12446
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Σημείο αναφοράς
Μια τυποποιημένη δοκιμή ή σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση και τη σύγκριση της απόδοσης του μοντέλου.
Μεγάλο μοντέλο γλώσσας (LLM)
Ένα μοντέλο γλώσσας εκπαιδευμένο σε τεράστια σώματα κειμένου για τη δημιουργία και ανάλυση κειμένου.
Σχολιασμός
Ετικέτες ή μεταδεδομένα που προστέθηκαν από τον άνθρωπο που χρησιμοποιούνται για την εκπαίδευση ή την αξιολόγηση μοντέλων μηχανικής μάθησης.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Οι ερευνητές εισήγαγαν ένα σημείο αναφοράς Werewolf που μετρά τον τρόπο με τον οποίο οι LLM που παρατηρούν ενημερώνουν τις πεποιθήσεις τους μετά τη λήψη μηνυμάτων υποψίας και κατηγορίας. Σε 1.224 σχολιασμένα μηνύματα και 40 διαμορφώσεις μοντέλων ανοιχτού βάρους, τα μεγαλύτερα μοντέλα εντόπιζαν συχνότερα αληθινούς λύκους από την ιστορία του παιχνιδιού, αλλά παρέμειναν έντονα επηρεασμένα από κατηγορίες και την αντιληπτή αξιοπιστία του κατήγορου.

Το έγγραφο προτείνει την αξιολόγηση των αλλαγών πεποιθήσεων αντί να βασίζεται μόνο στο τελικό αποτέλεσμα ενός παιχνιδιού κοινωνικής έκπτωσης. Στη διαμόρφωσή του, ένα μοντέλο παρατήρησης από την πλευρά του χωριού λαμβάνει μηνύματα παιχνιδιού, συμπεριλαμβανομένων υποψιών και κατηγοριών, και οι ερευνητές μετρούν πώς αλλάζουν οι πεποιθήσεις του μετά από κάθε μήνυμα.

Οι αφηρημένες αναφορές προκύπτουν από 40 διαμορφώσεις LLM ανοιχτού βάρους και 1.224 σχολιασμένα μηνύματα. Τα μεγαλύτερα μοντέλα απέδωσαν καλύτερα στη διάκριση των λύκων από τους χωρικούς χρησιμοποιώντας την πλήρη ιστορία του παιχνιδιού. Ωστόσο, οι κατηγορίες εξακολουθούσαν να αύξαναν την καχυποψία προς τον κατηγορούμενο και μείωσαν την καχυποψία προς τον κατήγορο, ιδιαίτερα όταν ο κατήγορος είχε ήδη εμπιστοσύνη.

Το αναφερόμενο μοτίβο διατηρήθηκε ακόμη και όταν ο έμπιστος κατήγορος ήταν ευθυγραμμισμένος με τον λύκο. Τα μεγαλύτερα μοντέλα ήταν καλύτερα σε θέση να αντισταθούν στις κατηγορίες από κατηγόρους που ήδη δεν εμπιστεύονταν, αλλά μοντέλα έως και 120 δισεκατομμυρίων παραμέτρων εξακολουθούσαν να αγωνίζονται να ενσωματώσουν το περιεχόμενο της κατηγορίας με την αξιοπιστία της πηγής της. Η πηγή δεν παρέχει λεπτομερείς βαθμολογίες ανά μοντέλο, στατιστική αβεβαιότητα ή ανεξάρτητη αναπαραγωγή στο παρεχόμενο κείμενο.

Στοιχεία πηγής: arxiv.org ↗

Γιατί έχει σημασία

Η μελέτη εντοπίζει μια συγκεκριμένη αδυναμία στη στρατηγική επικοινωνία: τα μοντέλα μπορεί να μην διαχωρίζουν επαρκώς την αξιοπιστία ενός ομιλητή από τα στοιχεία που περιέχονται στον ισχυρισμό αυτού του ομιλητή. Αυτό έχει σημασία για τους πράκτορες LLM που λειτουργούν σε ρυθμίσεις όπου τα μηνύματα μπορεί να είναι επιλεκτικά, παραπλανητικά ή αντίθετα. Το αποτέλεσμα είναι ένα σημείο αναφοράς και ένα εύρημα έρευνας, όχι απόδειξη ότι όλα τα αναπτυγμένα συστήματα τεχνητής νοημοσύνης συμπεριφέρονται με αυτόν τον τρόπο ή ότι η αξιολόγηση γενικεύεται πέρα ​​από το Werewolf.

Για τους ερευνητές που αξιολογούν τους πράκτορες LLM, το αποτέλεσμα υποδηλώνει ότι η τελική επιτυχία του παιχνιδιού μπορεί να κρύβει σημαντικές αδυναμίες στον ενδιάμεσο συλλογισμό και την ενημέρωση των πεποιθήσεων. Ένα μοντέλο μπορεί να καταλήξει σε μια εύλογη απόφαση, ενώ εξακολουθεί να βαραίνει ποιος υπέβαλε έναν ισχυρισμό αντί να αξιολογήσει τον ισχυρισμό μαζί με τα διαθέσιμα στοιχεία.

Η πρακτική επίπτωση είναι περιορισμένη αλλά χρήσιμη: οι αξιολογήσεις των πρακτόρων που επικοινωνούν ή λαμβάνουν αποφάσεις από πολλαπλές αναφορές μπορεί να χρειαστεί να μετρήσουν τις αλλαγές πεποιθήσεων μετά από μεμονωμένα μηνύματα, συμπεριλαμβανομένων περιπτώσεων όπου ένας αξιόπιστος ομιλητής είναι παραπλανητικός. Η μελέτη δεν αποδεικνύει ότι η ίδια συμπεριφορά εμφανίζεται σε αναπτυγμένα προϊόντα ή σε ρυθμίσεις εκτός παιχνιδιού.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Το σημείο αναφοράς και ο κώδικας είναι διαθέσιμα μέσω του ιστότοπου του έργου, αλλά η πηγή δεν αναφέρει αδειοδότηση, λεπτομέρειες φιλοξενίας ή εάν τα αξιολογημένα μοντέλα είναι διαθέσιμα για δημόσια χρήση. Περαιτέρω εργασία θα πρέπει να ελέγξει εάν η εύρεση μεταφέρεται σε άλλες εργασίες επικοινωνίας, εάν η εκπαίδευση βελτιώνει τη συλλογιστική πηγής-περιεχομένου και πόσο τα αποτελέσματα εξαρτώνται από τον σχεδιασμό του παιχνιδιού και τις επιλογές σχολιασμού.

Οι συγγραφείς λένε ότι το σημείο αναφοράς και ο κώδικας είναι διαθέσιμα στη συνδεδεμένη σελίδα του έργου. Η παρεχόμενη πηγή δεν τεκμηριώνει τις απαιτήσεις πρόσβασης, τις άδειες χρήσης, την τιμολόγηση, τα υποστηριζόμενα πλαίσια ή εάν το σημείο αναφοράς περιλαμβάνει εξόδους μοντέλων πέρα ​​από τα σχολιασμένα μηνύματα.

Σημαντικά άγνωστα στοιχεία περιλαμβάνουν τον τρόπο δημιουργίας και σχολιασμού των μηνυμάτων, τον τρόπο δημιουργίας εμπιστοσύνης, εάν τα αποτελέσματα είναι στατιστικά ισχυρά σε μεμονωμένα μοντέλα και εάν η βελτιωμένη λογική του ιστορικού παιχνιδιού των μεγαλύτερων μοντέλων μεταφράζεται σε καλύτερη αντίσταση στη χειραγώγηση.

Η αναπαραγωγή σε άλλες στρατηγικές εργασίες επικοινωνίας θα βοηθούσε να καθοριστεί εάν πρόκειται για ένα συγκεκριμένο αποτέλεσμα του Λυκάνθρωπου ή για έναν ευρύτερο περιορισμό στον τρόπο με τον οποίο οι πράκτορες LLM συνδυάζουν την αξιοπιστία της πηγής με το περιεχόμενο κατηγορίας.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΠράκτορες AIΗθική του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;