Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το χαρτί αναφέρει μια χρονική μέθοδο για την ανίχνευση παραισθήσεων σε συμβολικό επίπεδο

Μια προεκτύπωση arXiv περιγράφει έναν ανιχνευτή παραισθήσεων που συνδυάζει στατιστικά στοιχεία κειμένου, σήματα συνεπακόλουθων και εκπλήξεις γλωσσικού μοντέλου σε όλες τις ακολουθίες αντί να κρίνει ανεξάρτητα τα διακριτικά. Το μοντέλο BiGRU του έφτασε σε AUC 0,840 στο RAGTruth, σύμφωνα με την εφημερίδα.

6 min readRead the primary source
Source-provided image accompanying Paper reports a temporal method for detecting hallucinations at the token level
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.18115
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Token
Ένα κομμάτι κειμένου επεξεργασμένο από γλωσσικά μοντέλα, όπως ένα κομμάτι λέξης ή ένα σύμβολο.
Σετ αξιολόγησης
Ένα συγκρατημένο σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση της ποιότητας του μοντέλου μετά την εκπαίδευση.
Ψευδαίσθηση
Όταν ένα μοντέλο παράγει ρευστές αλλά ψευδείς ή μη υποστηριζόμενες πληροφορίες.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Μια νέα προεκτύπωση arXiv προτείνει την αντιμετώπιση των παραισθήσεων ως διαστημάτων που εκτυλίσσονται σε μια ακολουθία, αντί ως μεμονωμένων σφαλμάτων σε επίπεδο συμβολικού. Η μέθοδος συνδυάζει 33 χαρακτηριστικά από κείμενο που δημιουργείται, συνεπαγωγή συμπερασμάτων φυσικής γλώσσας και έκπληξη μοντέλου γλώσσας και στη συνέχεια τα επεξεργάζεται με ένα μοντέλο ακολουθίας. Η δημοσίευση αναφέρει ότι μια αμφίδρομη GRU έφτασε σε AUC 0,840 στο RAGTruth σε 10 seeds, ένα κέρδος 11 μονάδων σε σχέση με μια ανεξάρτητη γραμμή βάσης λογιστικής παλινδρόμησης.

Η πηγή είναι μια εγγραφή arXiv για το "Temporal Multi-Signal Fusion for -Level Detection", που συντάχθηκε από τον Igor Itkin και υποβλήθηκε στις 30 Ιουνίου 2026. Η κεντρική υπόθεση της εργασίας είναι ότι η ψευδαίσθηση είναι συχνά ένα προσωρινά εκτεταμένο διάστημα και όχι μια συλλογή ανεξάρτητων κακών διακριτικών. Ως εκ τούτου, πλαισιώνει την ανίχνευση ως επισήμανση ακολουθίας: κάθε διακριτικό λαμβάνει μια βαθμολογία από μια ροή χαρακτηριστικών, ενώ το μοντέλο μπορεί να χρησιμοποιήσει πληροφορίες από γειτονικές θέσεις για να αποφασίσει εάν ένα διάστημα είναι πιθανό να μην υποστηρίζεται ή να είναι εσφαλμένο.

Η προτεινόμενη ροή χαρακτηριστικών έχει 33 διαστάσεις. Σύμφωνα με την περίληψη, αυτά τα χαρακτηριστικά συνδυάζουν στατιστικά κειμένου, συνεπαγωγή συμπερασμάτων φυσικής γλώσσας και έκπληξη γλωσσικού μοντέλου. Ο ανιχνευτής δεν χρησιμοποιεί τις εσωτερικές ενεργοποιήσεις του μοντέλου παραγωγής ή άλλα ιδιόκτητα εσωτερικά στοιχεία. Το χαρτί δοκιμάζει μια αμφίδρομη περιφραγμένη επαναλαμβανόμενη μονάδα σε αυτά τα χαρακτηριστικά και αναφέρει μια περιοχή κάτω από τη χαρακτηριστική καμπύλη λειτουργίας του δέκτη 0,840 στο σύνολο δεδομένων RAGTruth, χρησιμοποιώντας 10 σπόρους. Συγκρίνει αυτό το αποτέλεσμα με μια ανεξάρτητη βασική γραμμή λογιστικής παλινδρόμησης και αναφέρει μια βελτίωση 11 σημείων, με μια τιμή p 0,002 από μια δοκιμή υπογεγραμμένης κατάταξης Wilcoxon.

Το έγγραφο αναφέρει επίσης πειράματα ελεγχόμενης αποσύνθεσης που προορίζονται να διαχωρίσουν την τιμή της χρονικής τάξης από την τιμή ενός πιο ισχυρού μοντέλου. Η ερμηνεία του είναι ότι το μεγαλύτερο μέρος του κέρδους προέρχεται από τη χρονική δομή και όχι από τη χωρητικότητα του μοντέλου: οι θέσεις με αυτοπεποίθηση μπορούν να περάσουν στοιχεία σε διφορούμενες γειτονικές θέσεις μέσα σε ένα παραισθησιακό διάστημα. Το ίδιο ανώτατο όριο απόδοσης περίπου 0,845 αναφέρεται σε επαναλαμβανόμενες αρχιτεκτονικές, χώρο κατάστασης και προσοχής, συμπεριλαμβανομένου του Mamba και των μοντέλων που βασίζονται στην προσοχή. Οι συγγραφείς χρησιμοποιούν αυτό το επαναλαμβανόμενο ανώτατο όριο για να υποστηρίξουν ότι ο περιοριστικός παράγοντας είναι το επιλεγμένο σύνολο χαρακτηριστικών, όχι η συγκεκριμένη αρχιτεκτονική ακολουθίας.

Η πηγή ισχυρίζεται περαιτέρω ότι ο ανιχνευτής μπορεί να λειτουργήσει σε κείμενο που δημιουργείται από μοντέλα κλειστού κώδικα επειδή διαβάζει μόνο κείμενο που δημιουργείται και εξωτερικά σήματα. Αναφέρει επίσης ότι ο ανιχνευτής συνεχίζει να εργάζεται σε κείμενο από μοντέλα γλώσσας που λείπουν από τα δεδομένα εκπαίδευσης, με λιγότερο από 4% απώλεια στην AUC. Αυτοί είναι ισχυρισμοί που προέκυψαν από μια προεκτύπωση. Η παρεχόμενη πηγή δεν παρέχει τα αξιολογημένα ονόματα μοντέλων, τις λεπτομέρειες κατασκευής δεδομένων, το πρωτόκολλο δοκιμής αμαξοστοιχίας, τη διαδικασία κατωφλίου, την ακρίβεια, την ανάκληση, τη βαθμονόμηση, την καθυστέρηση ή τα παραδείγματα σφάλματος. Επίσης, δεν παρέχει ανεξάρτητη επιβεβαίωση των ευρημάτων.

Στοιχεία πηγής: arxiv.org

Γιατί έχει σημασία

Η προσέγγιση έχει σχεδιαστεί για να λειτουργεί χωρίς πρόσβαση στις εσωτερικές καταστάσεις ενός μοντέλου, κάτι που θα μπορούσε να το κάνει εφαρμόσιμο σε συστήματα κλειστού κώδικα. Εάν το αναφερόμενο αποτέλεσμα διατηρείται εκτός της ρύθμισης αξιολόγησης του χαρτιού, θα μπορούσε να βοηθήσει στον εντοπισμό αμφισβητούμενων διαστημάτων στις επαυξημένες με ανάκτηση απαντήσεων και στην υποστήριξη ροών εργασιών ελέγχου ή επαλήθευσης. Το αποτέλεσμα παραμένει προκαταρκτικό: η πηγή είναι μια προεκτύπωση arXiv και η παρεχόμενη εγγραφή δεν καθορίζει ανεξάρτητη απόδοση αναπαραγωγής ή παραγωγής.

Η πρακτική σημασία είναι το προτεινόμενο μοντέλο πρόσβασης του ανιχνευτή. Πολλές τεχνικές παρακολούθησης μοντέλων εξαρτώνται από εσωτερικές αναπαραστάσεις, πιθανότητες διακριτικών ή άλλες πληροφορίες που είναι διαθέσιμες μόνο στον χειριστή του μοντέλου. Ένας ανιχνευτής που βασίζεται σε παραγόμενο κείμενο και εξωτερικά σήματα θα μπορούσε, καταρχήν, να τοποθετηθεί γύρω από ένα μοντέλο του οποίου τα εσωτερικά δεν είναι προσβάσιμα. Αυτό καθιστά την ιδέα σχετική με οργανισμούς που χρησιμοποιούν μοντέλα φιλοξενίας γλώσσας, αν και η πηγή δεν δείχνει ότι έχει ενσωματωθεί σε μια ζωντανή υπηρεσία ή έχει δοκιμαστεί υπό την κυκλοφορία παραγωγής.

Το πλαίσιο που βασίζεται σε ακολουθία αντιμετωπίζει επίσης έναν πραγματικό περιορισμό στη σύγκριση του χαρτιού: ένα διακριτικό που φαίνεται συνηθισμένο μεμονωμένα μπορεί να αποτελεί μέρος μιας μεγαλύτερης μη υποστηριζόμενης αξίωσης. Η χρήση γειτονικών αποδεικτικών στοιχείων θα μπορούσε να επιτρέψει σε ένα σύστημα να επισημάνει ένα απόσπασμα για έλεγχο αντί να παρουσιάζει μια μακρά λίστα με αποσυνδεδεμένες βαθμολογίες διακριτικών. Σε μια ροή εργασίας επαυξημένης ανάκτησης, ένα τέτοιο σήμα θα μπορούσε να χρησιμοποιηθεί για να ζητήσει πρόσθετα στοιχεία, να δρομολογήσει μια απάντηση σε έναν άνθρωπο ή να καταστείλει ένα εξαιρετικά αβέβαιο διάστημα. Αυτές είναι πιθανές εφαρμογές που συνάγονται από τη μέθοδο, όχι αναπτύξεις που αποδεικνύονται από την πηγή.

Η αναφερόμενη βελτίωση AUC είναι αξιοσημείωτη στο αναφερόμενο πείραμα επειδή υποδηλώνει ότι η παραγγελία πληροφοριών μπορεί να έχει μεγαλύτερη σημασία από την απλή αντικατάσταση μιας γραμμικής γραμμής βάσης με έναν μεγαλύτερο ανιχνευτή. Το ανώτατο όριο διασταυρούμενης αρχιτεκτονικής είναι επίσης χρήσιμο ως εύρημα έρευνας: εάν διαφορετικές κατηγορίες μοντέλων συγκλίνουν κοντά στην ίδια βαθμολογία, η προσθήκη χωρητικότητας από μόνη της μπορεί να μην αντιμετωπίσει τα υπόλοιπα σφάλματα. Η εξήγηση της ίδιας της εργασίας δείχνει προς τη βελτίωση των υποκείμενων σημάτων, όπως η ποιότητα των χαρακτηριστικών συνεπαγόμενης ή έκπληξης, αντί να υποθέσει ότι ένα διαφορετικό μοντέλο ακολουθίας θα λύσει το πρόβλημα.

Τα όρια είναι εξίσου σημαντικά. Μια AUC 0,840 συνοψίζει την απόδοση κατάταξης μεταξύ των ορίων. δεν αναφέρει πόσες παραισθήσεις θα καταγραφούν με λειτουργικό ρυθμό συναγερμού, πόσα σωστά αποσπάσματα θα επισημανθούν λανθασμένα ή αν οι βαθμολογίες του ανιχνευτή έχουν βαθμονομηθεί ως πιθανότητες. Το RAGTruth μπορεί να μην αντιπροσωπεύει κάθε θεματική περιοχή ή μορφή απάντησης. Επειδή το έγκυρο υλικό εδώ είναι μια προεκτύπωση arXiv, το αποτέλεσμα δεν καθορίζεται ανεξάρτητα από την παρεχόμενη εγγραφή. Οι αναγνώστες θα πρέπει να αντιμετωπίζουν το εύρημα ως απόδειξη για περαιτέρω δοκιμές, όχι ως απόδειξη ότι η ανίχνευση παραισθήσεων έχει λυθεί.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Τι να παρακολουθήσετε στη συνέχεια

Οι σημαντικές επόμενες δοκιμές είναι η αναπαραγωγή σε πρόσθετα σύνολα δεδομένων, η αξιολόγηση σε τομείς και οικογένειες μοντέλων και η μέτρηση των ψευδώς θετικών, η βαθμονόμηση και η καθυστέρηση. Η περίληψη της εργασίας δεν προσδιορίζει τα αξιολογούμενα μοντέλα, το όριο λειτουργίας του ανιχνευτή, την ακρίβεια ή την ανάκλησή του ή πώς αλλάζει η απόδοση όταν τα στοιχεία είναι ελλιπή, διφορούμενα ή αντιφατικά. Αυτές οι λεπτομέρειες θα καθορίσουν εάν η μέθοδος είναι μια χρήσιμη διασφάλιση ή κυρίως ένα αποτέλεσμα αναφοράς.

Η αναπαραγωγή πρέπει να ξεκινά με το ακριβές πρωτόκολλο του χαρτιού και στη συνέχεια να το επεκτείνει. Οι ερευνητές θα πρέπει να αναφέρουν αποτελέσματα σε πολλαπλά σύνολα δεδομένων παραισθήσεων, να τεκμηριώνουν τα γλωσσικά μοντέλα που χρησιμοποιούνται για τη δημιουργία και την αξιολόγηση κειμένου και να ελέγχουν τομείς όπου τα σφάλματα έχουν διαφορετικές συνέπειες. Οι συγκρίσεις θα πρέπει να περιλαμβάνουν απλές λεξικές και βασικές γραμμές, βαθμονομημένους ταξινομητές και μεθόδους που χρησιμοποιούν εσωτερικές πληροφορίες μοντέλου όταν αυτές οι πληροφορίες είναι διαθέσιμες. Το βασικό ερώτημα είναι εάν το αναφερόμενο κέρδος επιβιώνει από αλλαγές σε δεδομένα, γεννήτριες και πρακτικές σχολιασμού.

Οι λειτουργικές μετρήσεις θα έχουν τόση σημασία όσο και η συνολική AUC. Οι μελλοντικές αξιολογήσεις θα πρέπει να δημοσιεύουν ακρίβεια και ανάκληση σε συγκεκριμένα όρια συναγερμού, καμπύλες βαθμονόμησης, επικάλυψη επιπέδου εύρους με ανθρώπινες ετικέτες και το χρόνο και το κόστος υπολογισμού για την παραγωγή κάθε απόφασης. Ένας ανιχνευτής που προσδιορίζει ευρείες περιοχές αλλά δεν μπορεί να διακρίνει μια αβλαβή αβεβαιότητα από μια επακόλουθη ψευδή δήλωση μπορεί να είναι δύσκολο να χρησιμοποιηθεί. Η πηγή δεν αναφέρει εάν η μέθοδος προορίζεται για ανίχνευση ροής, αναθεώρηση μετά τη γενιά ή και τα δύο, επομένως ο λανθάνοντας χρόνος ανάπτυξης και το σημείο στο οποίο ένα σύστημα μπορεί να παρέμβει παραμένουν άγνωστα.

Οι δοκιμές ευρωστίας θα πρέπει να εξετάζουν ελλιπή στοιχεία ανάκτησης, αντιφατικές πηγές, παραφρασμένους ισχυρισμούς, μεγάλες απαντήσεις και σκόπιμα κατασκευασμένο κείμενο. Εφόσον ο ανιχνευτής χρησιμοποιεί εξωτερικά σήματα, η ποιότητα και η ανεξαρτησία αυτών των σημάτων ενδέχεται να ελέγχουν την απόδοση. Ένα μοντέλο γλώσσας θα μπορούσε επίσης να αλλάξει το στυλ, τη βαθμονόμηση ή τα μοτίβα σφάλματος μετά την ανάπτυξη, αποδυναμώνοντας ενδεχομένως έναν ανιχνευτή που έχει εκπαιδευτεί σε παλαιότερες εξόδους. Η εργασία αναφέρει λιγότερο από 4% απώλεια AUC σε μη εμφανή μοντέλα γλώσσας, αλλά η παρεχόμενη περίληψη δεν ορίζει τον διαχωρισμό του μοντέλου ή δεν δείχνει εάν αυτό το αποτέλεσμα επεκτείνεται σε αόρατους τομείς και μεταβαλλόμενα συστήματα ανάκτησης.

Τέλος, το επαναλαμβανόμενο ανώτατο όριο απόδοσης του χαρτιού αξίζει να εξεταστεί. Μπορεί να υποδεικνύει ένα πραγματικό όριο στις τρεις οικογένειες σημάτων ή μπορεί να αντικατοπτρίζει το σύνολο δεδομένων, τις ετικέτες ή τον πειραματικό σχεδιασμό. Το πλήρες έγγραφο θα πρέπει να διευκρινίζει πώς επισημαίνονται τα εύρη παραισθήσεων, πώς επιλέγονται τα στοιχεία και εάν οποιαδήποτε πληροφορία από το σύνολο αξιολόγησης μπορεί να διαρρεύσει στα χαρακτηριστικά. Ανεξάρτητες υλοποιήσεις και προοπτικές δοκιμές σε πραγματικές απαντήσεις που αντιμετωπίζουν οι χρήστες θα παρείχαν ισχυρότερα στοιχεία από τις πρόσθετες αρχιτεκτονικές αντικαταστάσεις. Μέχρι τότε, το πιο επακόλουθο άγνωστο δεν είναι αν ο ανιχνευτής μπορεί να κατατάξει παραδείγματα στο αναφερόμενο σημείο αναφοράς, αλλά αν μπορεί να βελτιώσει αξιόπιστα τις αποφάσεις στις ρυθμίσεις όπου οι μη υποστηριζόμενες δηλώσεις μοντέλων προκαλούν πρακτικό κακό.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIChatGPT και LLMΕκπαίδευση AIΗθική του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μας
Βρήκατε αυτό χρήσιμο;