Επιστροφή στις Ειδήσεις
ΑσφάλειαAI Understanding ενημέρωση

Η προεκτύπωση διαπιστώνει ότι η πειθώ μπορεί να εξαπλωθεί μέσω δικτύων πρακτόρων LLM

Μια νέα προεκτύπωση αναφέρει ότι τα άμεσα μηνύματα και οι ομότιμες αναμεταδόσεις μπορούν να αλλάξουν τις θέσεις των πρακτόρων του μοντέλου γλώσσας και υποστηρίζει ότι οι αξιολογήσεις πρέπει να παρακολουθούν τα ιστορικά έκθεσης και τις ενέργειες, όχι μόνο το κείμενο.

5 min readRead the primary source
Primary-source image accompanying Preprint finds persuasion can spread through LLM agent networks
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
arxiv.org
Σύνδεσμος πηγής
arxiv.orghttps://arxiv.org/abs/2608.25152
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Μεγάλο μοντέλο γλώσσας (LLM)
Ένα μοντέλο γλώσσας εκπαιδευμένο σε τεράστια σώματα κειμένου για τη δημιουργία και ανάλυση κειμένου.
Δοκιμάστε τον εαυτό σαςΚουίζ για πράκτορες AI

Τι έγινε

Ένα έγγραφο που υποβλήθηκε στο arXiv στις 25 Αυγούστου εξετάζει τον τρόπο με τον οποίο οι πράκτορες μοντέλων γλώσσας πείθουν ο ένας τον άλλον σε δικτυωμένα συστήματα πολλαπλών πρακτόρων. Η ελεγχόμενη δοκιμαστική του βάση κάλυπτε τέσσερις κορμούς LLM, πέντε δομές γραφημάτων και 55 δηλώσεις πολιτικής. Οι συγγραφείς αναφέρουν ότι η πειθώ διέφερε ανάλογα με την τοπολογία του δικτύου, τον ανταγωνισμό, το θέμα και την προηγούμενη θέση κάθε μοντέλου.

Η πηγή περιγράφει την πειθώ μεταξύ πρακτόρων μεγάλων γλωσσικών μοντέλων ως μια ολοένα πιο σημαντική αλλά υπομετρημένη ικανότητα. Οι συγγραφείς έχτισαν ένα ελεγχόμενο πεδίο δοκιμών στο οποίο ορισμένοι πράκτορες ήταν πείθοντες με στόχο και άλλοι μπορούσαν να λάβουν, να αναμεταδώσουν ή να απαντήσουν σε πληροφορίες. Τα δίκτυα βασίστηκαν σε τοπολογίες δικτύων εγώ του πραγματικού κόσμου, σύμφωνα με την περίληψη, αλλά η πηγή που παρέχεται εδώ δεν εξηγεί την ακριβή κατασκευή γραφήματος ή το πρωτόκολλο αλληλεπίδρασης.

Σε τέσσερις βασικούς άξονες LLM, πέντε γραφήματα και 55 δηλώσεις πολιτικής, το έγγραφο αναφέρει ότι η δυναμική πειθούς εξαρτιόταν από διάφορους αλληλεπιδρώντες παράγοντες. Αυτά περιελάμβαναν την τοπολογία του δικτύου, εάν οι πράκτορες ανταγωνίζονταν, το θέμα που συζητήθηκε και τις προηγούμενες πεποιθήσεις ή τάσεις του μοντέλου. Η περίληψη δεν παρέχει τα μεμονωμένα ονόματα μοντέλων, τον αριθμό των πρακτόρων σε κάθε εκτέλεση ή τα συγκριτικά μεγέθη εφέ για αυτούς τους παράγοντες.

Οι συγγραφείς αναφέρουν ότι η άμεση έκθεση ήταν ένας αξιόπιστος προγνωστικός παράγοντας αλλαγής στάσης στον επόμενο γύρο των ανταγωνιστικών σειρών. Τα μηνύματα που αναμεταδόθηκαν από ομοτίμους είχαν μικρότερη αλλά μετρήσιμη επιρροή. Αυτό το εύρημα παρουσιάζεται ως απόδειξη ότι οι πράκτορες που δεν έχουν ανατεθεί να πείσουν μπορούν ακόμα να μεταδώσουν πειστική δύναμη μέσω του δικτύου, ακόμη και όταν λειτουργούν ως μεσάζοντες και όχι ως η αρχική πηγή ενός επιχειρήματος.

Η εφημερίδα αναφέρει επίσης ένα χάσμα μεταξύ του τι σχεδίαζαν οι πράκτορες, τι είπαν και τι ανίχνευσαν οι ανιχνευτές. Οι προγραμματισμένες στρατηγικές υλοποιήθηκαν μόνο εν μέρει στα εκτελούμενα μηνύματα, οι επιλογές δράσης θα μπορούσαν να αποκλίνουν από το περιεχόμενο του μηνύματος και οι πείθοντες σπάνια δήλωσαν ρητά τις αλλαγές στάσης που ανιχνεύθηκαν από τους ερευνητές. Η περίληψη δεν διευκρινίζει πώς οι ανιχνευτές μέτρησαν την λανθάνουσα ή προκαλούμενη στάση, ούτε πώς οι ερευνητές επικύρωσαν αυτές τις μετρήσεις.

Στοιχεία πηγής: arxiv.org ↗

Γιατί έχει σημασία

Η μελέτη υποδηλώνει ότι το ορατό μήνυμα ενός πράκτορα μπορεί να μην αποκαλύψει πλήρως εάν η υποκείμενη στάση του άλλαξε ή ποιος την επηρέασε. Αυτό έχει σημασία για συστήματα στα οποία οι πράκτορες συζητούν, συντονίζουν την έρευνα, προσομοιώνουν τους χρήστες ή διαμεσολαβούν πληροφορίες, επειδή η επιρροή μπορεί να εξαπλωθεί μέσω πρακτόρων που δεν είχαν ανατεθεί να πείσουν.

Το πρακτικό ζήτημα είναι η παρατηρησιμότητα. Σε μια ενιαία ανταλλαγή chatbot, ένας αναθεωρητής μπορεί να επιθεωρήσει το κείμενο και να κρίνει εάν περιέχει ένα πειστικό επιχείρημα. Σε ένα σύστημα πολλαπλών παραγόντων, ωστόσο, η επιρροή μπορεί να συσσωρευτεί σε κύκλους και μονοπάτια. Ένα μοντέλο μπορεί να αλλάξει την απόκρισή του μετά από άμεση έκθεση, αφού ακούσει ένα ρελέ από άλλο πράκτορα ή αφού επιλέξει μια ενέργεια που δεν αποκαλύπτει ξεκάθαρα την αλλαγή στο γραπτό του μήνυμα.

Αυτή η διάκριση θα μπορούσε να επηρεάσει τον σχεδιασμό και τον έλεγχο συστημάτων πρακτόρων που χρησιμοποιούνται για συζήτηση, συντονισμό έρευνας, προσομοίωση χρήστη και διαμεσολάβηση πληροφοριών. Εάν μια αξιολόγηση καταγράφει μόνο το τελικό κείμενο, μπορεί να χάσει ποιος πράκτορας εισήγαγε μια ισχυρή αξίωση, ποιοι πράκτορες την ενίσχυσαν και αν η τελική ενέργεια αντικατόπτριζε μια αλλαγή που δεν αναγνωρίστηκε ανοιχτά. Επομένως, το επιχείρημα της δημοσίευσης αφορά τη μέτρηση και τη λογοδοσία και όχι τον ισχυρισμό ότι τα αναπτυγμένα συστήματα προκαλούν ήδη ένα συγκεκριμένο δημόσιο περιστατικό.

Ο αναφερόμενος ρόλος της τοπολογίας σχετίζεται επίσης με το σχεδιασμό του συστήματος. Η διάταξη των πρακτόρων καθορίζει ποιος μπορεί να δει ποια μηνύματα και πώς μπορούν να ταξιδέψουν οι πληροφορίες. Εάν η δομή του δικτύου αλλάξει τα αποτελέσματα πειθούς, τότε η προσθήκη πρακτόρων ή η αλλαγή των συνδέσμων επικοινωνίας τους θα μπορούσε να αλλάξει τη συμπεριφορά ακόμη και όταν τα υποκείμενα μοντέλα και οι προτροπές παραμένουν ίδια. Η πηγή δεν καθορίζει ποια τοπολογία είναι πιο ασφαλής ή πιο ανθεκτική σε χειρισμούς.

Τα ευρήματα παρουσιάζονται ως ισχυρισμοί έρευνας από μια προεκτύπωση arXiv, όχι ως ανεξάρτητα επαληθευμένα στοιχεία κοινωνικής πειθούς στον πραγματικό κόσμο. Η περίληψη δεν παρέχει πληροφορίες σχετικά με την αξιολόγηση από ομοτίμους, την ανθρώπινη επικύρωση, τις συνθήκες ανάπτυξης ή την ανθεκτικότητα των παρατηρούμενων αλλαγών στάσης. Οι αναγνώστες θα πρέπει να αντιμετωπίζουν το έργο ως μια προτεινόμενη κατεύθυνση αξιολόγησης που υποστηρίζεται από τα αναφερόμενα πειράματα, όχι ως μέτρηση του τρόπου συμπεριφοράς των ανθρώπων ή των συστημάτων τεχνητής νοημοσύνης παραγωγής.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Τι να παρακολουθήσετε στη συνέχεια

Το έγγραφο απαιτεί αξιολογήσεις που συνδυάζουν ανιχνευτές πεποιθήσεων, προέλευσης έκθεσης και καταγραφής ενεργειών. Στα σημαντικά άγνωστα περιλαμβάνονται οι ταυτότητες και οι εκδόσεις των δοκιμασμένων μοντέλων, το μέγεθος και η σύνθεση των δικτύων, η ισχύς και η επιμονή των αναφερόμενων αλλαγών στάσης και αν τα ευρήματα μεταφέρονται σε αναπτυγμένα συστήματα ή σε ανθρώπους συμμετέχοντες.

Οι συγγραφείς συνιστούν την αξιολόγηση της πειθούς ως διαδικασίας σε επίπεδο τροχιάς και έκθεσης. Αυτό θα απαιτούσε τη διατήρηση ενός λογαριασμού για το τι συνάντησε κάθε πράκτορας, πότε το συνάντησε και ποιοι άλλοι πράκτορες μετέφεραν τις πληροφορίες. Η προέλευση της έκθεσης θα μπορούσε να βοηθήσει στη διάκριση της άμεσης επιρροής από την επιρροή που μεταδίδεται μέσω πολλών ομότιμων, ενώ τα αρχεία καταγραφής ενεργειών θα μπορούσαν να δείξουν εάν ο πράκτορας ενήργησε διαφορετικά ακόμα και όταν το κείμενό του δεν αποκάλυπτε μια αλλαγμένη στάση.

Οι ανιχνευτές πεποιθήσεων είναι ένας άλλος τομέας που πρέπει να παρακολουθήσετε. Η περίληψη λέει ότι οι πείθοντες σπάνια δήλωναν τις αλλαγές στάσης που εντόπισαν οι ανιχνευτές, υπονοώντας ότι η συνηθισμένη επιθεώρηση κειμένου μπορεί να υποτιμήσει την κίνηση. Η μελλοντική εργασία θα χρειαστεί να καθορίσει εάν αυτοί οι ανιχνευτές μετρούν μια ουσιαστική εσωτερική αλλαγή ή αλλαγή συμπεριφοράς, πόσο σταθερά είναι τα αποτελέσματα σε προτροπές και μοντέλα και εάν οι ίδιοι οι ανιχνευτές μπορούν να παραμορφώσουν την αλληλεπίδραση.

Η πηγή αφήνει ανοιχτό πόσο εξαρτάται το αναφερόμενο αποτέλεσμα από το δοκιμαστικό κρεβάτι. Η εργασία χρησιμοποιεί δηλώσεις πολιτικής και δομές γραφημάτων που βασίζονται σε δίκτυα εγώ του πραγματικού κόσμου, αλλά η περίληψη δεν δηλώνει εάν οι δηλώσεις ήταν πολιτικά ευαίσθητες, πόσο δύσκολες ήταν ή πώς αντιστοιχίστηκαν οι αρχικές θέσεις των πρακτόρων. Επίσης, δεν αναφέρει το μέγεθος των άμεσων και ομότιμων επιδράσεων ή εάν οι αλλαγές παρέμειναν μετά τον επόμενο γύρο.

Θα χρειαστούν περαιτέρω στοιχεία πριν από την εφαρμογή των ευρημάτων σε υψηλά πονταρίσματα. Χρήσιμες δοκιμές παρακολούθησης θα εξέταζαν μεγαλύτερα και πιο μακροχρόνια δίκτυα, διαφορετικές οικογένειες μοντέλων, ποικίλες οδηγίες και πρόσβαση σε εργαλεία και αλληλεπιδράσεις που αφορούν άτομα. Μέχρι να είναι διαθέσιμα αυτά τα αποτελέσματα, το πιο σαφές πρακτικό μάθημα από την πηγή είναι ότι οι έλεγχοι πολλαπλών πρακτόρων πρέπει να διατηρούν τα ιστορικά έκθεσης μηνυμάτων και τα ίχνη δράσης παράλληλα με τα τελικά αποτελέσματα.

Σχετικοί οδηγοί και κουίζ

Πράκτορες AIΗθική του AIΕπεξήγηση μοντέλων AIΤο μέλλον του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε το πρόγραμμα παρακολούθησης ρυθμίσεων AI
Βρήκατε αυτό χρήσιμο;