ΟΔΗΓΟΣ Κοινωνίας

Δηλητηρίαση δεδομένων και επιθέσεις στην κερκόπορτα

Η δηλητηρίαση δεδομένων καταστρέφει ένα μοντέλο παραβιάζοντας τα δεδομένα εκπαίδευσης του και οι επιθέσεις σε κερκόπορτα κρύβουν ένα μυστικό έναυσμα που κάνει το μοντέλο να συμπεριφέρεται λανθασμένα κατόπιν εντολής.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Βαθιά κατάδυση

Οι επιθέσεις δηλητηρίασης χωρίζονται σε δύο γενικούς στόχους. Οι επιθέσεις διαθεσιμότητας στοχεύουν στην υποβάθμιση της συνολικής ακρίβειας με την ένεση παραδειγμάτων με εσφαλμένη επισήμανση ή κατεστραμμένα. Οι στοχευμένες επιθέσεις και οι επιθέσεις κερκόπορτας είναι πιο ύπουλες: το μοντέλο αποδίδει τέλεια σε κανονικές εισόδους, αλλά παράγει μια έξοδο επιλεγμένη από τον εισβολέα κάθε φορά που εμφανίζεται μια κρυφή ενεργοποίηση, όπως ένα μικρό patch pixel, μια συγκεκριμένη φράση ή ένα αόρατο υδατογράφημα. Η εργασία του BadNets έδειξε έναν ταξινομητή πινακίδας στοπ που διαβάζει μια πινακίδα με αυτοκόλλητο ως «όριο ταχύτητας». Τα σύγχρονα συστήματα εκτίθενται επειδή εκπαιδεύονται σε δεδομένα κλίμακας ιστού. Οι ερευνητές απέδειξαν ότι η αγορά ληγμένων τομέων πίσω από ένα μικρό κλάσμα διευθύνσεων URL δεδομένων θα μπορούσε να δηλητηριάσει δημοφιλή σύνολα δεδομένων εικόνων για μερικές εκατοντάδες δολάρια. Τα μοντέλα γλώσσας μπορούν επίσης να παραμείνουν πίσω μέσω δηλητηριασμένων δεδομένων λεπτομέρειας ή παραδειγμάτων οδηγιών.

Τεχνική διορατικότητα

Μια κερκόπορτα καθαρής ετικέτας είναι ιδιαίτερα επικίνδυνη: τα δηλητηριασμένα δείγματα διατηρούν τις σωστές ετικέτες και φαίνονται φυσιολογικά στους ανθρώπους που αναθεωρούν, ωστόσο ενσωματώνουν μια λειτουργία ενεργοποίησης που το μοντέλο μαθαίνει να συσχετίζει με μια κατηγορία-στόχο. Συμπερασματικά, η παρουσίαση της σκανδάλης αντιστρέφει την πρόβλεψη ενώ η καθαρή ακρίβεια παραμένει υψηλή, επομένως η τυπική επικύρωση δεν την πιάνει ποτέ. Οι άμυνες περιλαμβάνουν ομαδοποίηση ενεργοποίησης, φασματικές υπογραφές, ανακατασκευή ενεργοποίησης και ελέγχους προέλευσης δεδομένων.

Στρατηγικός αντίκτυπος

Κίνδυνος και ασφάλεια

Οι καταστροφικές και οι καθημερινές βλάβες της τεχνητής νοημοσύνης εξαρτώνται από το ποιος κατανοεί τους κινδύνους και ποιος μπορεί να δράσει.

Σαφέστερες αποφάσεις

Ο δημόσιος και επαγγελματικός γραμματισμός διαμορφώνει εάν είναι πολιτικά δυνατή η ισχυρή πολιτική ασφάλειας.

Κόβοντας τη διαφημιστική εκστρατεία

Οι σαφείς εξηγήσεις μειώνουν τη λήψη από διαφημιστική εκστρατεία, εργαστηριακές σχέσεις δημοσίων σχέσεων και αόριστες θεατρικές ηθικές.

Το μέλλον της δηλητηρίασης δεδομένων και των επιθέσεων στην πόρτα

Καθώς οι αλυσίδες εφοδιασμού βασίζονται σε αποκομμένα δεδομένα, προεκπαιδευμένα βάρη και τελειοποίηση τρίτων, η δηλητηρίαση μετατοπίζεται από τη θεωρία σε μια πραγματική απειλή της εφοδιαστικής αλυσίδας. Αναμένετε πρότυπα υπογραφής δεδομένων και προέλευσης, πιστοποιημένη εκπαίδευση στιβαρότητας που περιορίζει τη ζημιά από έναν σταθερό αριθμό δηλητηριασμένων σημείων και συνεχή σάρωση πλαισίων μοντέλων πριν από την ανάπτυξη. Οι ρυθμιστικές αρχές και τα πλαίσια ασφαλείας όπως το MITER ATLAS αρχίζουν να αντιμετωπίζουν τη δηλητηρίαση ως πρώτης τάξεως κίνδυνο μηχανικής μάθησης.

Υλοποίηση σε πραγματικό κόσμο

Ένα μοντέλο όρασης για αυτοοδηγούμενα αυτοκίνητα που διαβάζουν λάθος μια πινακίδα στάσης ως σήμα ορίου ταχύτητας όταν υπάρχει μια μικρή σκανδάλη με αυτοκόλλητο

Δηλητηρίαση ενός συνόλου δεδομένων δημόσιας εικόνας με φθηνό κόστος με την παραβίαση ληγμένων τομέων που φιλοξενούν ένα κλάσμα των διευθύνσεων URL εικόνων του

Το backdooring ενός μοντέλου συμπλήρωσης κώδικα, ώστε μια κρυφή φράση προτροπής να το κάνει να εισάγει μη ασφαλή κώδικα

Καταστροφή των σχολίων εκπαίδευσης από πλήθος προέλευσης ενός φίλτρου ανεπιθύμητης αλληλογραφίας, ώστε να περνούν συγκεκριμένα κακόβουλα μηνύματα ηλεκτρονικού ταχυδρομείου

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Αντιμετώπιση του υπαρξιακού κινδύνου ως ενώσεις επιστημονικής φαντασίας και ικανότητας.

Συγχέοντας την ασφάλεια του προϊόντος της επιφάνειας με την ευθυγράμμιση υπό υψηλή αυτονομία.

Αφήνοντας μη αγγλικά και μη εξειδικευμένα είδη κοινού με πηγές μόνο χαμηλής ποιότητας.

Οδικός Χάρτης Εφαρμογής

1

Ξεχωρίστε τους κινδύνους βλαβών, κακής χρήσης και απώλειας ελέγχου / κακής ευθυγράμμισης του προϊόντος.

2

Ρωτήστε ποια στοιχεία θα άλλαζαν την άποψή σας για τα χρονοδιαγράμματα και τη σοβαρότητα.

3

Προτιμήστε τις πρωτογενείς πηγές και τις συγκεκριμένες αξιολογήσεις έναντι των ισχυρισμών μάρκετινγκ.

4

Προσδιορίστε ένα μονοπάτι δράσης: καριέρα, πολιτική, χρηματοδότηση ή δεξιότητες — όχι μόνο ευαισθητοποίηση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is Data Poisoning and Backdoor Attacks?

Η δηλητηρίαση δεδομένων καταστρέφει ένα μοντέλο παραβιάζοντας τα δεδομένα εκπαίδευσης του και οι επιθέσεις σε κερκόπορτα κρύβουν ένα μυστικό έναυσμα που κάνει το μοντέλο να συμπεριφέρεται λανθασμένα κατόπιν εντολής. Έχουν σημασία επειδή τα μοντέλα μαθαίνουν ολοένα και περισσότερο από δεδομένα που συλλέγονται από πλήθος, τα οποία οι εισβολείς μπορούν να μολύνουν αθόρυβα.

Τι διακρίνει μια επίθεση κερκόπορτας από μια επίθεση δηλητηρίασης γενικής διαθεσιμότητας;

Τα μοντέλα με οπίσθια πόρτα ενεργούν κανονικά σε καθαρές εισόδους και παράγουν την έξοδο στόχο του εισβολέα μόνο όταν εμφανιστεί η κρυφή σκανδάλη.

Γιατί είναι δύσκολο να εντοπιστούν οι επιθέσεις κερκόπορτας καθαρής ετικέτας;

Επειδή τα δηλητηριασμένα παραδείγματα έχουν σωστές ετικέτες και εμφανίζονται συνηθισμένα, η ανθρώπινη αναθεώρηση και η τυπική ακρίβεια επικύρωσης δεν τα επισημαίνουν.

Τι απέδειξε περίφημα η έρευνα του BadNets;

Το BadNets έδειξε έναν ταξινομητή πινακίδων κυκλοφορίας με οπίσθια πόρτα που διαβάζει εσφαλμένα τα σημάδια στάσης που επισημαίνονται με ένα μικρό αυτοκόλλητο.

Πώς έδειξαν οι ερευνητές τα σύνολα δεδομένων κλίμακας ιστού θα μπορούσαν να δηλητηριαστούν φτηνά;

Επειδή τα σύνολα δεδομένων αναφέρονται σε εικόνες κατά διεύθυνση URL, η αγορά τομέων που έχουν λήξει επιτρέπει στους εισβολείς να ελέγχουν αυτές τις εικόνες με μικρό κόστος.

Ποιο από αυτά είναι μια αναγνωρισμένη άμυνα έναντι επιθέσεων από κερκόπορτα;

Οι άμυνες αναλύουν τις εσωτερικές ενεργοποιήσεις για να διαχωρίσουν τα δηλητηριασμένα από τα καθαρά παραδείγματα, μεταξύ άλλων μεθόδων ανίχνευσης.