ΟΔΗΓΟΣ Κοινωνίας

Επιθέσεις εξόρυξης μοντέλου και κλοπής

Οι επιθέσεις εξαγωγής μοντέλων επιτρέπουν σε έναν αντίπαλο να κλωνοποιήσει ένα ιδιόκτητο μοντέλο τεχνητής νοημοσύνης απλώς ρωτώντας το δημόσιο API του και εκπαιδεύοντας έναν αντίγραφο στις απαντήσεις.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Έχει σημασία γιατί οι εταιρείες ξοδεύουν εκατομμύρια μοντέλα εκπαίδευσης που μπορούν να προσεγγιστούν στην τιμή μερικών χιλιάδων κλήσεων API.

Βαθιά κατάδυση

Μια επίθεση εξαγωγής μοντέλου (ή κλοπής μοντέλου) αντιμετωπίζει ένα αναπτυγμένο μοντέλο ως χρησμό. Ο εισβολέας στέλνει εισόδους, καταγράφει τις εξόδους και εκπαιδεύει ένα υποκατάστατο μοντέλο για να μιμηθεί τη συμπεριφορά. Επειδή το ίδιο το μοντέλο-στόχος είναι μια μαθημένη συνάρτηση που αντιστοιχίζει εισόδους σε εξόδους, η αντιγραφή αρκετών ζευγών εισόδου-εξόδου μπορεί να ανακατασκευάσει μια στενή προσέγγιση χωρίς να δει ποτέ τα αρχικά βάρη ή τα δεδομένα εκπαίδευσης. Οι ερευνητές έχουν κλέψει τα όρια απόφασης των ταξινομητών εικόνων και ακόμη και έχουν ανακτήσει ακριβή βάρη μικρών στρωμάτων. Το 2024, μια ομάδα έδειξε ότι τμήματα των στρωμάτων ενσωμάτωσης μοντέλων παραγωγής OpenAI και Google μπορούσαν να εξαχθούν για λιγότερο από μερικές εκατοντάδες δολάρια. Τα κλεμμένα αντίγραφα υπονομεύουν τις πληρωμένες υπηρεσίες, παρακάμπτουν τα φίλτρα ασφαλείας και επιτρέπουν περαιτέρω επιθέσεις λευκού κουτιού, όπως τη δημιουργία παραδειγμάτων αντιπάλου.

Τεχνική διορατικότητα

Όσο πιο πλούσια είναι η απόκριση API, τόσο φθηνότερη είναι η κλοπή. Η επιστροφή διανυσμάτων πλήρους πιθανότητας ή logit διαρρέει πολύ περισσότερες πληροφορίες ανά ερώτημα από ό,τι μια μεμονωμένη ετικέτα top-1, επομένως οι εισβολείς ανασυνθέτουν τα όρια με λιγότερα ερωτήματα. Οι στρατηγικές ενεργητικής μάθησης επιλέγουν τα πιο ενημερωτικά ερωτήματα κοντά στα όρια αποφάσεων. Ένα ορόσημο αποτέλεσμα έδειξε ότι η αναζήτηση ακριβώς πάνω από τον αριθμό των διαστάσεων εξόδου μπορεί να ανακτήσει το τελικό επίπεδο γραμμικής προβολής ακριβώς μέσω της γραμμικής άλγεβρας, καθώς αυτό το επίπεδο είναι ουσιαστικά ένας πίνακας του εύρους των αποκρίσεων.

Στρατηγικός αντίκτυπος

Κίνδυνος και ασφάλεια

Οι καταστροφικές και οι καθημερινές βλάβες της τεχνητής νοημοσύνης εξαρτώνται από το ποιος κατανοεί τους κινδύνους και ποιος μπορεί να δράσει.

Σαφέστερες αποφάσεις

Ο δημόσιος και επαγγελματικός γραμματισμός διαμορφώνει εάν είναι πολιτικά δυνατή η ισχυρή πολιτική ασφάλειας.

Κόβοντας τη διαφημιστική εκστρατεία

Οι σαφείς εξηγήσεις μειώνουν τη λήψη από διαφημιστική εκστρατεία, εργαστηριακές σχέσεις δημοσίων σχέσεων και αόριστες θεατρικές ηθικές.

Το μέλλον της εξαγωγής μοντέλου και των επιθέσεων κλοπής

Οι άμυνες μετατοπίζονται από το μπλοκάρισμα στον εντοπισμό και την υποβάθμιση: περιορισμός ρυθμού, επιστροφή στρογγυλεμένων ή μόνο εξόδων top-1, προσθήκη βαθμονομημένου θορύβου, συμπεριφορά μοντέλου υδατογράφησης ώστε τα κλεμμένα αντίγραφα να μπορούν να ληφθούν δακτυλικά αποτυπώματα και παρακολούθηση μοτίβων ερωτημάτων για υπογραφές εξαγωγής. Αναμένετε κανονισμούς και όρους αδειοδότησης που αντιμετωπίζουν την εξόρυξη ως κλοπή, καθώς και την ενεργό έρευνα σε αρχιτεκτονικές που αποδεδειγμένα δύσκολα εξάγονται. Καθώς τα μοντέλα μεγαλώνουν, η πλήρης εκχύλιση παραμένει δαπανηρή, αλλά η μερική εκχύλιση πολύτιμων συστατικών και η κλωνοποίηση τύπου απόσταξης θα παραμείνουν μια επίμονη εμπορική απειλή και απειλή για την ασφάλεια.

Υλοποίηση σε πραγματικό κόσμο

Μια εκκίνηση ερωτά χιλιάδες φορές το API αναγνώρισης εικόνας επί πληρωμή ενός ανταγωνιστή και εκπαιδεύει έναν δωρεάν κλώνο που αναπαράγει την ακρίβειά του.

Οι ερευνητές ασφαλείας εξάγουν το τελικό επίπεδο ενσωμάτωσης-προβολής ενός μοντέλου γλώσσας παραγωγής χρησιμοποιώντας προσεκτικά δημιουργημένα ερωτήματα API που κοστίζουν μόνο μερικές εκατοντάδες δολάρια.

Ένας εισβολέας κλωνοποιεί έναν ταξινομητή ανεπιθύμητης αλληλογραφίας ή απάτης τοπικά, ώστε να μπορεί να τον ερευνήσει εκτός σύνδεσης και να δημιουργήσει εισόδους που αποφεύγουν αξιόπιστα τον εντοπισμό.

Ένας προμηθευτής cloud προσθέτει παρακολούθηση ρυθμού ερωτήματος που επισημαίνει έναν λογαριασμό του οποίου το μοτίβο πρόσβασης ταιριάζει με την εξαγωγή ενεργού μάθησης και μειώνει τις απαντήσεις του.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Αντιμετώπιση του υπαρξιακού κινδύνου ως ενώσεις επιστημονικής φαντασίας και ικανότητας.

Συγχέοντας την ασφάλεια του προϊόντος της επιφάνειας με την ευθυγράμμιση υπό υψηλή αυτονομία.

Αφήνοντας μη αγγλικά και μη εξειδικευμένα είδη κοινού με πηγές μόνο χαμηλής ποιότητας.

Οδικός Χάρτης Εφαρμογής

1

Ξεχωρίστε τους κινδύνους βλαβών, κακής χρήσης και απώλειας ελέγχου / κακής ευθυγράμμισης του προϊόντος.

2

Ρωτήστε ποια στοιχεία θα άλλαζαν την άποψή σας για τα χρονοδιαγράμματα και τη σοβαρότητα.

3

Προτιμήστε τις πρωτογενείς πηγές και τις συγκεκριμένες αξιολογήσεις έναντι των ισχυρισμών μάρκετινγκ.

4

Προσδιορίστε ένα μονοπάτι δράσης: καριέρα, πολιτική, χρηματοδότηση ή δεξιότητες — όχι μόνο ευαισθητοποίηση.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Επιθέσεις συμπερασμάτων μέλους

Συχνές ερωτήσεις

Τι είναι το Model Extraction and Stealing Attacks;

Οι επιθέσεις εξαγωγής μοντέλων επιτρέπουν σε έναν αντίπαλο να κλωνοποιήσει ένα ιδιόκτητο μοντέλο τεχνητής νοημοσύνης απλώς ρωτώντας το δημόσιο API του και εκπαιδεύοντας έναν αντίγραφο στις απαντήσεις. Έχει σημασία γιατί οι εταιρείες ξοδεύουν εκατομμύρια μοντέλα εκπαίδευσης που μπορούν να υπολογιστούν κατά προσέγγιση για την τιμή μερικών χιλιάδων κλήσεων API.

Ποια είναι η βασική ιδέα πίσω από μια επίθεση εξαγωγής μοντέλου;

Το Extraction αντιμετωπίζει το αναπτυγμένο μοντέλο ως χρησμό: ο εισβολέας συλλέγει ζεύγη εισόδου-εξόδου και εκπαιδεύει ένα μοντέλο αντιγραφής για να μιμηθεί τη συμπεριφορά, χωρίς ποτέ να έχει πρόσβαση στα αρχικά βάρη.

Γιατί η επιστροφή διανυσμάτων πλήρους πιθανότητας κάνει την εξαγωγή ευκολότερη από την επιστροφή μόνο μιας ετικέτας top-1;

Κάθε διάνυσμα πλήρους πιθανότητας αποκαλύπτει πολύ περισσότερα για την εσωτερική επιφάνεια απόφασης του μοντέλου από μια μεμονωμένη ετικέτα, επιτρέποντας στον εισβολέα να ανακατασκευάσει το όριο με λιγότερα ερωτήματα.

Ποια αμυντική τεχνική μειώνει άμεσα τις πληροφορίες που διαρρέουν ανά ερώτημα;

Η χονδροειδής έξοδος, για παράδειγμα η επιστροφή μόνο της επάνω ετικέτας ή οι στρογγυλεμένες πιθανότητες, μειώνει το σήμα που δίνει κάθε απάντηση στον εισβολέα, αυξάνοντας το κόστος εξαγωγής.

Ένα αποτέλεσμα του 2024 έδειξε ότι οι εισβολείς μπορούσαν να ανακτήσουν ακριβώς ποιο μέρος ενός μοντέλου γλώσσας παραγωγής φθηνά;

Οι ερευνητές απέδειξαν ότι το τελικό στρώμα γραμμικής προβολής θα μπορούσε να ανακτηθεί ακριβώς για μερικές εκατοντάδες δολάρια, επειδή οι αποκρίσεις του εκτείνονται σε μια ανακτήσιμη μήτρα.

Γιατί ένα κλεμμένο υποκατάστατο είναι επικίνδυνο πέρα από τα απλά χαμένα έσοδα;

Μόλις οι εισβολείς αποκτήσουν ένα τοπικό αντίγραφο, μπορούν να το διερευνήσουν ελεύθερα για να σχεδιάσουν αντίθετες εισόδους ή επιθέσεις αποφυγής που επίσης ξεγελούν το αρχικό αναπτυγμένο σύστημα.