Επιστροφή στις Ειδήσεις
ΑσφάλειαAI Understanding ενημέρωση

Το σημείο αναφοράς AWS βρίσκει τον ασφαλή κωδικό σημαίας των ανιχνευτών ευπάθειας AI

Το Help Net Security αναφέρει ότι το AWS εξέτασε 12 μοντέλα τεχνητής νοημοσύνης σε ένα σημείο αναφοράς σχεδιασμένο να διακρίνει τις εκμεταλλεύσιμες ευπάθειες από τον ασφαλή κώδικα που φαίνεται μόνο επικίνδυνος. Κανένα δεν πληρούσε το δηλωμένο όριο παραγωγής του AWS τόσο για ψευδώς θετικά όσο και για ψευδώς αρνητικά ποσοστά.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Αναφορά πηγήςΗ πηγή καταγράφηκε
Εκδότης
helpnetsecurity.com
Σύνδεσμος πηγής
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Τύπος πηγής
Συνδεδεμένη πηγή — η κατάσταση της κύριας πηγής δεν έχει καθοριστεί.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Σημείο αναφοράς
Μια τυποποιημένη δοκιμή ή σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση και τη σύγκριση της απόδοσης του μοντέλου.
Ακρίβεια
Το ποσοστό των προβλεπόμενων θετικών που είναι πραγματικά σωστά.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Το Help Net Security αναφέρει ότι το AWS κυκλοφόρησε δημόσια το Deception , το οποίο ελέγχει εάν τα μοντέλα τεχνητής νοημοσύνης μπορούν να διακρίνουν τις γνήσιες ευπάθειες λογισμικού από τον ασφαλή κώδικα που περιέχει παραπλανητικά μοτίβα ευπάθειας. Το σημείο αναφοράς περιλαμβάνει 14.822 δείγματα που καλύπτουν 16 γλώσσες προγραμματισμού και περισσότερες από 70 κατηγορίες CWE. 9.695 βαθμολογούνται και 5.127 αναμειγνύονται ως μη βαθμολογημένα δείγματα.

Η Help Net Security αναφέρει ότι η AWS αξιολόγησε 12 μοντέλα γενικής χρήσης από πέντε παρόχους χρησιμοποιώντας ένα σημείο αναφοράς σχεδιασμένο γύρω από ψευδώς θετικά. Τα ασφαλή παραδείγματα του δείκτη αναφοράς περιέχουν πραγματικά μοτίβα ευπάθειας παράλληλα με προστασίες που αποτρέπουν την εκμετάλλευση. Ορισμένες προκλήσεις ποικίλλουν τις συνθήκες ανάπτυξης, όπως οι πολιτικές δικτύου Kubernetes, επομένως ένα μοντέλο πρέπει να λαμβάνει υπόψη τόσο τον κώδικα όσο και το περιβάλλον του.

Σύμφωνα με την έκθεση, το AWS δημιούργησε και βελτίωσε παραδείγματα έναντι μοντέλων συνόρων, εξαιρουμένων δειγμάτων που ήταν πολύ εύκολο να ταξινομηθούν. Ο AWS λέει ότι αυτή η διαδικασία κατανάλωσε δεκάδες δισεκατομμύρια μάρκες. Η εταιρεία δημοσιεύει τα δείγματα αλλά αποκρύπτει τις ετικέτες τους. Οι χρήστες υποβάλλουν προβλέψεις στο AWS για επαληθευμένη βαθμολογία. Η πηγή δεν δηλώνει εάν η πρόσβαση στη βαθμολογία συνεπάγεται χρέωση ή άλλες απαιτήσεις καταλληλότητας.

Το Help Net Security αναφέρει ότι ανεξάρτητοι αναθεωρητές ελέγχουν τις ετικέτες χωρίς να βλέπουν ο ένας τις αποφάσεις του άλλου ή το αρχικό σκεπτικό. Τα αμφισβητούμενα δείγματα ελέγχονται περαιτέρω και οι ανεπίλυτες υποθέσεις μεταφέρονται στο μη βαθμολογημένο σύνολο. Ο AWS λέει ότι λιγότερο από το 3% των δειγμάτων που βαθμολογήθηκαν παραμένουν αμφισβητούμενα μετά την ανασκόπηση, με στόχο λιγότερο από 1% επιζών από ανθρώπινη επανεξέταση και δεν αναφέρει σφάλματα επισήμανσης σε μια ανασκόπηση 100 τυχαία επιλεγμένων δειγμάτων βαθμολογίας. Αυτοί οι ισχυρισμοί δεν έχουν επιβεβαιωθεί ανεξάρτητα εδώ.

Στοιχεία πηγής: helpnetsecurity.com ↗

Γιατί έχει σημασία

Τα αποτελέσματα υποδηλώνουν ότι η υψηλή απόδοση στην εύρεση ύποπτου κώδικα δεν μεταφράζεται απαραίτητα σε αξιόπιστη διαλογή ευπάθειας. Τα υψηλά ποσοστά ψευδώς θετικών μπορούν να επιβαρύνουν τις ομάδες ασφαλείας και να αποδυναμώσουν την εμπιστοσύνη στις ειδοποιήσεις, ενώ οι αυστηρότερες απαιτήσεις απόδειξης μπορεί να κάνουν τα μοντέλα να χάνουν πραγματικές ευπάθειες. Τα ευρήματα σχετίζονται με οργανισμούς που εξετάζουν το ενδεχόμενο αναθεώρησης κώδικα με τη βοήθεια τεχνητής νοημοσύνης ή λειτουργιών ασφαλείας, αλλά δεν μετρούν πλήρη εμπορικά προϊόντα ασφάλειας.

Το σημείο αναφοράς αντιμετωπίζει μια πρακτική αδυναμία στην ασφάλεια που υποστηρίζεται από AI: ένα μοντέλο μπορεί να αναγνωρίσει ένα επικίνδυνο μοτίβο χωρίς να κατανοεί τους ελέγχους που εμποδίζουν την εκμετάλλευση. Το Help Net Security αναφέρει ότι η άμεση προτροπή παρήγαγε ψευδώς θετικά ποσοστά από 41% έως 99%, ενώ η ακρίβεια κυμαινόταν από 52% έως 71%.

Ζητώντας από τα μοντέλα να αποδείξουν ότι μια ευπάθεια θα μπορούσε πράγματι να γίνει εκμετάλλευση μείωσε τα ψευδώς θετικά κατά 17 έως 74 ποσοστιαίες μονάδες, σύμφωνα με την έκθεση, αλλά αύξησε τα ψευδώς αρνητικά ποσοστά μεταξύ 7% και 44%. Η δηλωμένη ελάχιστη μπάρα παραγωγής του AWS ήταν κάτω από 10% και για τα δύο μέτρα και καμία από τις δοκιμασμένες διαμορφώσεις δεν πληρούσε και τα δύο κατώφλια.

Αυτά τα αποτελέσματα δεν πρέπει να διαβάζονται ως κατάταξη πλήρων προϊόντων ασφαλείας. Το AWS δοκίμασε τις προτροπές μίας στροφής σε μοντέλα γενικής χρήσης, όχι ειδικά κατασκευασμένα συστήματα που χρησιμοποιούν εργαλεία, επαναλαμβανόμενη επικύρωση ή ροές εργασίας αντιπροσώπων. Ως εκ τούτου, η πηγή υποστηρίζει την προσοχή σχετικά με τις κρίσεις ευπάθειας σε επίπεδο μοντέλου και όχι το συμπέρασμα ότι τα προϊόντα ασφάλειας τεχνητής νοημοσύνης στο σύνολό τους αποτυγχάνουν.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Παρακολουθήστε ανεξάρτητες αξιολογήσεις χρησιμοποιώντας τα δείγματα που κυκλοφόρησαν, αποτελέσματα από συστήματα ασφαλείας που χρησιμοποιούν εργαλεία ή πολλαπλά βήματα και στοιχεία σχετικά με την απόδοση σε πραγματικά περιβάλλοντα παραγωγής. Η πηγή δεν τεκμηριώνει την τιμολόγηση, την πρόσβαση σε επίπεδο υπηρεσίας ή εάν η διαδικασία βαθμολόγησης του AWS είναι διαθέσιμη χωρίς περιορισμούς. Επίσης, δεν αποδεικνύεται ότι τα δοκιμασμένα μοντέλα έχουν παρόμοια απόδοση σε μη αποκαλυπτόμενο εταιρικό κώδικα.

Οι ανεξάρτητοι ερευνητές μπορούν να χρησιμοποιήσουν τα δημόσια δείγματα και τη διαδικασία αξιολόγησης χωρίς να δημιουργήσουν εκ νέου τα αναφερόμενα κόστη δημιουργίας δεδομένων του AWS, αλλά οι παρακρατούμενες ετικέτες και η επαληθευμένη βαθμολογία AWS προορίζονται να περιορίσουν τη βελτιστοποίηση για συγκεκριμένα σημεία αναφοράς. Η αναπαραγωγή από εξωτερικές ομάδες θα βοηθούσε στον έλεγχο των αναφερόμενων αποτελεσμάτων και της ποιότητας της επισήμανσης.

Οι μελλοντικές αξιολογήσεις θα πρέπει να συγκρίνουν μοντέλα με ένα πέρασμα με συστήματα που επιθεωρούν αποθετήρια, εκτελούν κώδικα με ασφάλεια, αιτιολογούν τις ρυθμίσεις παραμέτρων ανάπτυξης και απαιτούν αποδεικτικά στοιχεία πριν από την έκδοση ειδοποίησης. Αυτές οι δοκιμές θα έδειχναν καλύτερα πόσο βελτιώνονται τα πρακτικά εργαλεία ασφάλειας στα αποτελέσματα μόνο για μοντέλα.

Η πηγή αφήνει σημαντικά άγνωστα: δεν προσδιορίζει τις 12 διαμορφώσεις μοντέλων που έχουν δοκιμαστεί, δεν αναφέρει αποτελέσματα ανά μοντέλο στο παρεχόμενο κείμενο, τιμολόγηση εγγράφων ή συνθήκες πρόσβασης για επαληθευμένη βαθμολογία ή δεν δείχνει πώς η απόδοση μεταφέρεται σε ιδιόκτητες βάσεις κωδικών και λειτουργίες ζωντανής ασφάλειας.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΗθική του AIPrompt EngineeringΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε το πρόγραμμα παρακολούθησης ρυθμίσεων AI
Βρήκατε αυτό χρήσιμο;