Kembali ke Berita
KeselamatanAI Understanding taklimat

Penanda aras AWS menemui kod selamat bendera pengesan kerentanan AI

Help Net Security melaporkan bahawa AWS menguji 12 model AI pada penanda aras yang direka untuk membezakan kelemahan yang boleh dieksploitasi daripada kod selamat yang hanya kelihatan berbahaya. Tiada yang memenuhi ambang pengeluaran AWS yang dinyatakan untuk kedua-dua kadar positif palsu dan negatif palsu.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Rujukan sumberSumber direkodkan
Penerbit
helpnetsecurity.com
Pautan sumber
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Ketepatan
Perkadaran positif yang diramalkan yang sebenarnya betul.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Help Net Security melaporkan bahawa AWS telah mengeluarkan Penanda Aras Penipuan secara terbuka, yang menguji sama ada model AI boleh membezakan kelemahan perisian tulen daripada kod selamat yang mengandungi corak kerentanan yang mengelirukan. Penanda aras termasuk 14,822 sampel merangkumi 16 bahasa pengaturcaraan dan lebih daripada 70 kategori CWE; 9,695 diberi markah dan 5,127 dicampur sebagai sampel tidak diberi markah.

Help Net Security melaporkan bahawa AWS menilai 12 model tujuan umum daripada lima pembekal menggunakan penanda aras yang direka berdasarkan positif palsu. Contoh selamat penanda aras mengandungi corak kerentanan sebenar di samping perlindungan yang menghalang eksploitasi. Sesetengah cabaran berbeza-beza keadaan penggunaan, seperti dasar rangkaian Kubernetes, jadi model mesti mempertimbangkan kedua-dua kod dan persekitarannya.

Menurut laporan itu, AWS menjana dan memperhalusi contoh terhadap model sempadan, tidak termasuk sampel yang terlalu mudah untuk dikelaskan. AWS mengatakan proses ini menggunakan berpuluh bilion token. Syarikat mengeluarkan sampel secara terbuka tetapi menahan labelnya; pengguna menyerahkan ramalan kepada AWS untuk pemarkahan yang disahkan. Sumber tidak menyatakan sama ada akses kepada pemarkahan membawa bayaran atau syarat kelayakan lain.

Help Net Security melaporkan bahawa pengulas bebas menyemak label tanpa melihat keputusan satu sama lain atau alasan asal. Sampel yang dipertikaikan menerima semakan lanjut, dan kes yang tidak diselesaikan dipindahkan ke set tidak diberi markah. AWS mengatakan bahawa kurang daripada 3% sampel yang mendapat markah kekal dipertikaikan selepas semakan, dengan sasaran kurang daripada 1% yang masih hidup dalam semakan manusia, dan melaporkan tiada ralat pelabelan dalam semakan 100 sampel yang dipilih secara rawak. Tuntutan ini belum disahkan secara bebas di sini.

Butiran sumber: helpnetsecurity.com ↗

Mengapa ia penting

Hasilnya menunjukkan bahawa prestasi kukuh untuk mencari kod yang mencurigakan tidak semestinya diterjemahkan ke dalam triase kerentanan yang boleh dipercayai. Kadar positif palsu yang tinggi boleh membebankan pasukan keselamatan dan melemahkan keyakinan terhadap makluman, manakala keperluan bukti yang lebih ketat boleh menyebabkan model terlepas kelemahan sebenar. Penemuan ini berkaitan dengan organisasi yang mempertimbangkan semakan kod bantuan AI atau operasi keselamatan, tetapi mereka tidak mengukur produk keselamatan komersial yang lengkap.

Penanda aras menangani kelemahan praktikal dalam keselamatan dibantu AI: model mungkin mengenali corak yang kelihatan berbahaya tanpa memahami kawalan yang menghalang eksploitasi. Help Net Security melaporkan bahawa gesaan langsung menghasilkan kadar positif palsu sebanyak 41% hingga 99%, manakala ketepatan berjulat dari 52% hingga 71%.

Meminta model untuk menunjukkan bahawa kelemahan sebenarnya boleh dieksploitasi mengurangkan positif palsu sebanyak 17 hingga 74 mata peratusan, menurut laporan itu, tetapi meningkatkan kadar negatif palsu kepada antara 7% dan 44%. Bar pengeluaran minimum AWS yang dinyatakan adalah di bawah 10% untuk kedua-dua ukuran, dan tiada konfigurasi yang diuji memenuhi kedua-dua ambang.

Keputusan ini tidak boleh dibaca sebagai penarafan produk keselamatan yang lengkap. AWS menguji gesaan satu pusingan pada model tujuan umum, bukan sistem yang dibina khusus yang menggunakan alatan, pengesahan berulang atau aliran kerja agen. Oleh itu, sumber itu menyokong berhati-hati tentang pertimbangan kerentanan peringkat model, bukan kesimpulan bahawa produk keselamatan AI secara keseluruhannya gagal.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Tonton penilaian bebas menggunakan sampel yang dikeluarkan, hasil daripada sistem keselamatan menggunakan alatan atau berbilang langkah, dan bukti tentang prestasi dalam persekitaran pengeluaran sebenar. Sumber tidak mendokumenkan harga, akses peringkat perkhidmatan atau sama ada proses pemarkahan AWS tersedia tanpa sekatan. Ia juga tidak menetapkan bahawa model yang diuji menunjukkan prestasi yang sama pada kod perusahaan yang tidak didedahkan.

Penyelidik bebas boleh menggunakan sampel awam dan proses penilaian tanpa mencipta semula kos penjanaan data AWS yang dilaporkan, tetapi label yang ditahan dan pemarkahan yang disahkan AWS bertujuan untuk mengehadkan pengoptimuman khusus penanda aras. Replikasi oleh kumpulan luar akan membantu menguji keputusan yang dilaporkan dan kualiti pelabelan.

Penilaian masa depan harus membandingkan model laluan tunggal dengan sistem yang memeriksa repositori, melaksanakan kod dengan selamat, menaakul konfigurasi penempatan dan memerlukan bukti sebelum mengeluarkan amaran. Ujian tersebut akan lebih baik menunjukkan sejauh mana perkakas keselamatan praktikal bertambah baik pada hasil model sahaja.

Sumber meninggalkan maklumat penting: ia tidak mengenal pasti 12 konfigurasi model yang diuji, melaporkan keputusan setiap model dalam teks yang dibekalkan, harga dokumen atau syarat akses untuk pemarkahan yang disahkan, atau menunjukkan cara pemindahan prestasi kepada pangkalan kod proprietari dan operasi keselamatan langsung.

Panduan & kuiz berkaitan

Model AI DiterangkanEtika AIPrompt EngineeringUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak peraturan AI
Adakah ini berguna?