กลับไปที่ข่าว
ความปลอดภัยAI Understanding บรรยายสรุป

เกณฑ์มาตรฐาน AWS พบว่าเครื่องตรวจจับช่องโหว่ของ AI ตั้งค่าสถานะรหัสปลอดภัย

Help Net Security รายงานว่า AWS ทดสอบโมเดล AI 12 แบบบนเกณฑ์มาตรฐานที่ออกแบบมาเพื่อแยกแยะช่องโหว่ที่สามารถหาประโยชน์ได้จากโค้ดที่ปลอดภัยที่ดูอันตรายเท่านั้น ไม่มีสิ่งใดตรงตามเกณฑ์การผลิตที่ระบุไว้ของ AWS สำหรับทั้งอัตราบวกลวงและลบลวง

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
แหล่งอ้างอิงแหล่งที่มาบันทึกไว้
สำนักพิมพ์
helpnetsecurity.com
ลิงค์แหล่งที่มา
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
ประเภทแหล่งที่มา
แหล่งที่มาที่เชื่อมโยง — ยังไม่ได้สร้างสถานะแหล่งที่มาหลัก
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
ความแม่นยำ
สัดส่วนผลบวกที่คาดการณ์ไว้ว่าถูกต้องตามความเป็นจริง
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

Help Net Security รายงานว่า AWS ได้เปิดตัว Deception ต่อสาธารณะ ซึ่งจะทดสอบว่าโมเดล AI สามารถแยกแยะช่องโหว่ของซอฟต์แวร์ของแท้จากโค้ดที่ปลอดภัยที่มีรูปแบบช่องโหว่ที่ทำให้เข้าใจผิดได้หรือไม่ เกณฑ์มาตรฐานประกอบด้วยตัวอย่าง 14,822 รายการ ซึ่งครอบคลุมภาษาโปรแกรม 16 ภาษา และหมวดหมู่ CWE มากกว่า 70 หมวดหมู่ มีคะแนน 9,695 รายการ และ 5,127 รายการผสมเป็นกลุ่มตัวอย่างที่ไม่ได้คะแนน

Help Net Security รายงานว่า AWS ประเมินโมเดลการใช้งานทั่วไป 12 โมเดลจากผู้ให้บริการ 5 รายโดยใช้เกณฑ์มาตรฐานที่ออกแบบมาเพื่อผลบวกลวง ตัวอย่างที่ปลอดภัยของเกณฑ์มาตรฐานประกอบด้วยรูปแบบช่องโหว่ที่แท้จริงควบคู่ไปกับการป้องกันที่ป้องกันการแสวงหาผลประโยชน์ ความท้าทายบางประการมีเงื่อนไขการใช้งานที่แตกต่างกัน เช่น นโยบายเครือข่าย Kubernetes ดังนั้นโมเดลจึงต้องพิจารณาทั้งโค้ดและสภาพแวดล้อม

ตามรายงาน AWS ได้สร้างและปรับปรุงตัวอย่างโดยเทียบกับโมเดลชายแดน ยกเว้นตัวอย่างที่จำแนกได้ง่ายเกินไป AWS กล่าวว่ากระบวนการนี้ใช้โทเค็นนับหมื่นล้าน บริษัทเผยแพร่ตัวอย่างต่อสาธารณะแต่ระงับฉลาก ผู้ใช้ส่งการคาดการณ์ไปที่ AWS เพื่อการให้คะแนนที่ตรวจสอบแล้ว แหล่งที่มาไม่ได้ระบุว่าการเข้าถึงการให้คะแนนมีค่าธรรมเนียมหรือข้อกำหนดคุณสมบัติอื่นๆ หรือไม่

Help Net Security รายงานว่าผู้ตรวจสอบอิสระตรวจสอบป้ายกำกับโดยไม่เห็นการตัดสินใจของกันและกันหรือเหตุผลดั้งเดิม ตัวอย่างที่มีการโต้แย้งจะได้รับการตรวจสอบเพิ่มเติม และกรณีที่ยังไม่ได้รับการแก้ไขจะถูกย้ายไปยังชุดที่ไม่มีการให้คะแนน AWS กล่าวว่าตัวอย่างที่ได้คะแนนน้อยกว่า 3% ยังคงถูกโต้แย้งหลังจากการตรวจสอบ โดยมีเป้าหมายน้อยกว่า 1% ที่รอดชีวิตจากการตรวจสอบโดยมนุษย์ และรายงานว่าไม่มีข้อผิดพลาดในการติดฉลากในการทบทวนตัวอย่างที่ได้คะแนนที่ได้รับการสุ่มเลือก 100 ตัวอย่าง การกล่าวอ้างเหล่านี้ยังไม่ได้รับการยืนยันโดยอิสระที่นี่

รายละเอียดที่มา: helpnetsecurity.com ↗

ทำไมมันถึงสำคัญ

ผลลัพธ์ชี้ให้เห็นว่าประสิทธิภาพที่แข็งแกร่งในการค้นหาโค้ดที่น่าสงสัยไม่จำเป็นต้องแปลเป็นการคัดแยกช่องโหว่ที่เชื่อถือได้ อัตราผลบวกลวงที่สูงสามารถสร้างภาระให้กับทีมรักษาความปลอดภัย และลดความมั่นใจในการแจ้งเตือน ในขณะที่ข้อกำหนดการพิสูจน์ที่เข้มงวดมากขึ้นอาจทำให้โมเดลพลาดช่องโหว่ที่แท้จริงได้ การค้นพบนี้เกี่ยวข้องกับองค์กรที่กำลังพิจารณาการตรวจสอบโค้ดที่ได้รับความช่วยเหลือจาก AI หรือการดำเนินการด้านความปลอดภัย แต่ไม่ได้วัดผลผลิตภัณฑ์รักษาความปลอดภัยเชิงพาณิชย์ที่สมบูรณ์

เกณฑ์มาตรฐานกล่าวถึงจุดอ่อนในทางปฏิบัติในการรักษาความปลอดภัยที่ได้รับความช่วยเหลือจาก AI: โมเดลอาจรับรู้รูปแบบที่ดูเป็นอันตรายโดยไม่เข้าใจการควบคุมที่ป้องกันการแสวงหาผลประโยชน์ Help Net Security รายงานว่าการแจ้งโดยตรงทำให้เกิดอัตราผลบวกลวงที่ 41% ถึง 99% ในขณะที่ความแม่นยำอยู่ระหว่าง 52% ถึง 71%

การขอให้แบบจำลองแสดงให้เห็นว่าช่องโหว่สามารถนำไปใช้ได้จริง ลดผลบวกลวงลง 17 ถึง 74 เปอร์เซ็นต์ ตามรายงาน แต่เพิ่มอัตราผลลบลวงเป็นระหว่าง 7% ถึง 44% แถบการผลิตขั้นต่ำที่ระบุไว้ของ AWS ต่ำกว่า 10% สำหรับการวัดทั้งสอง และไม่มีการกำหนดค่าที่ทดสอบใดที่ตรงตามเกณฑ์ทั้งสอง

ผลลัพธ์เหล่านี้ไม่ควรถูกอ่านว่าเป็นการจัดอันดับผลิตภัณฑ์รักษาความปลอดภัยที่สมบูรณ์ AWS ทดสอบการแจ้งแบบเลี้ยวครั้งเดียวในโมเดลที่ใช้งานทั่วไป ไม่ใช่ระบบที่สร้างขึ้นตามวัตถุประสงค์ที่ใช้เครื่องมือ การตรวจสอบซ้ำ หรือเวิร์กโฟลว์แบบเอเจนต์ แหล่งที่มาจึงสนับสนุนข้อควรระวังเกี่ยวกับการตัดสินช่องโหว่ระดับโมเดล ไม่ใช่ข้อสรุปว่าผลิตภัณฑ์รักษาความปลอดภัย AI โดยรวมล้มเหลว

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

ติดตามการประเมินโดยอิสระโดยใช้ตัวอย่างที่เผยแพร่ ผลลัพธ์จากการใช้เครื่องมือหรือระบบรักษาความปลอดภัยหลายขั้นตอน และหลักฐานเกี่ยวกับประสิทธิภาพในสภาพแวดล้อมการผลิตจริง แหล่งที่มาไม่ได้บันทึกราคา การเข้าถึงระดับบริการ หรือกระบวนการให้คะแนนของ AWS พร้อมใช้งานโดยไม่มีข้อจำกัดหรือไม่ นอกจากนี้ยังไม่ได้กำหนดว่าแบบจำลองที่ทดสอบนั้นทำงานเหมือนกันกับรหัสองค์กรที่ไม่เปิดเผย

นักวิจัยอิสระสามารถใช้ตัวอย่างสาธารณะและกระบวนการประเมินโดยไม่ต้องสร้างต้นทุนการสร้างข้อมูลที่รายงานของ AWS ขึ้นมาใหม่ แต่ป้ายกำกับที่ถูกระงับและการให้คะแนนที่ตรวจสอบแล้วของ AWS มีจุดประสงค์เพื่อจำกัดการเพิ่มประสิทธิภาพเฉพาะเกณฑ์มาตรฐาน การจำลองแบบโดยกลุ่มภายนอกจะช่วยทดสอบผลลัพธ์ที่รายงานและคุณภาพการติดฉลาก

การประเมินในอนาคตควรเปรียบเทียบโมเดลแบบ single-pass กับระบบที่ตรวจสอบพื้นที่เก็บข้อมูล รันโค้ดอย่างปลอดภัย เหตุผลในการกำหนดค่าการใช้งาน และต้องมีหลักฐานก่อนที่จะออกการแจ้งเตือน การทดสอบเหล่านั้นจะบ่งชี้ได้ดีขึ้นว่าเครื่องมือรักษาความปลอดภัยที่ใช้งานได้จริงจะปรับปรุงผลลัพธ์เฉพาะรุ่นได้มากน้อยเพียงใด

แหล่งที่มาทิ้งสิ่งที่ไม่รู้ที่สำคัญ: ไม่ได้ระบุการกำหนดค่าโมเดลที่ทดสอบแล้ว 12 รายการ รายงานผลลัพธ์ต่อโมเดลในข้อความที่ให้มา ราคาเอกสาร หรือเงื่อนไขการเข้าถึงสำหรับการให้คะแนนที่ตรวจสอบแล้ว หรือแสดงให้เห็นว่าประสิทธิภาพถ่ายโอนไปยังฐานโค้ดที่เป็นกรรมสิทธิ์และการดำเนินการรักษาความปลอดภัยแบบเรียลไทม์อย่างไร

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIจริยธรรม AIPrompt Engineeringทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราปฏิบัติตามตัวติดตามกฎระเบียบของ AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?