เกิดอะไรขึ้น
Help Net Security รายงานว่า AWS ได้เปิดตัว Deception ต่อสาธารณะ ซึ่งจะทดสอบว่าโมเดล AI สามารถแยกแยะช่องโหว่ของซอฟต์แวร์ของแท้จากโค้ดที่ปลอดภัยที่มีรูปแบบช่องโหว่ที่ทำให้เข้าใจผิดได้หรือไม่ เกณฑ์มาตรฐานประกอบด้วยตัวอย่าง 14,822 รายการ ซึ่งครอบคลุมภาษาโปรแกรม 16 ภาษา และหมวดหมู่ CWE มากกว่า 70 หมวดหมู่ มีคะแนน 9,695 รายการ และ 5,127 รายการผสมเป็นกลุ่มตัวอย่างที่ไม่ได้คะแนน
Help Net Security รายงานว่า AWS ประเมินโมเดลการใช้งานทั่วไป 12 โมเดลจากผู้ให้บริการ 5 รายโดยใช้เกณฑ์มาตรฐานที่ออกแบบมาเพื่อผลบวกลวง ตัวอย่างที่ปลอดภัยของเกณฑ์มาตรฐานประกอบด้วยรูปแบบช่องโหว่ที่แท้จริงควบคู่ไปกับการป้องกันที่ป้องกันการแสวงหาผลประโยชน์ ความท้าทายบางประการมีเงื่อนไขการใช้งานที่แตกต่างกัน เช่น นโยบายเครือข่าย Kubernetes ดังนั้นโมเดลจึงต้องพิจารณาทั้งโค้ดและสภาพแวดล้อม
ตามรายงาน AWS ได้สร้างและปรับปรุงตัวอย่างโดยเทียบกับโมเดลชายแดน ยกเว้นตัวอย่างที่จำแนกได้ง่ายเกินไป AWS กล่าวว่ากระบวนการนี้ใช้โทเค็นนับหมื่นล้าน บริษัทเผยแพร่ตัวอย่างต่อสาธารณะแต่ระงับฉลาก ผู้ใช้ส่งการคาดการณ์ไปที่ AWS เพื่อการให้คะแนนที่ตรวจสอบแล้ว แหล่งที่มาไม่ได้ระบุว่าการเข้าถึงการให้คะแนนมีค่าธรรมเนียมหรือข้อกำหนดคุณสมบัติอื่นๆ หรือไม่
Help Net Security รายงานว่าผู้ตรวจสอบอิสระตรวจสอบป้ายกำกับโดยไม่เห็นการตัดสินใจของกันและกันหรือเหตุผลดั้งเดิม ตัวอย่างที่มีการโต้แย้งจะได้รับการตรวจสอบเพิ่มเติม และกรณีที่ยังไม่ได้รับการแก้ไขจะถูกย้ายไปยังชุดที่ไม่มีการให้คะแนน AWS กล่าวว่าตัวอย่างที่ได้คะแนนน้อยกว่า 3% ยังคงถูกโต้แย้งหลังจากการตรวจสอบ โดยมีเป้าหมายน้อยกว่า 1% ที่รอดชีวิตจากการตรวจสอบโดยมนุษย์ และรายงานว่าไม่มีข้อผิดพลาดในการติดฉลากในการทบทวนตัวอย่างที่ได้คะแนนที่ได้รับการสุ่มเลือก 100 ตัวอย่าง การกล่าวอ้างเหล่านี้ยังไม่ได้รับการยืนยันโดยอิสระที่นี่
รายละเอียดที่มา: helpnetsecurity.com ↗
ทำไมมันถึงสำคัญ
ผลลัพธ์ชี้ให้เห็นว่าประสิทธิภาพที่แข็งแกร่งในการค้นหาโค้ดที่น่าสงสัยไม่จำเป็นต้องแปลเป็นการคัดแยกช่องโหว่ที่เชื่อถือได้ อัตราผลบวกลวงที่สูงสามารถสร้างภาระให้กับทีมรักษาความปลอดภัย และลดความมั่นใจในการแจ้งเตือน ในขณะที่ข้อกำหนดการพิสูจน์ที่เข้มงวดมากขึ้นอาจทำให้โมเดลพลาดช่องโหว่ที่แท้จริงได้ การค้นพบนี้เกี่ยวข้องกับองค์กรที่กำลังพิจารณาการตรวจสอบโค้ดที่ได้รับความช่วยเหลือจาก AI หรือการดำเนินการด้านความปลอดภัย แต่ไม่ได้วัดผลผลิตภัณฑ์รักษาความปลอดภัยเชิงพาณิชย์ที่สมบูรณ์
เกณฑ์มาตรฐานกล่าวถึงจุดอ่อนในทางปฏิบัติในการรักษาความปลอดภัยที่ได้รับความช่วยเหลือจาก AI: โมเดลอาจรับรู้รูปแบบที่ดูเป็นอันตรายโดยไม่เข้าใจการควบคุมที่ป้องกันการแสวงหาผลประโยชน์ Help Net Security รายงานว่าการแจ้งโดยตรงทำให้เกิดอัตราผลบวกลวงที่ 41% ถึง 99% ในขณะที่ความแม่นยำอยู่ระหว่าง 52% ถึง 71%
การขอให้แบบจำลองแสดงให้เห็นว่าช่องโหว่สามารถนำไปใช้ได้จริง ลดผลบวกลวงลง 17 ถึง 74 เปอร์เซ็นต์ ตามรายงาน แต่เพิ่มอัตราผลลบลวงเป็นระหว่าง 7% ถึง 44% แถบการผลิตขั้นต่ำที่ระบุไว้ของ AWS ต่ำกว่า 10% สำหรับการวัดทั้งสอง และไม่มีการกำหนดค่าที่ทดสอบใดที่ตรงตามเกณฑ์ทั้งสอง
ผลลัพธ์เหล่านี้ไม่ควรถูกอ่านว่าเป็นการจัดอันดับผลิตภัณฑ์รักษาความปลอดภัยที่สมบูรณ์ AWS ทดสอบการแจ้งแบบเลี้ยวครั้งเดียวในโมเดลที่ใช้งานทั่วไป ไม่ใช่ระบบที่สร้างขึ้นตามวัตถุประสงค์ที่ใช้เครื่องมือ การตรวจสอบซ้ำ หรือเวิร์กโฟลว์แบบเอเจนต์ แหล่งที่มาจึงสนับสนุนข้อควรระวังเกี่ยวกับการตัดสินช่องโหว่ระดับโมเดล ไม่ใช่ข้อสรุปว่าผลิตภัณฑ์รักษาความปลอดภัย AI โดยรวมล้มเหลว
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
ติดตามการประเมินโดยอิสระโดยใช้ตัวอย่างที่เผยแพร่ ผลลัพธ์จากการใช้เครื่องมือหรือระบบรักษาความปลอดภัยหลายขั้นตอน และหลักฐานเกี่ยวกับประสิทธิภาพในสภาพแวดล้อมการผลิตจริง แหล่งที่มาไม่ได้บันทึกราคา การเข้าถึงระดับบริการ หรือกระบวนการให้คะแนนของ AWS พร้อมใช้งานโดยไม่มีข้อจำกัดหรือไม่ นอกจากนี้ยังไม่ได้กำหนดว่าแบบจำลองที่ทดสอบนั้นทำงานเหมือนกันกับรหัสองค์กรที่ไม่เปิดเผย
นักวิจัยอิสระสามารถใช้ตัวอย่างสาธารณะและกระบวนการประเมินโดยไม่ต้องสร้างต้นทุนการสร้างข้อมูลที่รายงานของ AWS ขึ้นมาใหม่ แต่ป้ายกำกับที่ถูกระงับและการให้คะแนนที่ตรวจสอบแล้วของ AWS มีจุดประสงค์เพื่อจำกัดการเพิ่มประสิทธิภาพเฉพาะเกณฑ์มาตรฐาน การจำลองแบบโดยกลุ่มภายนอกจะช่วยทดสอบผลลัพธ์ที่รายงานและคุณภาพการติดฉลาก
การประเมินในอนาคตควรเปรียบเทียบโมเดลแบบ single-pass กับระบบที่ตรวจสอบพื้นที่เก็บข้อมูล รันโค้ดอย่างปลอดภัย เหตุผลในการกำหนดค่าการใช้งาน และต้องมีหลักฐานก่อนที่จะออกการแจ้งเตือน การทดสอบเหล่านั้นจะบ่งชี้ได้ดีขึ้นว่าเครื่องมือรักษาความปลอดภัยที่ใช้งานได้จริงจะปรับปรุงผลลัพธ์เฉพาะรุ่นได้มากน้อยเพียงใด
แหล่งที่มาทิ้งสิ่งที่ไม่รู้ที่สำคัญ: ไม่ได้ระบุการกำหนดค่าโมเดลที่ทดสอบแล้ว 12 รายการ รายงานผลลัพธ์ต่อโมเดลในข้อความที่ให้มา ราคาเอกสาร หรือเงื่อนไขการเข้าถึงสำหรับการให้คะแนนที่ตรวจสอบแล้ว หรือแสดงให้เห็นว่าประสิทธิภาพถ่ายโอนไปยังฐานโค้ดที่เป็นกรรมสิทธิ์และการดำเนินการรักษาความปลอดภัยแบบเรียลไทม์อย่างไร