การสกัดแบบจำลองและการขโมยการโจมตี
การโจมตีด้วยการแยกโมเดลทำให้ฝ่ายตรงข้ามสามารถโคลนโมเดล AI ที่เป็นกรรมสิทธิ์ได้ เพียงแค่สอบถาม API สาธารณะและฝึกผู้เลียนแบบในคำตอบ
ภาพรวม
มันสําคัญเพราะบริษัทต่าง ๆ ใช้เงินหลายล้านในการฝึกโมเดลที่สามารถประมาณค่าได้ในราคาเพียงไม่กี่พัน API call
เจาะลึก
การโจมตีแบบแยกโมเดล (หรือการขโมยโมเดล) จะถือว่าโมเดลที่ปรับใช้เป็นออราเคิล ผู้โจมตีส่งข้อมูลเข้า บันทึกผลลัพธ์ และฝึกโมเดลทดแทนเพื่อเลียนแบบพฤติกรรม เนื่องจากโมเดลเป้าหมายนั้นเป็นการเรียนรู้การจับคู่อินพุตกับเอาต์พุต การคัดลอกคู่อินพุต-เอาต์พุตที่เพียงพอจึงสามารถสร้างการประมาณที่ใกล้เคียงขึ้นใหม่ได้โดยไม่ต้องเห็นน้ำหนักดั้งเดิมหรือข้อมูลการฝึก นักวิจัยได้ขโมยขอบเขตการตัดสินใจของตัวแยกประเภทรูปภาพและแม้กระทั่งกู้คืนน้ำหนักที่แน่นอนของเลเยอร์ขนาดเล็ก ในปี 2024 ทีมงานได้สาธิตการฝังเลเยอร์แบบจำลองการผลิต OpenAI และ Google บางส่วนที่สามารถดึงออกมาได้ในราคาต่ำกว่าสองสามร้อยดอลลาร์ สำเนาที่ถูกขโมยตัดราคาบริการที่ต้องชำระเงิน เลี่ยงตัวกรองความปลอดภัย และเปิดใช้งานการโจมตีแบบ white-box เพิ่มเติม เช่น การสร้างตัวอย่างฝ่ายตรงข้าม
ข้อมูลเชิงลึกทางเทคนิค
ยิ่งการตอบสนองของ API สมบูรณ์ การโจรกรรมก็จะยิ่งถูกลง การส่งคืนเวกเตอร์ความน่าจะเป็นแบบเต็มหรือการบันทึกจะทำให้ข้อมูลต่อการสืบค้นรั่วไหลมากกว่าป้ายกำกับ 1 อันดับแรก ดังนั้นผู้โจมตีจึงสร้างขอบเขตใหม่โดยใช้การสืบค้นน้อยลง กลยุทธ์การเรียนรู้เชิงรุกเลือกคำถามที่มีข้อมูลมากที่สุดใกล้กับขอบเขตการตัดสินใจ ผลลัพธ์ที่สำคัญแสดงให้เห็นว่าการสืบค้นเกินจำนวนมิติเอาต์พุตสามารถกู้คืนเลเยอร์การฉายภาพเชิงเส้นสุดท้ายได้อย่างแน่นอนผ่านพีชคณิตเชิงเส้น เนื่องจากเลเยอร์นั้นเป็นเมทริกซ์ช่วงการตอบสนองอย่างมีประสิทธิภาพ
ผลกระทบเชิงกลยุทธ์
ความเสี่ยงและความปลอดภัย
ความเสียหายที่เกิดจาก AI ที่เป็นหายนะและเกิดขึ้นทุกวันนั้นขึ้นอยู่กับว่าใครเข้าใจความเสี่ยงและใครสามารถดำเนินการได้
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ความรู้สาธารณะและวิชาชีพเป็นตัวกำหนดว่านโยบายความปลอดภัยที่เข้มงวดจะเป็นไปได้ทางการเมืองหรือไม่
ตัดผ่านกระแสโฆษณาชวนเชื่อ
คำอธิบายที่ชัดเจนช่วยลดการจับภาพโดยการโฆษณาเกินจริง การประชาสัมพันธ์ในห้องปฏิบัติการ และการแสดงจริยธรรมที่คลุมเครือ
อนาคตของการสกัดแบบจำลองและการขโมยการโจมตี
การป้องกันกำลังเปลี่ยนจากการบล็อกไปสู่การตรวจจับและการลดลง: การจำกัดอัตรา การส่งคืนเอาต์พุตแบบปัดเศษหรืออันดับสูงสุด 1 เท่านั้น การเพิ่มสัญญาณรบกวนที่ปรับเทียบแล้ว ลักษณะการทำงานของโมเดลลายน้ำเพื่อให้สามารถพิมพ์ลายนิ้วมือของสำเนาที่ถูกขโมยได้ และตรวจสอบรูปแบบแบบสอบถามสำหรับการแยกลายเซ็น คาดหวังข้อกำหนดด้านกฎระเบียบและใบอนุญาตที่ถือว่าการสกัดเป็นการโจรกรรม บวกกับการวิจัยเชิงรุกเกี่ยวกับสถาปัตยกรรมที่สกัดได้ยากที่พิสูจน์ได้ เมื่อแบบจำลองมีขนาดใหญ่ขึ้น การสกัดแบบเต็มยังคงมีต้นทุนสูง แต่การสกัดส่วนประกอบที่มีคุณค่าและการโคลนนิ่งแบบกลั่นบางส่วนจะยังคงเป็นภัยคุกคามทางการค้าและความปลอดภัยอย่างต่อเนื่อง
การใช้งานจริงในโลกแห่งความเป็นจริง
สตาร์ทอัพสอบถาม API การจดจำรูปภาพที่เสียค่าใช้จ่ายของคู่แข่งหลายพันครั้ง และฝึกโคลนฟรีที่จำลองความแม่นยำ
นักวิจัยด้านความปลอดภัยแยกเลเยอร์การฝัง-การฉายภาพขั้นสุดท้ายของโมเดลภาษาที่ใช้งานจริงโดยใช้คำสั่ง API ที่สร้างขึ้นอย่างพิถีพิถันซึ่งมีราคาเพียงไม่กี่ร้อยดอลลาร์
ผู้โจมตีจะโคลนตัวแยกประเภทสแปมหรือการฉ้อโกงในเครื่อง เพื่อให้สามารถตรวจสอบแบบออฟไลน์และสร้างอินพุตที่หลบเลี่ยงการตรวจจับได้อย่างน่าเชื่อถือ
ผู้จำหน่ายระบบคลาวด์เพิ่มการตรวจสอบอัตราการสืบค้นที่ทำเครื่องหมายบัญชีที่มีรูปแบบการเข้าถึงตรงกับการแยกการเรียนรู้แบบแอคทีฟและควบคุมปริมาณการตอบสนอง
ความเสี่ยงและรั้ว
การรักษาความเสี่ยงที่มีอยู่เป็นไซไฟในขณะที่สารประกอบความสามารถ
ความปลอดภัยของผลิตภัณฑ์พื้นผิวที่สับสนด้วยการจัดตำแหน่งภายใต้ความเป็นอิสระสูง
ปล่อยให้ผู้ชมที่ไม่ใช่ภาษาอังกฤษและไม่ใช่ผู้เชี่ยวชาญเหลือเพียงแหล่งข้อมูลคุณภาพต่ำ
แผนงานการดำเนินงาน
แยกอันตรายของผลิตภัณฑ์ การใช้ในทางที่ผิด และความเสี่ยงในการสูญเสียการควบคุม/การวางแนวที่ไม่ถูกต้อง
ถามว่าหลักฐานใดที่จะเปลี่ยนมุมมองของคุณเกี่ยวกับลำดับเวลาและความรุนแรง
ชอบแหล่งที่มาหลักและการประเมินที่เป็นรูปธรรมมากกว่าคำกล่าวอ้างทางการตลาด
ระบุเส้นทางการดำเนินการเส้นทางเดียว: อาชีพ นโยบาย เงินทุน หรือทักษะ ไม่ใช่แค่ความตระหนักรู้เท่านั้น
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การโจมตีโดยอนุมานสมาชิกภาพ
คำถามที่พบบ่อย
การสกัดโมเดลและการขโมยโจมตีคืออะไร?
การโจมตีด้วยการแยกโมเดลทำให้ฝ่ายตรงข้ามสามารถโคลนโมเดล AI ที่เป็นกรรมสิทธิ์ได้ เพียงแค่สอบถาม API สาธารณะและฝึกผู้เลียนแบบในคำตอบ สิ่งสำคัญคือบริษัทต่างๆ ใช้โมเดลการฝึกอบรมหลายล้านโมเดลซึ่งสามารถประมาณราคาของการเรียก API เพียงไม่กี่พันครั้ง
แนวคิดหลักเบื้องหลังการโจมตีแบบสกัดแบบจำลองคืออะไร
การสกัดจะถือว่าโมเดลที่ใช้งานเป็นเหมือนออราเคิล: ผู้โจมตีรวบรวมคู่อินพุต-เอาท์พุต และฝึกโมเดลลอกเลียนแบบเพื่อเลียนแบบพฤติกรรม โดยไม่ต้องเข้าถึงน้ำหนักดั้งเดิมเลย
เหตุใดการส่งคืนเวกเตอร์ความน่าจะเป็นแบบเต็มจึงทำให้การแยกข้อมูลง่ายกว่าการส่งคืนป้ายกำกับ 1 อันดับแรกเท่านั้น
เวกเตอร์ความน่าจะเป็นแบบเต็มแต่ละตัวเปิดเผยเกี่ยวกับพื้นผิวการตัดสินใจภายในของโมเดลมากกว่าป้ายกำกับเดียว ทำให้ผู้โจมตีสร้างขอบเขตขึ้นใหม่โดยมีการสืบค้นน้อยลง
เทคนิคการป้องกันใดช่วยลดข้อมูลที่รั่วไหลได้โดยตรงต่อการสืบค้น
เอาต์พุตที่หยาบ เช่น ส่งคืนเฉพาะป้ายกำกับด้านบนหรือความน่าจะเป็นแบบปัดเศษ จะช่วยลดสัญญาณที่แต่ละการตอบสนองให้กับผู้โจมตี ส่งผลให้ต้นทุนในการสกัดเพิ่มขึ้น
ผลลัพธ์ในปี 2024 แสดงให้เห็นว่าผู้โจมตีสามารถกู้คืนส่วนใดของโมเดลภาษาที่ใช้งานจริงได้ในราคาถูก
นักวิจัยแสดงให้เห็นว่าชั้นฉายเชิงเส้นสุดท้ายสามารถกู้คืนได้อย่างแน่นอนในราคาไม่กี่ร้อยดอลลาร์ เนื่องจากการตอบสนองของชั้นนั้นครอบคลุมเมทริกซ์ที่สามารถกู้คืนได้
เหตุใดโมเดลทดแทนที่ถูกขโมยไปจึงเป็นอันตรายนอกเหนือจากการสูญเสียรายได้?
เมื่อผู้โจมตีมีสำเนาในเครื่องแล้ว พวกเขาสามารถตรวจสอบได้อย่างอิสระเพื่อออกแบบอินพุตของฝ่ายตรงข้ามหรือการโจมตีแบบหลบเลี่ยงที่หลอกระบบที่ใช้งานเดิมด้วย