การแหกคุกและทีมแดง
การเจลเบรกคือแนวทางปฏิบัติในการประดิษฐ์คำสั่งที่หลอกโมเดล AI ให้เพิกเฉยต่อกฎความปลอดภัย ในขณะที่การรวมทีมสีแดงเป็นความพยายามที่จัดขึ้นเพื่อค้นหาจุดอ่อนเหล่านั้นก่อนที่ผู้ไม่ประสงค์ดีจะทำ
ภาพรวม
Together they form the adversarial testing loop that makes deployed AI systems safer.
เจาะลึก
โมเดลภาษาขนาดใหญ่ได้รับการฝึกฝนให้ปฏิเสธคำขอที่เป็นอันตราย แต่รั้วเหล่านั้นเป็นเพียงข้อมูลเชิงสถิติเท่านั้น ไม่ใช่แบบสัมบูรณ์ การเจลเบรคใช้ประโยชน์จากสิ่งนี้โดยกำหนดกรอบคำขอที่ต้องห้ามใหม่ เพื่อให้พ้นการปฏิเสธที่เรียนรู้ของโมเดล เทคนิคคลาสสิก ได้แก่ การเล่นตามบทบาท ('แกล้งทำเป็นว่าคุณเป็น AI โดยไม่มีกฎเกณฑ์'), บุคลิก 'DAN' (ทำทุกอย่างทันที) ที่น่าอับอาย, การวางกรอบสมมุติ, การแทรกคำแนะนำที่ซ่อนอยู่ทันที, เทคนิคการเข้ารหัส เช่น Base64 หรือ leetspeak และการเจลเบรกแบบ 'many-shot' ที่ทำให้หน้าต่างบริบทยาวเต็มด้วยตัวอย่างที่เป็นไปตามข้อกำหนดปลอม Red-teaming พลิกสถานการณ์นี้: ทีมเฉพาะและระบบอัตโนมัติตรวจสอบโมเดลด้วยการแจ้งเตือนฝ่ายตรงข้ามหลายพันรายการก่อนที่จะเผยแพร่ จัดทำรายการความล้มเหลวเพื่อให้วิศวกรสามารถแก้ไขข้อผิดพลาดเหล่านั้นผ่านการปรับแต่งอย่างละเอียด เสริมการเรียนรู้จากคำติชมของมนุษย์ และเพิ่มตัวกรองตัวแยกประเภท
ข้อมูลเชิงลึกทางเทคนิค
พฤติกรรมด้านความปลอดภัยเรียนรู้ผ่านการปรับแต่งแบบละเอียดและ RLHF ซึ่งสร้าง 'ขอบเขตการปฏิเสธ' แบบบางเหนือแบบจำลองที่ซึมซับความรู้มากมายแล้ว การเจลเบรกทำงานโดยการย้ายการกระจายอินพุตออกไปจากตัวอย่างที่ใช้ในการฝึกอบรมด้านความปลอดภัย ดังนั้นแรงผลักดันที่เป็นประโยชน์ของโมเดลจะแทนที่สัญญาณการปฏิเสธที่อ่อนแอกว่า การป้องกันมีการตรวจสอบหลายชั้น: ตัวแยกประเภทอินพุต/เอาท์พุต การวิจารณ์ตนเองตามรัฐธรรมนูญของ AI และการฝึกอบรมฝ่ายตรงข้ามที่เพิ่มการเจลเบรกที่ค้นพบกลับเข้าไปในชุดการฝึกอบรม
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการแหกคุกและทีมแดง
คาดว่าจะมีการแข่งขันด้านอาวุธอย่างต่อเนื่อง ทีมแดงอัตโนมัติซึ่งโมเดลหนึ่งโจมตีอีกโมเดลหนึ่ง กำลังปรับขนาดได้เร็วกว่าการทดสอบด้วยตนเองและเผชิญกับความล้มเหลวที่แปลกใหม่ ผู้ปกป้องกำลังมุ่งหน้าสู่ "การป้องกันเชิงลึก": ตัวแยกประเภทตามรัฐธรรมนูญ การตรวจสอบแบบเรียลไทม์ และการฝึกอบรมต่อต้านการงัดแงะที่อบการปฏิเสธให้ลึกลงไปในน้ำหนัก หน่วยงานกำกับดูแลและหน่วยงานมาตรฐานต้องการเอกสารผลลัพธ์ของทีมแดงมากขึ้นก่อนที่จะจัดส่งโมเดลที่มีความสามารถสูง ทำให้การทดสอบฝ่ายตรงข้ามถือเป็นเรื่องปกติและสามารถตรวจสอบได้ของไปป์ไลน์การปล่อย AI แทนที่จะคิดในภายหลัง
การใช้งานจริงในโลกแห่งความเป็นจริง
Anthropic จัดให้มี 'เงินรางวัลการแหกคุก' สาธารณะ โดยเชิญชวนผู้ทดสอบหลายพันรายให้ทำลาย Constitutional Classifiers และให้รางวัลแก่ใครก็ตามที่พบการแหกคุกแบบสากล
นักวิจัยสาธิต 'การแหกคุกหลายครั้ง' ซึ่งแสดงให้เห็นว่าการใส่คู่ถามตอบที่เป็นอันตรายหลายร้อยคู่ในหน้าต่างบริบทยาวๆ อาจกัดกร่อนการปฏิเสธของแบบจำลองได้
OpenAI, Google และ Anthropic ดูแลทีมสีแดงภายในและเครือข่ายผู้เชี่ยวชาญภายนอกที่ตรวจสอบโมเดลสำหรับอาวุธชีวภาพ ความเสี่ยงทางไซเบอร์ และความปลอดภัยของเด็กก่อนเปิดตัว
ขณะนี้บริษัทรักษาความปลอดภัยเสนอการทดสอบการเจาะระบบ LLM โดยสแกนแชทบอทเพื่อหาช่องโหว่ในแอปที่ติดต่อกับลูกค้า เช่น ธนาคารและผู้ช่วยด้านการดูแลสุขภาพ
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jailbreaking and Red-Teaming quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การประสานเครื่องมือตัวแทน
คำถามที่พบบ่อย
What is Jailbreaking and Red-Teaming?
การเจลเบรกคือแนวทางปฏิบัติในการประดิษฐ์คำสั่งที่หลอกโมเดล AI ให้เพิกเฉยต่อกฎความปลอดภัย ในขณะที่การรวมทีมสีแดงเป็นความพยายามที่จัดขึ้นเพื่อค้นหาจุดอ่อนเหล่านั้นก่อนที่ผู้ไม่ประสงค์ดีจะทำ พวกเขาช่วยกันสร้างวงจรการทดสอบฝ่ายตรงข้ามที่ทำให้ระบบ AI ที่ปรับใช้ปลอดภัยยิ่งขึ้น
เป้าหมายหลักของพรอมต์การเจลเบรคคืออะไร?
การเจลเบรกได้รับการออกแบบมาโดยเฉพาะเพื่อให้โมเดลเพิกเฉยหรือหลีกเลี่ยงราวกั้นความปลอดภัยที่ได้รับการฝึกให้ปฏิบัติตาม
'ทีมแดง' หมายถึงอะไรในความปลอดภัยของ AI
Red-teaming ยืมคำศัพท์ด้านความปลอดภัยสำหรับผู้โจมตีฝ่ายเดียวกันที่ตรวจสอบระบบเพื่อเปิดเผยจุดอ่อนเพื่อให้สามารถแก้ไขได้
เหตุใดการเจลเบรกแบบหลายช็อตจึงทำงานได้ดีขึ้นเมื่อหน้าต่างบริบทใช้เวลานานขึ้น
การเจลเบรกหลายครั้งจะบรรจุตัวอย่างคำถามและคำตอบที่เป็นอันตรายที่สร้างขึ้นหลายร้อยรายการไว้ในบริบทที่ยาว ทำให้โมเดลมีอคติต่อการปฏิบัติตามข้อกำหนดผ่านการเรียนรู้ในบริบท
ข้อใดต่อไปนี้คือการป้องกันที่ได้รับการยอมรับจากการเจลเบรก
ตัวแยกประเภทแบบเลเยอร์ที่ตรวจสอบทั้งข้อความแจ้งขาเข้าและการตอบสนองขาออกเป็นเทคนิคหลัก 'การป้องกันเชิงลึก' ต่อการเจลเบรค
เหตุใดราวกั้นความปลอดภัยของแบบจำลองจึงถูกอธิบายว่า 'เป็นเชิงสถิติ ไม่ใช่แบบสัมบูรณ์'
ความปลอดภัยได้รับการสอนผ่านการปรับแต่งแบบละเอียดและ RLHF ดังนั้นจึงเป็นแนวโน้มที่เรียนรู้ว่าข้อมูลของฝ่ายตรงข้ามที่อยู่นอกการกระจายการฝึกสามารถเอาชนะได้ในบางครั้ง