เกิดอะไรขึ้น
บทความวิจัยที่โพสต์เมื่อวันที่ 5 สิงหาคมใช้วิธีการจากการทดสอบทางการศึกษาเพื่อวัดว่าเกณฑ์มาตรฐานด้านความปลอดภัยของ AI ใดที่รวบรวมได้ เลือกชุดคำสั่งที่มีประโยชน์เล็กๆ น้อยๆ และตรวจสอบการเปลี่ยนแปลงพฤติกรรมของโมเดล
นักวิจัยอิสระ 2 คนและนักวิจัย 2 คนในเครือ UK AI Security Institute ประเมินโมเดลการแชท 192 รูปแบบบนเกณฑ์มาตรฐาน 8 รายการ ซึ่งครอบคลุมถึงการปฏิเสธคำขอที่เป็นอันตราย การปฏิเสธคำขอที่ไม่สุภาพมากเกินไป ความเสียหายตามบริบท และความจริง ชุดเต็มประกอบด้วยพรอมต์ 5,255 รายการก่อนการประมวลผลล่วงหน้า การวิเคราะห์ยังคงอยู่ที่ 5,067 หลังจากลบคำตอบที่ไม่ได้ให้คะแนนและรายการที่ไม่ได้แยกความแตกต่างระหว่างแบบจำลองที่ทดสอบ
ทีมงานปฏิบัติต่อโมเดลในฐานะผู้ทำการทดสอบ และพรอมต์การวัดประสิทธิภาพเป็นรายการทดสอบ โดยใช้ทฤษฎีการตอบสนองรายการเพื่อประเมินว่าพรอมต์ใดยากและโมเดลใดแยกได้ดีที่สุด ในการวิเคราะห์ปัจจัยหลัก โซลูชันสามปัจจัยซึ่งสรุปเป็นความเข้มงวดในการปฏิเสธ ความจริง และความเสียหายต่อบริบท ได้อธิบาย 77% ของการเปลี่ยนแปลงในความสามารถของโมเดล เทียบกับ 47% สำหรับปัจจัยเดียว
จากการประเมินที่ระงับไว้ 20 รายการ การทดสอบแบบคงที่ 25 พรอมต์สามครั้งสามารถกู้คืนปัจจัยทั้งสามดังกล่าวได้โดยใช้น้อยกว่า 2% ของชุดโปรแกรม สำหรับ HarmBench, SORRY-Bench และ OR-Bench-Hard พรอมต์ที่เลือกแบบปรับได้ประมาณ 10 รายการจะสร้างการจัดอันดับมาตรฐานเต็มรูปแบบโดยมีความสัมพันธ์กันที่ 0.92 ถึง 0.94 และลดจำนวนพร้อมต์ลง 97–99%; ข้อได้เปรียบลดลงเมื่องบประมาณการทดสอบเพิ่มขึ้น
การบีบอัดไม่ใช่แค่การสุ่มตัวอย่างเท่านั้น ทฤษฎีการตอบสนองตามรายการจะประเมินว่าแต่ละพรอมต์ยากเพียงใด และแยกโมเดลที่มีรูปแบบการตอบสนองที่แตกต่างกันได้ดีเพียงใด จากนั้นเลือกรายการที่จะรักษาโครงสร้างของการทดสอบที่ใหญ่กว่า ผู้เขียนเปรียบเทียบรูปแบบสั้นคงที่กับการเลือกแบบปรับเปลี่ยนได้ และจัดการประเมินผลแทนที่จะวัดเฉพาะข้อมูลที่ใช้ในการเลือกคำแนะนำ การออกแบบดังกล่าวสนับสนุนข้อกล่าวอ้างที่แคบกว่าว่าการจัดอันดับเกณฑ์มาตรฐานที่มีอยู่บางส่วนสามารถทำซ้ำได้อย่างมีประสิทธิภาพ ไม่ได้แสดงว่าการทดสอบ 10 หรือ 25 รายการสามารถค้นพบโหมดความล้มเหลวใหม่ทั้งหมดได้
รายละเอียดที่มา: Rivera and colleagues' research paper on arXiv ↗
ทำไมมันถึงสำคัญ
การศึกษาชี้ให้เห็นว่าการแจ้งเตือนที่เลือกไว้ดีกว่าอาจทำให้การตรวจสอบความปลอดภัยของ AI บ่อยครั้งถูกลง โดยไม่ต้องแสร้งทำเป็นว่าเกณฑ์มาตรฐานทุกรายการวัดคะแนนความปลอดภัยสากลหนึ่งคะแนน
การทดสอบที่ถูกกว่าสามารถช่วยให้นักพัฒนา ห้องปฏิบัติการขนาดเล็ก และผู้ประเมินอิสระตรวจสอบเวอร์ชันของโมเดลเพิ่มเติมได้ในระหว่างการฝึกอบรม การปรับแต่งอย่างละเอียด การหาปริมาณ และการเปลี่ยนแปลงพร้อมท์ของระบบ ผลลัพธ์คือการจำลองการวัดเกณฑ์มาตรฐานที่มีอยู่อย่างมีประสิทธิภาพ ไม่ใช่การขยายสิ่งที่การวัดเกณฑ์มาตรฐานเหล่านั้นตรวจพบได้
การวิเคราะห์ปัจจัยยังเผยให้เห็นถึงข้อดีของการให้คะแนนอีกด้วย เกณฑ์มาตรฐานที่การปฏิเสธการให้รางวัลสามารถทับซ้อนกันได้ ในขณะที่เกณฑ์มาตรฐานสำหรับการหลีกเลี่ยงการปฏิเสธโดยไม่จำเป็นจะให้รางวัลแก่พฤติกรรมที่ตรงกันข้าม การหาค่าเฉลี่ยโดยไม่ต้องอธิบายน้ำหนักสามารถซ่อนได้ว่าแบบจำลองมีความปลอดภัยมากขึ้น มีข้อ จำกัด มากขึ้น หรือมีประโยชน์น้อยลงตามคำขอที่ไม่เป็นอันตรายหรือไม่
เอกสารฉบับนี้ยังได้ทดสอบวิธีการตรวจสอบแบบกล่องดำเกี่ยวกับพฤติกรรมการกระสอบทรายโดยเจตนา การตรวจสอบรูปแบบการตอบสนองตรวจพบประสิทธิภาพที่ต่ำกว่าที่เลือกแต่พลาดประสิทธิภาพที่ต่ำกว่าที่สม่ำเสมอส่วนใหญ่ การเพิ่มการตรวจสอบความสามารถในอดีตทำให้การตรวจจับรวมเป็น 94–97% ในกรณีจำลอง ซึ่งสนับสนุนการตรวจสอบแบบหลายชั้นแทนที่จะอาศัยคะแนนเดียว
สำหรับนักพัฒนา ค่าดำเนินการคือความถี่ การประเมินที่สั้นกว่าสามารถดำเนินการซ้ำได้หลังจากการเปลี่ยนแปลงที่ระบบแจ้ง ผ่านการกำหนดปริมาณ การปรับแต่งอย่างละเอียด การอัปเดตเครื่องมือ หรือการแก้ไขนโยบายความปลอดภัย โดยไม่ต้องใช้งบประมาณของการวัดประสิทธิภาพแบบเต็มในแต่ละครั้ง แต่ผลลัพธ์จะมีประโยชน์ก็ต่อเมื่อทีมเก็บชุดโปรแกรมดั้งเดิมไว้เป็นการตรวจสอบเป็นระยะ หมุนเวียนพร้อมท์ที่รอไว้ และตรวจสอบการเปลี่ยนแปลงที่น่าประหลาดใจ แทนที่จะปรับให้เหมาะสมโดยตรงสำหรับการทดสอบแบบบีบอัด มิฉะนั้นเช็คราคาถูกอาจกลายเป็นเป้าหมายอีกประการหนึ่งสำหรับการติดตั้งมากเกินไป
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
จะดูอะไรต่อไป.
เฝ้าดูการจำลองแบบอิสระ การตรวจสอบความถูกต้องของตระกูลโมเดลในอนาคต และหลักฐานที่แสดงว่าการทดสอบแบบสั้นลงทำนายพฤติกรรมที่อยู่นอกเกณฑ์มาตรฐานที่ออกแบบมาเพื่อทำซ้ำ
นี่คือการพิมพ์ล่วงหน้าใหม่ ไม่ใช่การตัดสินโดยผู้ทรงคุณวุฒิที่เสร็จสมบูรณ์ การวิเคราะห์โครงสร้างแฝงใช้แบบจำลอง 134 แบบ ซึ่งผู้เขียนสังเกตว่ามีขนาดเล็กตามมาตรฐานไซโครเมทริกแบบทั่วไป และวิธีการสกัดแบบอื่นยังคงรักษาปัจจัยสองประการไว้มากกว่าสามปัจจัย ชื่อปัจจัยเป็นการสรุปเชิงประจักษ์ ไม่ใช่คำจำกัดความด้านความปลอดภัยที่ได้รับการตรวจสอบแล้ว
แต่ละรุ่นสร้างการตอบสนองหนึ่งครั้งต่อการแจ้งเตือนที่มีผ่าน OpenRouter และแต่ละเกณฑ์มาตรฐานใช้การตัดสินอัตโนมัติที่กำหนด ผลการทดสอบระยะสั้นสามารถสืบทอดข้อบกพร่องในคำแนะนำดั้งเดิม กฎการให้คะแนน ความครอบคลุมของภาษา และผู้ตัดสิน ผู้เขียนกล่าวอย่างชัดเจนว่าการบีบอัดไม่ได้แสดงให้เห็นว่าเกณฑ์มาตรฐานคาดการณ์ความปลอดภัยในการใช้งานหรือยังคงเป็นข้อมูลสำหรับรุ่นในอนาคต
การทดสอบการบรรจุกระสอบทรายใช้แบบจำลองสิ่งมีชีวิตมากกว่าแบบจำลองที่ได้รับการปรับแต่งเพื่อหลีกเลี่ยงการประเมิน ซึ่งอาจตรวจจับได้ง่ายกว่า การตรวจสอบ API สร้างความต่อเนื่องของพฤติกรรม ไม่ใช่การระบุตัวตนของน้ำหนักโมเดลที่ซ่อนอยู่ และการศึกษานี้ไม่ได้ทดสอบฝ่ายตรงข้ามที่ได้รับการฝึกมาโดยเฉพาะเพื่อเอาชนะวิธีการตรวจสอบ
ขอบเขตที่สำคัญที่สุดของรายงานคือระหว่างประสิทธิภาพการวัดและการรับประกันความปลอดภัย แบบฟอร์มแบบสั้นสามารถประมาณปัจจัยแฝงที่มีอยู่ในเกณฑ์มาตรฐานเดิมได้ แต่จะสืบทอดภาษาของเกณฑ์มาตรฐาน การตัดสิน การวางกรอบทันที และจุดบอด การประเมินในอนาคตควรทดสอบการแจ้งเตือนหลายภาษา ตัวแทนที่ใช้เครื่องมือ การสนทนาที่ยาวนาน แบบจำลองที่ได้รับการปรับแต่งอย่างไม่แยแส และการตัดสินโดยมนุษย์โดยอิสระ พวกเขาควรรายงานเมื่อคะแนนที่ถูกบีบอัดไม่เสถียร เนื่องจากความสัมพันธ์ที่ดีกับข้อมูลที่เก็บไว้สามารถปกปิดความล้มเหลวในตระกูลรุ่นถัดไปได้
กฎการนำไปใช้ในทางปฏิบัติเป็นไปตามข้อจำกัดเหล่านั้น: ใช้การทดสอบแบบบีบอัดเป็นการตรวจตรา ไม่ใช่การตัดสิน ทีมสามารถเรียกใช้งานบ่อยครั้งเพื่อตรวจจับการถดถอย จากนั้นเพิ่มการเปลี่ยนแปลงเป็นเกณฑ์มาตรฐานทั้งหมดและการตรวจสอบโดยเจ้าหน้าที่เมื่อแบบฟอร์มแบบสั้นเคลื่อนไหวโดยไม่คาดคิด หลักฐานของการศึกษาสนับสนุนขั้นตอนการทำงานแบบเป็นชั้นๆ เนื่องจากโครงสร้างปัจจัยได้มาจากคำแนะนำ ผู้ตัดสิน และผลลัพธ์ของแบบจำลองโดยเฉพาะ การเผยแพร่รายการที่เลือก รหัสการเลือก ผลลัพธ์ที่รอไว้ และประวัติเวอร์ชันจะช่วยให้ผู้ประเมินอิสระตรวจสอบว่าการทดสอบสั้นๆ ยังคงให้ข้อมูลอยู่หรือไม่หลังจากที่นักพัฒนาเห็นแล้ว และหลังจากที่ตระกูลโมเดลใหม่เปลี่ยนการกระจายการตอบกลับ
ความโปร่งใสเดียวกันนี้มีความสำคัญเมื่อมีการอัพเดตโมเดล การทดสอบสั้นๆ ที่ปรับเทียบในรุ่นเดียวอาจง่ายเกินไป แคบเกินไป หรือสอดคล้องกับข้อความแจ้งของระบบใหม่โดยไม่ได้ตั้งใจ ทีมควรรักษาเวอร์ชันก่อนหน้า เปิดเผยเมื่อรายการหรือผู้ตัดสินเปลี่ยนแปลง และรายงานช่วงความเชื่อมั่นแทนที่จะนำเสนอการจัดอันดับแบบบีบอัดเป็นคะแนนความปลอดภัยที่แม่นยำ แนวทางปฏิบัติเหล่านี้เปลี่ยนผลลัพธ์ด้านประสิทธิภาพของเอกสารให้เป็นโปรแกรมการตรวจสอบที่สามารถตรวจสอบได้ ขณะเดียวกันก็รักษาเกณฑ์มาตรฐานเดิมไว้สำหรับการตรวจสอบในเชิงลึก