กลับไปที่ข่าว
ความปลอดภัยAI Understanding บรรยายสรุป

การศึกษาพบว่าเกณฑ์มาตรฐานด้านความปลอดภัยของ AI สามารถใช้การทดสอบน้อยกว่ามาก

การพิมพ์ล่วงหน้าในเครือ UK AI Security Institute สร้างผลลัพธ์มาตรฐานด้านความปลอดภัยหลายรายการโดยได้รับแจ้งน้อยลง 97–99% พร้อมเตือนว่าการทดสอบที่สั้นลงไม่ได้พิสูจน์ความปลอดภัยในโลกแห่งความเป็นจริง

5 min readRead the primary source
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
Rivera and colleagues' research paper on arXiv
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.05086
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

ความปลอดภัยของเอไอ
สาขาที่มุ่งเน้นไปที่การลดพฤติกรรมที่เป็นอันตราย ความล้มเหลว และความเสี่ยงในการใช้งานในทางที่ผิดในระบบ AI
API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
พร้อมท์ระบบ
คำสั่งที่มีลำดับความสำคัญสูงที่กำหนดพฤติกรรม นโยบาย และรูปแบบการตอบสนองสำหรับโมเดล
ทดสอบตัวเองเอไอคืออะไร? แบบทดสอบ

เกิดอะไรขึ้น

บทความวิจัยที่โพสต์เมื่อวันที่ 5 สิงหาคมใช้วิธีการจากการทดสอบทางการศึกษาเพื่อวัดว่าเกณฑ์มาตรฐานด้านความปลอดภัยของ AI ใดที่รวบรวมได้ เลือกชุดคำสั่งที่มีประโยชน์เล็กๆ น้อยๆ และตรวจสอบการเปลี่ยนแปลงพฤติกรรมของโมเดล

นักวิจัยอิสระ 2 คนและนักวิจัย 2 คนในเครือ UK AI Security Institute ประเมินโมเดลการแชท 192 รูปแบบบนเกณฑ์มาตรฐาน 8 รายการ ซึ่งครอบคลุมถึงการปฏิเสธคำขอที่เป็นอันตราย การปฏิเสธคำขอที่ไม่สุภาพมากเกินไป ความเสียหายตามบริบท และความจริง ชุดเต็มประกอบด้วยพรอมต์ 5,255 รายการก่อนการประมวลผลล่วงหน้า การวิเคราะห์ยังคงอยู่ที่ 5,067 หลังจากลบคำตอบที่ไม่ได้ให้คะแนนและรายการที่ไม่ได้แยกความแตกต่างระหว่างแบบจำลองที่ทดสอบ

ทีมงานปฏิบัติต่อโมเดลในฐานะผู้ทำการทดสอบ และพรอมต์การวัดประสิทธิภาพเป็นรายการทดสอบ โดยใช้ทฤษฎีการตอบสนองรายการเพื่อประเมินว่าพรอมต์ใดยากและโมเดลใดแยกได้ดีที่สุด ในการวิเคราะห์ปัจจัยหลัก โซลูชันสามปัจจัยซึ่งสรุปเป็นความเข้มงวดในการปฏิเสธ ความจริง และความเสียหายต่อบริบท ได้อธิบาย 77% ของการเปลี่ยนแปลงในความสามารถของโมเดล เทียบกับ 47% สำหรับปัจจัยเดียว

จากการประเมินที่ระงับไว้ 20 รายการ การทดสอบแบบคงที่ 25 พรอมต์สามครั้งสามารถกู้คืนปัจจัยทั้งสามดังกล่าวได้โดยใช้น้อยกว่า 2% ของชุดโปรแกรม สำหรับ HarmBench, SORRY-Bench และ OR-Bench-Hard พรอมต์ที่เลือกแบบปรับได้ประมาณ 10 รายการจะสร้างการจัดอันดับมาตรฐานเต็มรูปแบบโดยมีความสัมพันธ์กันที่ 0.92 ถึง 0.94 และลดจำนวนพร้อมต์ลง 97–99%; ข้อได้เปรียบลดลงเมื่องบประมาณการทดสอบเพิ่มขึ้น

การบีบอัดไม่ใช่แค่การสุ่มตัวอย่างเท่านั้น ทฤษฎีการตอบสนองตามรายการจะประเมินว่าแต่ละพรอมต์ยากเพียงใด และแยกโมเดลที่มีรูปแบบการตอบสนองที่แตกต่างกันได้ดีเพียงใด จากนั้นเลือกรายการที่จะรักษาโครงสร้างของการทดสอบที่ใหญ่กว่า ผู้เขียนเปรียบเทียบรูปแบบสั้นคงที่กับการเลือกแบบปรับเปลี่ยนได้ และจัดการประเมินผลแทนที่จะวัดเฉพาะข้อมูลที่ใช้ในการเลือกคำแนะนำ การออกแบบดังกล่าวสนับสนุนข้อกล่าวอ้างที่แคบกว่าว่าการจัดอันดับเกณฑ์มาตรฐานที่มีอยู่บางส่วนสามารถทำซ้ำได้อย่างมีประสิทธิภาพ ไม่ได้แสดงว่าการทดสอบ 10 หรือ 25 รายการสามารถค้นพบโหมดความล้มเหลวใหม่ทั้งหมดได้

รายละเอียดที่มา: Rivera and colleagues' research paper on arXiv ↗

ทำไมมันถึงสำคัญ

การศึกษาชี้ให้เห็นว่าการแจ้งเตือนที่เลือกไว้ดีกว่าอาจทำให้การตรวจสอบความปลอดภัยของ AI บ่อยครั้งถูกลง โดยไม่ต้องแสร้งทำเป็นว่าเกณฑ์มาตรฐานทุกรายการวัดคะแนนความปลอดภัยสากลหนึ่งคะแนน

การทดสอบที่ถูกกว่าสามารถช่วยให้นักพัฒนา ห้องปฏิบัติการขนาดเล็ก และผู้ประเมินอิสระตรวจสอบเวอร์ชันของโมเดลเพิ่มเติมได้ในระหว่างการฝึกอบรม การปรับแต่งอย่างละเอียด การหาปริมาณ และการเปลี่ยนแปลงพร้อมท์ของระบบ ผลลัพธ์คือการจำลองการวัดเกณฑ์มาตรฐานที่มีอยู่อย่างมีประสิทธิภาพ ไม่ใช่การขยายสิ่งที่การวัดเกณฑ์มาตรฐานเหล่านั้นตรวจพบได้

การวิเคราะห์ปัจจัยยังเผยให้เห็นถึงข้อดีของการให้คะแนนอีกด้วย เกณฑ์มาตรฐานที่การปฏิเสธการให้รางวัลสามารถทับซ้อนกันได้ ในขณะที่เกณฑ์มาตรฐานสำหรับการหลีกเลี่ยงการปฏิเสธโดยไม่จำเป็นจะให้รางวัลแก่พฤติกรรมที่ตรงกันข้าม การหาค่าเฉลี่ยโดยไม่ต้องอธิบายน้ำหนักสามารถซ่อนได้ว่าแบบจำลองมีความปลอดภัยมากขึ้น มีข้อ จำกัด มากขึ้น หรือมีประโยชน์น้อยลงตามคำขอที่ไม่เป็นอันตรายหรือไม่

เอกสารฉบับนี้ยังได้ทดสอบวิธีการตรวจสอบแบบกล่องดำเกี่ยวกับพฤติกรรมการกระสอบทรายโดยเจตนา การตรวจสอบรูปแบบการตอบสนองตรวจพบประสิทธิภาพที่ต่ำกว่าที่เลือกแต่พลาดประสิทธิภาพที่ต่ำกว่าที่สม่ำเสมอส่วนใหญ่ การเพิ่มการตรวจสอบความสามารถในอดีตทำให้การตรวจจับรวมเป็น 94–97% ในกรณีจำลอง ซึ่งสนับสนุนการตรวจสอบแบบหลายชั้นแทนที่จะอาศัยคะแนนเดียว

สำหรับนักพัฒนา ค่าดำเนินการคือความถี่ การประเมินที่สั้นกว่าสามารถดำเนินการซ้ำได้หลังจากการเปลี่ยนแปลงที่ระบบแจ้ง ผ่านการกำหนดปริมาณ การปรับแต่งอย่างละเอียด การอัปเดตเครื่องมือ หรือการแก้ไขนโยบายความปลอดภัย โดยไม่ต้องใช้งบประมาณของการวัดประสิทธิภาพแบบเต็มในแต่ละครั้ง แต่ผลลัพธ์จะมีประโยชน์ก็ต่อเมื่อทีมเก็บชุดโปรแกรมดั้งเดิมไว้เป็นการตรวจสอบเป็นระยะ หมุนเวียนพร้อมท์ที่รอไว้ และตรวจสอบการเปลี่ยนแปลงที่น่าประหลาดใจ แทนที่จะปรับให้เหมาะสมโดยตรงสำหรับการทดสอบแบบบีบอัด มิฉะนั้นเช็คราคาถูกอาจกลายเป็นเป้าหมายอีกประการหนึ่งสำหรับการติดตั้งมากเกินไป

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

จะดูอะไรต่อไป.

เฝ้าดูการจำลองแบบอิสระ การตรวจสอบความถูกต้องของตระกูลโมเดลในอนาคต และหลักฐานที่แสดงว่าการทดสอบแบบสั้นลงทำนายพฤติกรรมที่อยู่นอกเกณฑ์มาตรฐานที่ออกแบบมาเพื่อทำซ้ำ

นี่คือการพิมพ์ล่วงหน้าใหม่ ไม่ใช่การตัดสินโดยผู้ทรงคุณวุฒิที่เสร็จสมบูรณ์ การวิเคราะห์โครงสร้างแฝงใช้แบบจำลอง 134 แบบ ซึ่งผู้เขียนสังเกตว่ามีขนาดเล็กตามมาตรฐานไซโครเมทริกแบบทั่วไป และวิธีการสกัดแบบอื่นยังคงรักษาปัจจัยสองประการไว้มากกว่าสามปัจจัย ชื่อปัจจัยเป็นการสรุปเชิงประจักษ์ ไม่ใช่คำจำกัดความด้านความปลอดภัยที่ได้รับการตรวจสอบแล้ว

แต่ละรุ่นสร้างการตอบสนองหนึ่งครั้งต่อการแจ้งเตือนที่มีผ่าน OpenRouter และแต่ละเกณฑ์มาตรฐานใช้การตัดสินอัตโนมัติที่กำหนด ผลการทดสอบระยะสั้นสามารถสืบทอดข้อบกพร่องในคำแนะนำดั้งเดิม กฎการให้คะแนน ความครอบคลุมของภาษา และผู้ตัดสิน ผู้เขียนกล่าวอย่างชัดเจนว่าการบีบอัดไม่ได้แสดงให้เห็นว่าเกณฑ์มาตรฐานคาดการณ์ความปลอดภัยในการใช้งานหรือยังคงเป็นข้อมูลสำหรับรุ่นในอนาคต

การทดสอบการบรรจุกระสอบทรายใช้แบบจำลองสิ่งมีชีวิตมากกว่าแบบจำลองที่ได้รับการปรับแต่งเพื่อหลีกเลี่ยงการประเมิน ซึ่งอาจตรวจจับได้ง่ายกว่า การตรวจสอบ API สร้างความต่อเนื่องของพฤติกรรม ไม่ใช่การระบุตัวตนของน้ำหนักโมเดลที่ซ่อนอยู่ และการศึกษานี้ไม่ได้ทดสอบฝ่ายตรงข้ามที่ได้รับการฝึกมาโดยเฉพาะเพื่อเอาชนะวิธีการตรวจสอบ

ขอบเขตที่สำคัญที่สุดของรายงานคือระหว่างประสิทธิภาพการวัดและการรับประกันความปลอดภัย แบบฟอร์มแบบสั้นสามารถประมาณปัจจัยแฝงที่มีอยู่ในเกณฑ์มาตรฐานเดิมได้ แต่จะสืบทอดภาษาของเกณฑ์มาตรฐาน การตัดสิน การวางกรอบทันที และจุดบอด การประเมินในอนาคตควรทดสอบการแจ้งเตือนหลายภาษา ตัวแทนที่ใช้เครื่องมือ การสนทนาที่ยาวนาน แบบจำลองที่ได้รับการปรับแต่งอย่างไม่แยแส และการตัดสินโดยมนุษย์โดยอิสระ พวกเขาควรรายงานเมื่อคะแนนที่ถูกบีบอัดไม่เสถียร เนื่องจากความสัมพันธ์ที่ดีกับข้อมูลที่เก็บไว้สามารถปกปิดความล้มเหลวในตระกูลรุ่นถัดไปได้

กฎการนำไปใช้ในทางปฏิบัติเป็นไปตามข้อจำกัดเหล่านั้น: ใช้การทดสอบแบบบีบอัดเป็นการตรวจตรา ไม่ใช่การตัดสิน ทีมสามารถเรียกใช้งานบ่อยครั้งเพื่อตรวจจับการถดถอย จากนั้นเพิ่มการเปลี่ยนแปลงเป็นเกณฑ์มาตรฐานทั้งหมดและการตรวจสอบโดยเจ้าหน้าที่เมื่อแบบฟอร์มแบบสั้นเคลื่อนไหวโดยไม่คาดคิด หลักฐานของการศึกษาสนับสนุนขั้นตอนการทำงานแบบเป็นชั้นๆ เนื่องจากโครงสร้างปัจจัยได้มาจากคำแนะนำ ผู้ตัดสิน และผลลัพธ์ของแบบจำลองโดยเฉพาะ การเผยแพร่รายการที่เลือก รหัสการเลือก ผลลัพธ์ที่รอไว้ และประวัติเวอร์ชันจะช่วยให้ผู้ประเมินอิสระตรวจสอบว่าการทดสอบสั้นๆ ยังคงให้ข้อมูลอยู่หรือไม่หลังจากที่นักพัฒนาเห็นแล้ว และหลังจากที่ตระกูลโมเดลใหม่เปลี่ยนการกระจายการตอบกลับ

ความโปร่งใสเดียวกันนี้มีความสำคัญเมื่อมีการอัพเดตโมเดล การทดสอบสั้นๆ ที่ปรับเทียบในรุ่นเดียวอาจง่ายเกินไป แคบเกินไป หรือสอดคล้องกับข้อความแจ้งของระบบใหม่โดยไม่ได้ตั้งใจ ทีมควรรักษาเวอร์ชันก่อนหน้า เปิดเผยเมื่อรายการหรือผู้ตัดสินเปลี่ยนแปลง และรายงานช่วงความเชื่อมั่นแทนที่จะนำเสนอการจัดอันดับแบบบีบอัดเป็นคะแนนความปลอดภัยที่แม่นยำ แนวทางปฏิบัติเหล่านี้เปลี่ยนผลลัพธ์ด้านประสิทธิภาพของเอกสารให้เป็นโปรแกรมการตรวจสอบที่สามารถตรวจสอบได้ ขณะเดียวกันก็รักษาเกณฑ์มาตรฐานเดิมไว้สำหรับการตรวจสอบในเชิงลึก

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

เอไอคืออะไร?ChatGPT และ LLMจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราปฏิบัติตามตัวติดตามกฎระเบียบของ AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?