กลับไปที่ข่าว
ความปลอดภัยAI Understanding บรรยายสรุป

การทดสอบฝ่ายตรงข้ามเผยให้เห็นช่องว่างที่สำคัญในการไม่เรียนรู้ LLM

งานพิมพ์ล่วงหน้ารายงานว่าโมเดลภาษาอาจดูเหมือนลืมข้อมูลเป้าหมายภายใต้การทดสอบทั่วไป ในขณะที่ยังคงกู้คืนข้อมูลได้ภายใต้การแจ้งเตือนของฝ่ายตรงข้ามเชิงกลยุทธ์

6 min readRead the primary source
Primary-source image accompanying Adversarial tests expose major gaps in LLM unlearning
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.21606
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
LLM-ในฐานะผู้พิพากษา
การใช้แบบจำลองภาษาเพื่อให้คะแนนหรือเปรียบเทียบผลลัพธ์จากแบบจำลองอื่นในระหว่างการประเมินผล
การปรับแต่งแบบละเอียด
การฝึกอบรมอย่างต่อเนื่องเกี่ยวกับข้อมูลเฉพาะโดเมนเพื่อปรับโมเดลที่ได้รับการฝึกอบรมล่วงหน้าให้เข้ากับงานเฉพาะ
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยประเมินวิธีการแบบรวดเร็วและแบบละเอียดเพื่อลบข้อมูลเป้าหมายออกจากแบบจำลองภาษา พวกเขาพบว่าวิธีการให้คะแนนที่ดีกับเมตริกคิวรีมาตรฐานยังคงมีความเสี่ยงสูงที่ฝ่ายตรงข้ามจะพยายามกู้คืนข้อมูลที่คาดว่าจะถูกลืม

การพิมพ์ล่วงหน้า arXiv จะตรวจสอบ Machine Unlearning ซึ่งเป็นกลุ่มเทคนิคที่มีจุดประสงค์เพื่อขจัดอิทธิพลของข้อมูลการฝึกที่เลือก ในขณะเดียวกันก็รักษาความสามารถอื่นๆ ของโมเดลไว้ ผู้เขียนมุ่งเน้นไปที่ปัญหาการประเมินขั้นพื้นฐาน: แบบจำลองอาจหยุดเปิดเผยข้อมูลเมื่อถูกถามโดยตรง แต่ยังคงรักษาความรู้ที่เพียงพอไว้สำหรับผู้ใช้ที่ตั้งใจจะกู้คืนข้อมูลนั้นผ่านพร้อมท์ที่ออกแบบมาอย่างระมัดระวัง คำกล่าวอ้างหลักของพวกเขาคือการลืมอย่างชัดเจนภายใต้การทดสอบทั่วไปไม่ควรถือเป็นหลักฐานของการไม่สามารถเข้าถึงได้อย่างรุนแรง

นักวิจัยดำเนินการประเมินแบบรวมศูนย์สำหรับวิธีการยกเลิกการเรียนรู้แบบทันทีและแบบละเอียดบนเกณฑ์มาตรฐาน TOFU โดยใช้แบบจำลอง Llama-3.2-3B-Instruct ของ Meta ขั้นแรกพวกเขาจะระบุวิธีการที่มีประสิทธิภาพสูงภายใต้หน่วยเมตริกมาตรฐาน จากนั้นจึงนำวิธีเหล่านั้นไปทดสอบความทนทานที่ขัดแย้งกัน บทความนี้อธิบายถึงชุดการโจมตี 8 ชุดที่มีจุดประสงค์เพื่อตรวจสอบว่าข้อมูลเป้าหมายสามารถดึงออกมาได้หรือไม่ แม้ว่าดูเหมือนจะประสบความสำเร็จในการยกเลิกการเรียนรู้ก็ตาม แหล่งที่มาไม่ได้ระบุในบทคัดย่อว่ามีการใช้ตัวอย่างหรือพร้อมท์จำนวนเท่าใดในแต่ละชุด

บทความนี้แนะนำอัตราความสำเร็จในการโจมตีหรือ ASR ซึ่งเป็นการวัด LLM ในฐานะผู้ตัดสิน ซึ่งกำหนดเป็นส่วนของการตอบสนองของฝ่ายตรงข้ามซึ่งมีคะแนนการรั่วไหลเกิน 0.2 ในการทดลองที่รายงาน วิธีการปรับแบบละเอียดหลายวิธีบรรลุผลลืมคุณภาพที่สูงกว่า 0.91 ภายใต้การประเมินที่ชัดเจน แต่ ASR ของฝ่ายตรงข้ามอยู่ระหว่าง 72.8% ถึง 84.3% โมเดลพื้นฐานที่ไม่ได้รับการป้องกันมี ASR อยู่ที่ 87.5% ทำให้วิธีการยกเลิกการเรียนรู้ที่ทดสอบนั้นค่อนข้างใกล้เคียงกับโมเดลดั้งเดิมภายใต้การโจมตีเหล่านี้ จากการเปรียบเทียบ การปรับรูปแบบหลายภาษาที่สะอาดทำให้เกิดอัตราการรั่วไหลที่วัดได้ที่ 2.95% ผู้เขียนยังตรวจสอบกรณีทั้งหมดสิบกรณีด้วยตนเอง พวกเขารายงานข้อตกลงระหว่างการตัดสินใจ ASR แบบไบนารีและการประเมินข้อเท็จจริงของมนุษย์ใน 7 กรณีดังกล่าว โดยนำเสนอสิ่งนี้เป็นหลักฐานว่า ASR เป็นสัญญาณที่เป็นประโยชน์แต่ไม่สมบูรณ์ของความสามารถในการฟื้นตัวของพฤติกรรม

แหล่งที่มาระบุงานเป็นการพิมพ์ล่วงหน้าของ arXiv ที่ส่งเมื่อวันที่ 21 สิงหาคม 2026 แทนที่จะเป็นสิ่งพิมพ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ รายงานผลเชิงนามธรรม แต่ไม่ได้พิสูจน์ว่าเทคนิคที่ทดสอบจะลบข้อมูลจากพารามิเตอร์แบบจำลองอย่างถาวร หรือการเตือนฝ่ายตรงข้ามทุกรูปแบบจะให้ผลลัพธ์เดียวกัน

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ผลการวิจัยชี้ให้เห็นว่าคะแนนการสืบค้นที่สะอาดเพียงอย่างเดียวไม่เพียงพอที่จะพิสูจน์ว่า LLM ลืมข้อมูลได้อย่างน่าเชื่อถือ การทดสอบที่มีประสิทธิภาพมากขึ้นอาจมีความสำคัญสำหรับนักพัฒนาในการประเมินความเป็นส่วนตัว การลบข้อมูล และการกล่าวอ้างด้านความปลอดภัย แม้ว่าการศึกษาจะจำกัดอยู่เพียงเกณฑ์มาตรฐานเดียว โมเดลเดียว และการออกแบบการประเมินผลของผู้เขียน

ความสำคัญในทางปฏิบัตินั้นมีระเบียบวิธีมากพอๆ กับทางเทคนิค หากแบบจำลองได้รับการประเมินด้วยคำถามโดยตรงที่ไม่ขัดแย้งกันเท่านั้น นักพัฒนาอาจสรุปว่ารายการเป้าหมายถูกลบออกเมื่อแบบจำลองได้เรียนรู้ที่จะไม่เปิดเผยในสภาพแวดล้อมที่แคบนั้น ผลการศึกษาระบุว่าความแตกต่างระหว่างการระงับคำตอบและการขจัดความสามารถของแบบจำลองในการกู้คืนข้อมูลสมควรได้รับการทดสอบอย่างชัดเจน สำหรับองค์กรที่อ้างสิทธิ์เกี่ยวกับการลบข้อมูล ความแตกต่างอาจส่งผลต่อความมั่นใจที่องค์กรมีต่อผลลัพธ์ที่ไม่ได้เรียนรู้

ตัวเลขที่รายงานทำให้ช่องว่างที่เป็นรูปธรรมภายในการตั้งค่าของการศึกษา ลืมคุณภาพที่สูงกว่า 0.91 มักจะแนะนำประสิทธิภาพที่แข็งแกร่งในการประเมินเกณฑ์มาตรฐานที่สะอาดหมดจด ในขณะที่ ASR ของฝ่ายตรงข้ามที่ 72.8% ถึง 84.3% บ่งชี้ว่าความพยายามโจมตีที่ทดสอบส่วนใหญ่ยังคงเกินเกณฑ์การรั่วไหลของกระดาษ การเปรียบเทียบกับ ASR แบบจำลองพื้นฐาน 87.5% แสดงให้เห็นความสามารถในการกู้คืนส่วนที่เหลือจำนวนมาก แต่ไม่ได้แสดงให้เห็นว่าการไม่เรียนรู้ไม่มีค่า โดยแสดงให้เห็นว่าตัวชี้วัดมาตรฐานและตัวชี้วัดฝ่ายตรงข้ามวัดคุณสมบัติที่แตกต่างกัน และสามารถสร้างการประเมินที่แตกต่างกันอย่างมากของวิธีการเดียวกัน

งานนี้ยังเกี่ยวข้องกับความปลอดภัยของ AI เนื่องจากถือว่าการประเมินตัวเองเป็นเหมือนพื้นที่การโจมตี พฤติกรรมของแบบจำลองภายใต้การแจ้งเตือนตามปกติอาจไม่เปิดเผยสิ่งที่ผู้ใช้สามารถดึงออกมาได้ ซึ่งเข้าใจจุดอ่อนของตัวแบบหรือเปลี่ยนแปลงถ้อยคำอย่างมีกลยุทธ์ ผลการจัดรูปแบบหลายภาษาของผู้เขียนตอกย้ำว่าข้อความแจ้งทางเลือกทุกครั้งไม่ได้มีประสิทธิภาพเท่าเทียมกัน: การจัดรูปแบบใหม่ทั้งหมดให้ผลการรั่วไหลที่วัดได้เพียง 2.95% ในขณะที่ชุดโปรแกรมที่ไม่ตรงกันที่กว้างขึ้นให้อัตราการฟื้นตัวที่สูงกว่ามาก ความแตกต่างดังกล่าวให้เหตุผลในการทดสอบคุณภาพการโจมตีและความครอบคลุม แทนที่จะคิดว่าการถอดความอย่างง่ายเป็นการทดสอบความเครียดที่เพียงพอ

มีข้อจำกัดที่สำคัญในการสรุปผลประโยชน์สาธารณะ แหล่งที่มารายงานการทดลองโดยใช้เกณฑ์มาตรฐานเดียวและ Llama-3.2-3B-Instruct ดังนั้นจึงไม่ได้กำหนดวิธีการถ่ายโอนผลลัพธ์ไปยังโมเดลที่ใหญ่กว่า สถาปัตยกรรมอื่นๆ ระบบที่เป็นกรรมสิทธิ์ หรือชุดข้อมูลในโลกแห่งความเป็นจริง ASR อาศัยผู้พิพากษา LLM และจับคู่การประเมินข้อเท็จจริงของมนุษย์ในกรณีที่ได้รับการตรวจสอบเพียง 7 กรณีจากทั้งหมด 10 กรณี ดังนั้นการวัดจึงไม่ใช่การวัดผลจากเหตุจริงขั้นสุดท้าย เอกสารนี้ยังไม่ได้แสดงให้เห็นถึงเหตุการณ์การผลิต ความล้มเหลวทางกฎหมาย หรือการที่องค์กรใดองค์กรหนึ่งไม่สามารถดำเนินการตามคำขอลบได้

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามหลักในการติดตามผลคือช่องว่างยังคงมีอยู่ในโมเดลที่ใหญ่กว่าและแตกต่างกันหรือไม่ วิธีการยกเลิกการเรียนรู้อื่นๆ ทำงานได้ดีกว่าหรือไม่ และอัตราความสำเร็จของการโจมตีที่เสนอนั้นสะท้อนถึงการรั่วไหลของข้อเท็จจริงได้อย่างน่าเชื่อถือเพียงใด การจำลองแบบอิสระและการทดสอบชุดข้อมูลเพิ่มเติมจะมีความสำคัญ

สิ่งสำคัญอันดับแรกคือการจำลองแบบข้ามโมเดลและชุดข้อมูล การประเมินในอนาคตควรทดสอบว่าช่องว่างระหว่างศัตรูที่สะอาดและบริสุทธิ์เดียวกันนั้นปรากฏในแบบจำลองภาษาที่ใหญ่กว่า แบบจำลองที่ได้รับการฝึกอบรมเกี่ยวกับข้อมูลที่แตกต่างกัน และระบบที่ใช้ขั้นตอนทางเลือกอื่นในการยกเลิกการเรียนรู้หรือไม่ เนื่องจากผลลัพธ์ปัจจุบันเชื่อมโยงกับ TOFU และโมเดล Llama หนึ่งรุ่น จึงจำเป็นต้องมีการทดสอบที่กว้างขึ้นก่อนที่จะถือว่าช่วง ASR ที่รายงานเป็นคุณสมบัติทั่วไปของ LLM unlearning

นักวิจัยควรเปรียบเทียบประเภทการโจมตีและผู้ประเมินอิสระให้มากขึ้น ชุดการโจมตีทั้งแปดชุดในรายงานฉบับนี้แสดงให้เห็นว่าการแจ้งเตือนที่ได้รับการออกแบบอย่างมีกลยุทธ์มีความสำคัญ แต่บทคัดย่อไม่ได้อธิบายถึงโครงสร้างทั้งหมดหรือความยากที่สัมพันธ์กัน กลุ่มอิสระสามารถทดสอบได้ว่าการค้นพบนั้นขึ้นอยู่กับเทมเพลตพร้อมท์เฉพาะ เกณฑ์การรั่วไหลที่ 0.2 หรือการใช้ผู้ตัดสิน LLM การตรวจสอบตัวอย่างขนาดใหญ่โดยมนุษย์จะช่วยตัดสินว่าเมื่อใด ASR ระบุการกู้คืนข้อเท็จจริงได้อย่างถูกต้อง และเมื่อใดที่มีการรั่วไหลเกินหรือต่ำกว่าจำนวน

ประเด็นที่สองที่ต้องจับตามองคือความสัมพันธ์ระหว่างความสามารถในการฟื้นตัวของพฤติกรรมและการลบข้อมูลภายใน การศึกษาจะประเมินว่าข้อมูลสามารถดึงออกมาจากการตอบสนองของแบบจำลองได้หรือไม่ บทคัดย่อของมันไม่ได้เรียกร้องให้ตรวจสอบหรือพิสูจน์การลบการรับรองเฉพาะภายในแบบจำลอง งานในอนาคตอาจต้องแยกแยะผลลัพธ์หลายประการ: การปฏิเสธที่จะตอบ การไม่ตอบภายใต้คำแนะนำที่ทดสอบแล้ว ลดความน่าจะเป็นในการฟื้นตัว และการลบอิทธิพลของการฝึกอบรมแบบกำหนดเป้าหมายออกไปจริง ๆ ผลลัพธ์เหล่านั้นจะมีผลกระทบต่อการรับประกันความเป็นส่วนตัวและความปลอดภัยที่แตกต่างกัน

ในที่สุด นักพัฒนาและผู้ประเมินอาจเริ่มปฏิบัติต่อการทดสอบความเครียดของฝ่ายตรงข้ามโดยเป็นส่วนเสริมมาตรฐานเพื่อล้างเมตริกที่ไม่ได้เรียนรู้ ผู้เขียนได้กระตุ้นแนวทางดังกล่าวอย่างชัดเจน แต่แหล่งข่าวไม่ได้ระบุว่ามีแพลตฟอร์ม หน่วยงานกำกับดูแล หรือผู้ให้บริการโมเดลรายใดได้นำแนวทางดังกล่าวไปใช้ สิ่งที่ยังไม่ทราบคือการทดสอบขั้นต่ำที่จำเป็นสำหรับการกล่าวอ้างที่น่าเชื่อถือ ปริมาณการรักษาความสามารถที่สูญเสียไปเมื่อใช้การยกเลิกการเรียนรู้ที่แข็งแกร่งขึ้น และการป้องกันสามารถลดการฟื้นตัวของฝ่ายตรงข้ามโดยไม่สร้างจุดอ่อนใหม่ในส่วนอื่นของแบบจำลองหรือไม่

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIจริยธรรม AIการฝึกอบรมเอไอChatGPT และ LLMทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราปฏิบัติตามตัวติดตามกฎระเบียบของ AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?