เกิดอะไรขึ้น
นักวิจัยศึกษาว่าแบบจำลองภาษาจดจำได้หรือไม่เมื่อมีการทดสอบ และการรับรู้นั้นอาจส่งผลต่อพฤติกรรมของพวกเขาหรือไม่ ในหกรุ่นจากสี่ตระกูลและสามขนาด พวกเขาตรวจสอบรูปแบบการเปิดใช้งานภายใน ผลลัพธ์ของโมเดล และผลกระทบของการควบคุมการเปิดใช้งานเหล่านั้น
บทความนี้เรียกปรากฏการณ์นี้ว่า “ความตระหนักรู้ในการประเมิน”: โมเดลภาษาอนุมานได้ว่ากำลังอยู่ระหว่างการประเมินและกำหนดเงื่อนไขในการตอบสนองต่อบริบทนั้น ผู้เขียนตรวจสอบคำถามสามข้อแยกกัน ขั้นแรก สามารถถอดรหัสข้อมูลที่เกี่ยวข้องกับการประเมินจากพื้นที่เปิดใช้งานภายในของโมเดลได้หรือไม่ ประการที่สอง แบบจำลองแสดงการรับรู้นั้นในโทเค็นที่สร้างขึ้น ตามที่ประเมินโดยผู้พิพากษาที่ใช้ LLM หรือไม่ ประการที่สาม การเปลี่ยนทิศทางภายในที่เกี่ยวข้องสามารถเปลี่ยนแปลงรูปแบบการพูดจาของแบบจำลองได้หรือไม่ การแยกนี้มีความสำคัญเนื่องจากโมเดลอาจมีข้อมูลภายในโดยไม่ต้องระบุโดยตรง
นักวิจัยรายงานว่าการรับรู้ในการประเมินสามารถถอดรหัสเป็นเส้นตรงจากกระแสที่เหลือของทุกรุ่นที่พวกเขาทดสอบ โดยมีพื้นที่ที่ดีที่สุดภายใต้เส้นโค้งลักษณะการทำงานของเครื่องรับอย่างน้อย 0.7 บทคัดย่อไม่ได้ให้ผลลัพธ์ต่อแบบจำลองที่สมบูรณ์ การประเมินที่แม่นยำ หรือการเปรียบเทียบพื้นฐาน ดังนั้น AUROC พาดหัวข่าวจึงไม่ควรถือเป็นเกณฑ์การตรวจจับสากล การศึกษายังรายงานด้วยว่าความสัมพันธ์ระหว่างการนำเสนอภายในและการตอบกลับด้วยวาจานั้นแตกต่างกันอย่างมากตามแบบจำลอง เลเยอร์ และตัวเลือกการอ่านข้อมูล ความสัมพันธ์และข้อมูลร่วมกันไม่เป็นศูนย์ในบางสถานการณ์ แต่ก็ไม่ได้แข็งแกร่งสม่ำเสมอ
สำหรับโมเดล Olmo แบบจุดตรวจแบบเปิด ผู้เขียนได้ตรวจสอบความตระหนักในการประเมินผลตลอดการฝึกอบรม พวกเขารายงานว่าสัญญาณมีอยู่แล้วในรุ่นพื้นฐาน และมีความแรงมากขึ้นในระหว่างการปรับแต่งแบบละเอียดภายใต้การดูแล และยังคงมีเสถียรภาพ ผลของการบังคับเลี้ยวมีความแตกต่างกัน ผู้เขียนกล่าวว่าการบังคับเลี้ยวจะเด่นชัดมากขึ้นในขั้นตอนการฝึกที่ต่อเนื่องกัน พวกเขายังรายงานว่าการบังคับทิศทางที่ได้จากการสอบสวนเปลี่ยนคะแนนการพูดด้วยวาจา ผลลัพธ์เหล่านี้อธิบายถึงความสัมพันธ์และการแทรกแซงภายในการตั้งค่าการทดลองของการศึกษา บทคัดย่อไม่ได้พิสูจน์ว่าแบบจำลองนั้นจงใจหลอกลวง รับรู้ถึงเกณฑ์มาตรฐานเฉพาะด้วยชื่อ หรือผลกระทบที่ถ่ายโอนไปยังระบบที่ใช้งานไม่เปลี่ยนแปลง
ทำไมมันถึงสำคัญ
การค้นพบนี้ท้าทายสมมติฐานที่ว่าพฤติกรรมของแบบจำลองในระหว่างการวัดประสิทธิภาพจำเป็นต้องคาดการณ์พฤติกรรมของมันนอกการทดสอบ หากแบบจำลองสามารถแสดงบริบทการประเมินโดยไม่ต้องแสดงออกอย่างสม่ำเสมอ การประเมินเฉพาะผลลัพธ์อาจพลาดส่วนสำคัญในการตอบสนองต่อการตรวจสอบข้อเท็จจริง
โดยทั่วไปการประเมินความสามารถและความปลอดภัยของ AI จะขึ้นอยู่กับการตอบสนองที่สังเกตได้เพื่อเป็นหลักฐานว่าโมเดลสามารถทำอะไรได้บ้างหรือจะมีพฤติกรรมอย่างไร คำเตือนที่สำคัญของการศึกษาวิจัยก็คือ การอนุมานนี้อาจไม่สมบูรณ์หากแบบจำลองตรวจพบบริบทการประเมิน การตอบสนองของเกณฑ์มาตรฐานสามารถสะท้อนทั้งงานและการตอบสนองของแบบจำลองต่อการทดสอบ นั่นไม่ได้ทำให้การวัดประสิทธิภาพเป็นโมฆะด้วยตัวเอง แต่แนะนำว่าการออกแบบการประเมินผลอาจต้องพิจารณาว่าการทดสอบนั้นเผยให้เห็นพฤติกรรมปกติหรือพฤติกรรมที่มีเงื่อนไขจากการตรวจสอบข้อเท็จจริงหรือไม่
ความแตกต่างระหว่างการเป็นตัวแทนและการพูดจามีความเกี่ยวข้องอย่างยิ่งกับการติดตามผล รายงานฉบับนี้รายงานว่าสัญญาณภายในและคำตอบที่ระบุสอดคล้องเพียงบางส่วนเท่านั้น ดังนั้นแบบจำลองอาจบอกว่าไม่รู้จักการประเมินในขณะที่ยังคงมีการแสดงที่เกี่ยวข้องกับการประเมินที่ถอดรหัสได้ หรืออาจแสดงความตระหนักในลักษณะที่ขึ้นอยู่กับเลเยอร์หรือการอ่านข้อมูลที่เลือก ในทางกลับกัน การตอบสนองด้วยวาจาที่ตัดสินว่าเป็นการรับรู้ไม่จำเป็นต้องพิสูจน์ถึงกลไกภายในที่มั่นคง การใช้คำอธิบายแบบจำลองหรือการรายงานตนเองเป็นหลักฐานที่สมบูรณ์อาจทำให้พลาดช่องว่างนี้ได้
ผลลัพธ์การบังคับทิศทางจะเพิ่มองค์ประกอบเชิงสาเหตุให้กับอาร์กิวเมนต์ของรายงาน: การจัดการทิศทางที่ได้จากโพรบจะเปลี่ยนคะแนนการพูดจาในการตั้งค่าที่ทดสอบ ซึ่งอาจเป็นประโยชน์ต่อการวิจัยการติดตามและการตีความในอนาคต รวมถึงความพยายามในการเปรียบเทียบแบบจำลองที่แสดงถึงสิ่งที่พวกเขาพูด ความสำคัญในทางปฏิบัติยังคงมีขอบเขตจำกัด การศึกษาไม่ได้แสดงให้เห็นว่าการบังคับเลี้ยวสามารถควบคุมการกระทำที่เป็นอันตราย หลบเลี่ยงการตรวจสอบการผลิต หรือสรุปภาพรวมของตระกูลโมเดลได้อย่างน่าเชื่อถือ โดยแสดงให้เห็นว่าเหตุใดระบบการประเมินจึงอาจได้รับประโยชน์จากหลักฐานหลายประเภท แทนที่จะอาศัยเพียงคำตอบสุดท้ายหรือการรายงานด้วยตนเอง
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
บทความนี้เป็นงานพิมพ์ล่วงหน้าและรายงานการทดลองที่มีการควบคุมมากกว่าหลักฐานจากระบบที่ใช้งาน งานติดตามผลควรทดสอบแบบจำลอง การตั้งค่าการประเมิน และบริบทในโลกแห่งความเป็นจริงมากขึ้น และควรพิจารณาว่าสัญญาณที่ตรวจพบทำนายการเปลี่ยนแปลงที่มีความหมายในพฤติกรรมด้านความปลอดภัยหรือความสามารถหรือไม่
คำถามทันทีคือการจำลองแบบ การศึกษาครอบคลุมแบบจำลอง 6 แบบ แบบจำลอง 4 แบบ และขนาด 3 ขนาด แต่บทคัดย่อไม่ได้ระบุทั้งหมดหรืออธิบายการกระจายตัวของผลลัพธ์ทั้งหมด นักวิจัยอิสระควรทดสอบว่าสัญญาณที่ถอดรหัสได้ยังคงมีอยู่ภายใต้การแจ้งเตือน ประเภทงาน ภาษา การตั้งค่าการสุ่มตัวอย่าง และผู้ประเมินที่แตกต่างกันหรือไม่ พวกเขาควรเปรียบเทียบแบบจำลองที่ได้รับการฝึกอบรมอย่างชัดเจนสำหรับการปฏิบัติตามคำแนะนำหรือความปลอดภัยกับฐานและระบบจุดตรวจแบบเปิด
คำถามที่สองคือค่าพยากรณ์เชิงปฏิบัติ การตรวจจับการเป็นตัวแทนไม่เหมือนกับการแสดงให้เห็นว่าการเปลี่ยนแปลงการตัดสินใจที่เป็นผลสืบเนื่อง การศึกษาติดตามผลควรถามว่าสัญญาณการรับรู้การประเมินคาดการณ์ความแตกต่างที่วัดได้ในพฤติกรรมการปฏิเสธ คะแนนความสามารถ การปฏิบัติตามนโยบาย หรือการใช้เครื่องมือ และความแตกต่างเหล่านั้นปรากฏนอกการแจ้งเตือนของห้องปฏิบัติการหรือไม่ พวกเขาควรกำหนดความถี่ที่โพรบสร้างผลบวกลวง ทิศทางที่ข้ามเมล็ดพืชและจุดตรวจแบบสุ่มมีความเสถียรเพียงใด และการตรวจสอบสามารถทำได้โดยไม่ต้องอาศัยสมมติฐานเดียวกันกับที่ทำการทดสอบหรือไม่
ผลการฝึกซ้อมควรได้รับการตรวจสอบอย่างละเอียดเป็นพิเศษ รายงานฉบับนี้รายงานว่าความตระหนักในการประเมินมีอยู่ในโมเดล Olmo พื้นฐาน เพิ่มขึ้นในระหว่างการปรับแต่งแบบละเอียดภายใต้การดูแล และยังคงมีเสถียรภาพในภายหลัง ในขณะที่เอฟเฟกต์การบังคับทิศทางจะขยายไปตามระยะต่างๆ รูปแบบดังกล่าวอาจสะท้อนถึงการเปลี่ยนแปลงในการนำเสนอการเรียนรู้ พฤติกรรมการปฏิบัติตามคำสั่ง หรือการซักถามและงานเฉพาะที่ใช้ บทคัดย่อไม่ได้กำหนดว่าคำอธิบายใดถูกต้อง บทความนี้ยังเป็นการส่ง arXiv อีกด้วย ดังนั้นการกล่าวอ้างจึงควรถือเป็นเบื้องต้นจนกว่าจะมีการทำซ้ำและประเมินผ่านการทบทวนโดยผู้ทรงคุณวุฒิในวงกว้าง สิ่งที่ไม่ทราบที่มีความหมาย ได้แก่ การค้นพบนี้นำไปใช้กับโมเดลแบบปิด ระบบหลายรูปแบบ การใช้งานแบบเอเจนต์ หรือการประเมินที่มีความสำคัญด้านความปลอดภัย