เกิดอะไรขึ้น
การพิมพ์ล่วงหน้าใหม่ที่โพสต์เมื่อวันที่ 11 สิงหาคม ตั้งชื่อโหมดความล้มเหลวที่สังเกตได้ในที่เก็บการเข้ารหัสแบบเอเจนต์ว่า "การจดจำแบบภัยพิบัติ": ไฟล์คำสั่งโครงการยังคงสะสมกฎอยู่ เนื่องจากการเพิ่มข้อควรระวังนั้นมีราคาถูก ในขณะที่การลบกฎเก่าอย่างปลอดภัยจะยากขึ้นหลังจากที่เหตุผลดั้งเดิมหายไป
นักวิจัยรวบรวมระยะเวลาการสอน 247,694 ครั้ง และการเปลี่ยนแปลงแบบคอมมิตเพื่อคอมมิต 299,440 ครั้ง จากที่เก็บข้อมูลสาธารณะ 1,867 แห่งที่มีไฟล์ เช่น CLAUDE.md พวกเขาติดตามคำสั่งแต่ละรายการผ่านการแก้ไขและรายงานว่าไฟล์เพิ่มขึ้น 226% ตลอดอายุการใช้งานที่สังเกตได้ โดยเพิ่มคำสั่งสุทธิเฉลี่ย 4.9 คำสั่งต่อการแก้ไขคอมมิต การศึกษาถือว่าตัวเลขเหล่านี้เป็นหลักฐานของการสะสมอย่างต่อเนื่องในกลุ่มตัวอย่าง ไม่ใช่การพิสูจน์ว่าทุกคำสั่งนั้นไม่จำเป็น หรือโปรเจ็กต์การเขียนโค้ดตัวแทนทั้งหมดมีพฤติกรรมในลักษณะเดียวกัน
กลไกส่วนกลางของรายงานคือหลักฐานที่ไม่สมมาตร ผู้ดูแลหรือเอเจนต์การเขียนโค้ดสามารถผนวกคำสั่งใหม่หลังจากเกิดข้อผิดพลาด โดยไม่ต้องสร้างทุกการโต้ตอบระหว่างกฎที่มีอยู่แล้วใหม่ การลบในภายหลังมีความเสี่ยงมากขึ้น: เมื่อความล้มเหลวในการจูงใจและบริบทโดยรอบหายไปแล้ว การลบคำสั่งหนึ่งออกอาจต้องตรวจสอบว่ายังคงป้องกันการถดถอยภายใต้การรวมกันของคำสั่งที่เหลือหลายชุดหรือไม่ ในข้อมูลที่เก็บข้อมูล อันตรายจากการลบโดยประมาณจะลดลงตามอายุคำสั่ง โดยมีความชันของบันทึกอันตรายที่รายงานที่ -0.032 ต่อการกระทำ
เพื่อทดสอบวิธีการแก้ไขที่เป็นไปได้ ผู้เขียนได้สร้างงานตามคำสั่งโดยการกลับค่าข้อจำกัด IFEval จากนั้นเปรียบเทียบพร้อมท์ที่มีกฎเปล่ากับพร้อมท์ที่ยังคงรักษาความคิดเห็นสั้นๆ ที่อธิบายว่าทำไมแต่ละกฎจึงมีอยู่ ในการตั้งค่าแบบควบคุม พรอมต์ที่ไม่ใส่เครื่องหมายข้อคิดเห็นสะสมคำสั่งส่วนเกิน 211.3% ในขณะที่พร้อมต์แสดงข้อคิดเห็นสิ้นสุดที่ส่วนเกิน 1.4% ความคิดเห็นไม่ใช่คำสั่งพิเศษสำหรับโมเดล เป็นแหล่งที่มาที่มีขนาดกะทัดรัดซึ่งมีวัตถุประสงค์เพื่อให้การตัดสินใจในการลบออกในภายหลังสามารถตรวจสอบได้
ทีมงานยังประเมินด้วยว่าข้อความแจ้งที่มีขนาดเล็กกว่าและมีเอกสารดีกว่าช่วยให้เจ้าหน้าที่ปฏิบัติตามคำแนะนำได้หรือไม่ ในเกณฑ์มาตรฐานที่ได้มาจาก WildIFEval เอกสารรายงานการเพิ่มขึ้นมากถึง 23.1 เปอร์เซ็นต์เมื่อรักษาเหตุผลไว้และสามารถลบกฎที่ล้าสมัยออกได้ ผลลัพธ์เหล่านั้นเป็นการอ้างสิทธิ์จากการพิมพ์ล่วงหน้าที่โพสต์ใหม่และไม่ได้รับการตรวจทานโดยผู้ทรงคุณวุฒิ งานไม่ได้กำหนดว่าความคิดเห็นเพียงอย่างเดียวจะปรับปรุงทุกเอเจนต์การเขียนโค้ด พื้นที่เก็บข้อมูล ภาษา หรือเวิร์กโฟลว์การผลิต
รายละเอียดที่มา: Catastrophic remembering research paper on arXiv ↗
ทำไมมันถึงสำคัญ
ไฟล์คำสั่งระดับพื้นที่เก็บข้อมูลกำลังกลายเป็นหน่วยความจำในการปฏิบัติงานที่ทนทานสำหรับเอเจนต์การเขียนโค้ด ดังนั้นการเติบโตที่ไม่สามารถควบคุมได้จึงทำให้ต้นทุนโทเค็นเพิ่มขึ้น รักษาข้อจำกัดที่ล้าสมัย และทำให้กฎที่ควบคุมการเปลี่ยนแปลงโค้ดอัตโนมัติยากขึ้นสำหรับคนที่จะเข้าใจ
ความเสี่ยงในทางปฏิบัติไม่ใช่แค่ไฟล์ที่ยาวเท่านั้น ทุกคำสั่งแข่งขันกันเพื่อความสนใจของโมเดลและสามารถโต้ตอบกับกฎที่ใหม่กว่า คำอธิบายเครื่องมือ บริบทของโค้ด และคำขอของผู้ใช้ คำสั่งที่เขียนขึ้นเพื่อป้องกันความล้มเหลวในอดีตอาจไม่เกี่ยวข้องหลังจากการเปลี่ยนแปลง codebase ขัดแย้งกับนโยบายที่ใหม่กว่า หรือจำกัดงานที่ไม่เกี่ยวข้องมากเกินไป หากไม่มีใครสามารถสร้างมันขึ้นมาใหม่ได้ว่าทำไมมันถึงมีอยู่ ทางเลือกในท้องถิ่นที่ปลอดภัยที่สุดมักจะรักษามันไว้ ซึ่งจะย้ายค่าใช้จ่ายในการล้างข้อมูลไปสู่การดำเนินการในอนาคต
รูปแบบนั้นมีความสำคัญมากกว่า CLAUDE.md ทีมจัดเก็บแบบแผน ขอบเขตความปลอดภัย คำสั่งทดสอบ การตัดสินใจทางสถาปัตยกรรม และข้อควรระวังในการปรับใช้มากขึ้นในคำแนะนำโครงการที่เครื่องอ่านได้ ไฟล์เหล่านี้สามารถปรับปรุงความสอดคล้องและลดข้อผิดพลาดซ้ำๆ ได้ แต่ยังกลายเป็นส่วนควบคุมอีกด้วย กล่าวคือ ผู้คนควรจะสามารถระบุได้ว่าใครเป็นผู้แนะนำกฎที่เป็นผลตามมา หลักฐานใดที่สมเหตุสมผล และเงื่อนไขใดที่จะยอมให้กฎดังกล่าวถูกยกเลิก ความคิดเห็นเชิงเหตุผลเป็นเวอร์ชันที่ไม่ซับซ้อนของเส้นทางการตรวจสอบนั้น
ผลลัพธ์แสดงให้เห็นหลักการออกแบบที่มีประโยชน์สำหรับหน่วยความจำของเอเจนต์: การจดจำควรรวมถึงเงื่อนไขสำหรับการลืมด้วย แทนที่จะบันทึกเฉพาะ "ทำ X เสมอ" ระบบสามารถรักษาความล้มเหลวที่สังเกตได้ ขอบเขตของกฎ ส่วนประกอบหรือการทดสอบที่เกี่ยวข้อง และทริกเกอร์การตรวจสอบ นั่นไม่ได้เป็นการลบโดยอัตโนมัติ แต่จะให้หลักฐานผู้ดูแลในภายหลังในการตัดสินใจว่าข้อจำกัดยังคงปกป้องความถูกต้องหรือเพียงสะท้อนถึงสภาพแวดล้อมเก่าเท่านั้น
นอกจากนี้ยังมีมุมมองที่เป็นประโยชน์ต่อสาธารณะเนื่องจากตัวแทนการเข้ารหัสสัมผัสกับซอฟต์แวร์ที่เป็นผลสืบเนื่องมากขึ้น คำสั่งส่วนตัวที่สะสมมาสามารถกำหนดการตัดสินใจด้านความปลอดภัย พฤติกรรมการเข้าถึง การจัดการข้อมูล หรือวิธีที่ตัวแทนตอบสนองต่อความล้มเหลวได้อย่างเงียบๆ ไฟล์ขนาดเล็กจะไม่ปลอดภัยโดยอัตโนมัติ และการล้างข้อมูลเชิงรุกอาจลบการป้องกันที่สำคัญออกไปได้ ผลลัพธ์ที่เป็นประโยชน์คือความสามารถในการตรวจสอบย้อนกลับ: มีกฎที่ไม่สามารถอธิบายได้น้อยลง ความเป็นเจ้าของที่ชัดเจน และแนวปฏิบัติในการทบทวนที่ให้มนุษย์ท้าทายทั้งการเพิ่มเติมและการลบ
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
จะดูอะไรต่อไป.
การทดสอบครั้งต่อไปคือการจำลองแบบอิสระระหว่างภาษา องค์กร ผลิตภัณฑ์เอเจนต์ และที่เก็บข้อมูลที่มีอายุยาวนานกว่า ตามด้วยการทดลองในอนาคตที่วัดว่าการล้างข้อมูลที่ได้รับการจัดทำเป็นเอกสารช่วยปรับปรุงคุณภาพโค้ดโดยไม่ต้องลบการป้องกันที่สำคัญหรือไม่
ตัวอย่างเชิงสังเกตมีขีดจำกัดในการเลือก พื้นที่เก็บข้อมูลสาธารณะที่คอมมิตไฟล์คำแนะนำของเอเจนต์อาจแตกต่างจากโค้ดเบสขององค์กรส่วนตัว และประวัติพื้นที่เก็บข้อมูลไม่สามารถเปิดเผยการสนทนานอกแพลตฟอร์มหรือเหตุการณ์ทั้งหมดที่กระตุ้นให้เกิดกฎได้ การเติบโตยังสามารถมีเหตุผลได้เมื่อโครงการขยาย การวิเคราะห์ในอนาคตควรแยกความครอบคลุมที่เป็นประโยชน์ของส่วนประกอบใหม่ออกจากคำสั่งที่ซ้ำกัน ขัดแย้งกัน หรือล้าสมัย และรายงานว่าผลลัพธ์แตกต่างกันไปตามอายุ พื้นที่เก็บข้อมูล ภาษา จำนวนผู้ร่วมให้ข้อมูล และแพลตฟอร์มตัวแทนอย่างไร
การทดลองที่มีการควบคุมจำเป็นต้องมีการตรวจสอบความถูกต้องในวงกว้างมากขึ้น งานดังกล่าวได้มาจากการวัดประสิทธิภาพตามคำแนะนำแทนที่จะเป็นการบำรุงรักษาซอฟต์แวร์ที่ใช้งานจริงเป็นเวลาหลายเดือน และไปป์ไลน์ที่ตรงกันของกระดาษได้รับการตรวจสอบในตัวอย่างการเปลี่ยนผ่าน 50 ครั้ง ผู้เขียนคนหนึ่งจัดทำคำอธิบายประกอบมือซึ่งใช้เป็นส่วนหนึ่งของการตรวจสอบความถูกต้อง การศึกษานี้ไม่ได้ครอบคลุมไฟล์คำสั่งที่ไม่ใช่ภาษาอังกฤษ และไม่ได้ครอบคลุมทุกเกณฑ์ที่ใช้ในการตัดสินใจว่าเมื่อใดที่การเปลี่ยนแปลงจะถูกนับเป็นการเขียนใหม่ แทนที่จะเป็นการต่อเนื่องของคำสั่ง
ความคิดเห็นสามารถรักษาเหตุผลที่ไม่ถูกต้องได้อย่างง่ายดายเช่นเดียวกับเหตุผลที่ถูกต้อง ดังนั้นทีมจึงควรทดสอบที่มาที่มีโครงสร้างเทียบกับทางเลือกอื่นๆ เช่น ปัญหาที่เชื่อมโยง การทดสอบการถดถอยที่ไม่สำเร็จ วันหมดอายุ ฟิลด์ความเป็นเจ้าของ หรือการตรวจสอบอัตโนมัติที่ทำเครื่องหมายคำสั่งที่ซ้ำกันและขัดแย้งกัน ขั้นตอนการทำงานที่ปลอดภัยที่สุดจะเสนอให้ลบออก แสดงหลักฐานและการทดสอบที่ได้รับผลกระทบ และต้องมีการตรวจสอบกฎที่มีผลกระทบสูง แทนที่จะปล่อยให้ตัวแทนตัดคำสั่งเพื่อบันทึกโทเค็นเพียงอย่างเดียว
หลักฐานการติดตามผลที่เป็นประโยชน์จะวัดผลลัพธ์ตั้งแต่ต้นทางถึงปลายทาง: ขนาดที่รวดเร็ว การปฏิบัติตามคำสั่ง ความสำเร็จของงาน การถดถอย เวลาในการทบทวน และจำนวนกฎที่ได้รับคืนหลังจากการลบ นักวิจัยควรทดสอบด้วยว่าแบบจำลองใช้ความคิดเห็นเชิงเหตุผลตามที่ตั้งใจจริงหรือบางครั้งก็เข้าใจผิดว่าเป็นข้อกำหนดเพิ่มเติม จนกว่าผลลัพธ์เหล่านั้นจะมาถึง การจดจำภัยพิบัติเป็นคำอธิบายที่ได้รับการสนับสนุนอย่างดีสำหรับชุดข้อมูลและการทดลองของผู้เขียน ไม่ใช่กฎหมายสากลหรือเหตุผลในการลบคำแนะนำโครงการที่เป็นผู้ใหญ่ขายส่ง