เกิดอะไรขึ้น
พิมพ์ล่วงหน้า arXiv ใหม่จะตรวจสอบว่าอัตชีวประวัติที่สร้างโดย LLM ตรงกับบันทึกที่บันทึกไว้เกี่ยวกับชีวิตที่อธิบายไว้หรือไม่ ในหนังสือที่มีระยะเวลา 366 วันต่อวันนั้น ระยะเวลา 354 วันล้มเหลวในการควบคุมฉากที่ได้รับการยืนยันเชิงบวกจากคลังข้อมูลการตรวจสอบอิสระ ซึ่งทำให้เกิดอัตราความล้มเหลวในการตรวจสอบตามรายงานที่ 96.7%
การพิมพ์ล่วงหน้าซึ่งส่งไปยัง arXiv เมื่อวันที่ 23 สิงหาคม อธิบายถึงกรณีศึกษาวิชาเดียวที่ผู้เขียนและบุคคลที่สร้างชีวิตขึ้นมาเป็นบุคคลคนเดียวกัน แหล่งข่าวกล่าวว่า LLM เชิงสนทนาได้รับเพียงเทมเพลต สองวันตัวอย่าง และใบเสนอราคาในแต่ละวัน ไม่ใช่คลังข้อมูลพื้นฐานของหัวเรื่อง เมื่อร่างหนังสือเกร็ดเล็กเกร็ดน้อยของบุคคลที่หนึ่งความยาว 366 วัน จากนั้นจะมีการประเมินทุกวันในระดับเหตุการณ์เล็กๆ น้อยๆ เทียบกับคลังข้อมูลการตรวจสอบอิสระ
บทความนี้ระบุความล้มเหลวในการตรวจสอบว่าเป็นวันที่ไม่ได้รับการจัดอันดับ VERIFIED ซึ่งหมายความว่าฉากดังกล่าวได้รับการยืนยันในเชิงบวก จากการวัดนั้น 354 วันจาก 366 วันล้มเหลวหรือ 96.7% โดยมีช่วงความเชื่อมั่นของ Wilson 95% ที่ 94.4% ถึง 98.1% มีเพียง 12 วันเท่านั้นที่มีฉากยืนยัน การตรวจสอบยังรายงานว่าการอ้างสิทธิ์ที่ยืนยันในช่วง 19 วันขัดแย้งกับบันทึกอย่างแข็งขัน
ข้อผิดพลาดที่รายงานหลักมีสาเหตุมาจากการเลื่อนลอย: ฉากที่ประดิษฐ์ขึ้นประกอบด้วยบุคคลจริง นายจ้าง และสภาพแวดล้อมจากชีวิตของบุคคลนั้น รูปแบบนั้นมีความสำคัญเนื่องจากข้อความที่สร้างขึ้นอาจดูเป็นไปได้ในขณะที่ยืมรายละเอียดที่แท้จริงจากบันทึกโดยรอบ รายงานระบุว่าส่วนแบ่งที่วัดได้ของโหมดความล้มเหลวนี้แตกต่างกันไปตามผู้ประเมิน ดังนั้นการค้นพบควรอ่านเป็นรูปแบบที่รายงาน ไม่ใช่สัดส่วนที่ตัดสินอย่างแม่นยำ
ผู้เขียนยังสร้างใหม่ในวันเดียวกันด้วยโมเดลที่มีชื่อปัจจุบันภายใต้อินพุตเดียวกัน และรายงานว่าการตรวจสอบล้มเหลว 100% เมื่อการสร้างอยู่ในคลังข้อมูลของผู้ถูกทดสอบ อัตราการตรวจสอบดีขึ้น แต่รายงานระบุว่าอัตราความล้มเหลวตกค้างยังคงอยู่ที่ 83.3% แหล่งที่มาไม่ได้ระบุแบบจำลองในบทคัดย่อหรือยืนยันว่าผลลัพธ์นั้นนำไปใช้กับทุกขั้นตอนการทำงาน LLM หรืออัตชีวประวัติ
ทำไมมันถึงสำคัญ
การศึกษานี้นำเสนอวิธีที่เป็นรูปธรรมในการวัดการรวมกลุ่มในระดับฉาก แทนที่จะมองว่าชีวประวัติที่สร้างขึ้นทั้งหมดนั้นมีความถูกต้องแม่นยำหรือไม่ถูกต้อง ผลการวิจัยชี้ให้เห็นว่าการเขียนอัตชีวประวัติอย่างคล่องแคล่วสามารถผสมผสานคนจริงๆ นายจ้าง และสภาพแวดล้อมเข้ากับเหตุการณ์ที่ประดิษฐ์ขึ้น ทำให้เกิดรูปแบบข้อผิดพลาดที่ตรวจพบได้ยากเป็นพิเศษ
การศึกษานี้เปลี่ยนข้อกังวลในวงกว้างเกี่ยวกับภาพหลอนให้เป็นปัญหาการวัดผลการปฏิบัติงาน แทนที่จะถามว่าบันทึกความทรงจำทั้งหมด "ฟังดูเป็นเรื่องจริง" หรือไม่ ระบบจะประเมินฉากเล็กๆ น้อยๆ แต่ละฉากเทียบกับบันทึกเฉพาะเรื่อง วิธีการดังกล่าวสามารถช่วยให้นักวิจัยและผู้จัดพิมพ์แยกแยะฉากที่ได้รับการยืนยันอย่างสมบูรณ์จากฉากที่น่าเชื่อถือ ได้รับการสนับสนุนเพียงเล็กน้อยหรือขัดแย้งกัน
รูปแบบข้อผิดพลาดที่รายงานเป็นผลสืบเนื่องโดยเฉพาะอย่างยิ่งสำหรับชีวประวัติ ประวัติโดยบอกเล่า จดหมายเหตุของครอบครัว และการเล่าเรื่องส่วนตัวในรูปแบบอื่น ๆ แบบจำลองไม่จำเป็นต้องประดิษฐ์ทุกชื่อหรือสถานที่เพื่อบิดเบือนความจริงของชีวิต สามารถใส่รายละเอียดที่แท้จริงไว้ในเหตุการณ์ที่ไม่เคยเกิดขึ้นได้ ผู้อ่านอาจพบว่าเอาท์พุตประเภทนั้นยากต่อการท้าทาย เนื่องจากฉากที่สร้างขึ้นนั้นยึดอยู่กับข้อเท็จจริงที่เป็นที่รู้จัก
การทดลองต่อสายดินยังช่วยให้งานวิจัยนี้มีผลในทางปฏิบัตินอกเหนือจากการวินิจฉัยอีกด้วย การจัดหาคลังข้อมูลของอาสาสมัครได้รับการปรับปรุงให้ดีขึ้นอย่างมากเมื่อเทียบกับการสร้างจากการแจ้งเตือนแบบกระจัดกระจาย ตามแหล่งที่มา แต่อัตราความล้มเหลวที่เหลืออีก 83.3% แสดงให้เห็นว่าการเข้าถึงแหล่งข้อมูลเพียงอย่างเดียวไม่ได้ทำให้ผลลัพธ์เชื่อถือได้ในกรณีนี้ ดังนั้นการต่อสายดินจึงควรถือเป็นการบรรเทาผลกระทบซึ่งจะต้องวัดประสิทธิผล ไม่ใช่การรับประกันความเป็นจริง
ข้อควรระวังด้านระเบียบวิธีของบทความนี้เป็นศูนย์กลางในการตีความการมีส่วนร่วม การให้คะแนนซ้ำโดยอิสระทำให้เกิดอัตราความล้มเหลวของพาดหัวข่าว ซึ่งผู้เขียนกล่าวว่าไม่มีหลักฐานว่าอัตราเดิมสูงเกินจริง ในเวลาเดียวกัน อนุกรมวิธานสี่ระดับมีความน่าเชื่อถือเพียงปานกลางถึงปานกลาง และขอบเขตระหว่างอ่อนแอและไม่ได้ยืนยันก็ไม่น่าเชื่อถือ การศึกษานี้แสดงให้เห็นถึงคุณค่าของการตรวจสอบในขณะเดียวกันก็แสดงให้เห็นว่าเครื่องมือตรวจสอบต้องมีการปรับปรุง
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').What is a common training objective for an autoregressive language model?
จะดูอะไรต่อไป.
การค้นพบของรายงานนี้จำเป็นต้องมีการทดสอบในหัวข้อ เนื้อหา ข้อความแจ้ง และเวอร์ชันของแบบจำลองเพิ่มเติม งานในอนาคตควรชี้แจงด้วยว่าบันทึกการตรวจสอบมีความสมบูรณ์เพียงใด เกณฑ์การตรวจสอบที่เสนอสามารถทำให้เชื่อถือได้มากขึ้นหรือไม่ และประสิทธิภาพจะดีขึ้นมากเพียงใดเมื่อแบบจำลองได้รับวัสดุสายดินที่มีโครงสร้าง
สิ่งที่ไม่ทราบที่ใหญ่ที่สุดคือความสามารถทั่วไป นี่คือชีวิตของผู้เขียนหนึ่งคน หนังสือที่มีระยะเวลา 366 วันหนึ่งเล่ม และคลังเอกสารยืนยันหนึ่งฉบับ แหล่งที่มาไม่ได้กำหนดว่าอัตราความล้มเหลวที่คล้ายกันจะปรากฏขึ้นหรือไม่เมื่อมีการจัดทำเอกสารเรื่องไว้อย่างกว้างขวาง มีการจัดทำเอกสารไม่ดี มีการนำเสนอในบันทึกประเภทต่างๆ หรือไม่สามารถประเมินผลลัพธ์ได้ด้วยตนเอง
รายละเอียดรุ่นและรายละเอียดที่รวดเร็วยังต้องมีการตรวจสอบอย่างใกล้ชิด บทคัดย่อหมายถึง "โมเดลที่มีชื่อในปัจจุบัน" แต่ไม่ได้ตั้งชื่อ ให้ข้อมูลเวอร์ชัน หรือรายงานผลการเปรียบเทียบ ซึ่งจะเปิดทิ้งไว้ไม่ว่าความล้มเหลวจะสะท้อนถึงการตั้งค่ารุ่นใดรุ่นหนึ่ง พฤติกรรมของโมเดล กระบวนการสุ่มตัวอย่าง หรือการรวมกันของปัจจัยต่างๆ การจำลองควรเผยแพร่รายละเอียดเหล่านั้นและทดสอบหลายรุ่นภายใต้เงื่อนไขที่ตรงกัน
ความน่าเชื่อถือของกระบวนการตรวจสอบสมควรได้รับความสนใจอย่างต่อเนื่อง รายงานฉบับนี้รายงานว่าการให้คะแนนซ้ำโดยอิสระได้จำลองอัตราพาดหัวข่าวแต่ขอบเขตหมวดหมู่บางประเภทไม่เสถียร การตรวจสอบในอนาคตควรตรวจสอบข้อตกลงในระดับที่เกิดเหตุ กำหนดสิ่งที่นับเป็นการยืนยันที่เพียงพอ และคำนึงถึงบันทึกที่ไม่สมบูรณ์หรือคลุมเครือ หากไม่มีการดำเนินการดังกล่าว เปอร์เซ็นต์ที่แม่นยำอาจปรากฏชัดเจนมากกว่าการจำแนกประเภทที่เกี่ยวข้อง
ผู้ใช้เชิงปฏิบัติควรดูว่าการสร้างแบบมีเหตุผลได้รับการประเมินในงานที่นอกเหนือไปจากการเขียนบันทึกความทรงจำและมีการควบคุมที่แข็งแกร่งหรือไม่ การทดสอบที่เกี่ยวข้องจะเปรียบเทียบการเข้าถึงคลังข้อมูล ข้อกำหนดการอ้างอิง วิธีการดึงข้อมูล และการตรวจสอบโดยมนุษย์ ขณะเดียวกันก็ตรวจสอบทั้งเหตุการณ์ที่ประดิษฐ์ขึ้นและการละเว้น แหล่งที่มาสนับสนุนความจำเป็นในการทดสอบดังกล่าว แต่ไม่ได้แสดงว่าวิธีการแก้ไขที่เสนอนั้นเพียงพอสำหรับการตีพิมพ์ การเก็บถาวร หรือการใช้งานที่มีเดิมพันสูงอื่นๆ ซึ่งจะทำให้ผลลัพธ์ที่รายงานเชื่อมโยงกับการตั้งค่าและขอบเขตที่ระบุไว้ของการศึกษา แทนที่จะขยายออกไปนอกเหนือหลักฐานที่อธิบายไว้