กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

ผลการศึกษาพบว่าอัตชีวประวัติของ LLM สร้างสรรค์ฉากต่างๆ แม้ว่าจะใช้บุคคลและสถานที่จริงก็ตาม

การตรวจสอบกรณีศึกษารายงานว่า 354 วันจาก 366 วันในบันทึกความทรงจำที่สร้างโดย LLM ไม่มีฉากที่ได้รับการยืนยันในเชิงบวก การต่อโมเดลในบันทึกที่จัดทำเป็นเอกสารของอาสาสมัครทำให้ผลลัพธ์ดีขึ้น แต่ยังคงมีอัตราความล้มเหลวในการตรวจสอบยืนยันอยู่ที่ 83.3%

5 min readRead the primary source
Source-page capture accompanying Study finds LLM autobiographies invent scenes despite using real people and places
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.23640
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
ช่วงความเชื่อมั่น
ช่วงทางสถิติที่น่าจะมีค่าที่แท้จริงของเมตริกแบบจำลองที่วัดได้
อาการประสาทหลอน
เมื่อแบบจำลองสร้างข้อมูลคล่องแต่เป็นเท็จหรือไม่ได้รับการสนับสนุน
ทดสอบตัวเองChatGPT และแบบทดสอบ LLM

เกิดอะไรขึ้น

พิมพ์ล่วงหน้า arXiv ใหม่จะตรวจสอบว่าอัตชีวประวัติที่สร้างโดย LLM ตรงกับบันทึกที่บันทึกไว้เกี่ยวกับชีวิตที่อธิบายไว้หรือไม่ ในหนังสือที่มีระยะเวลา 366 วันต่อวันนั้น ระยะเวลา 354 วันล้มเหลวในการควบคุมฉากที่ได้รับการยืนยันเชิงบวกจากคลังข้อมูลการตรวจสอบอิสระ ซึ่งทำให้เกิดอัตราความล้มเหลวในการตรวจสอบตามรายงานที่ 96.7%

การพิมพ์ล่วงหน้าซึ่งส่งไปยัง arXiv เมื่อวันที่ 23 สิงหาคม อธิบายถึงกรณีศึกษาวิชาเดียวที่ผู้เขียนและบุคคลที่สร้างชีวิตขึ้นมาเป็นบุคคลคนเดียวกัน แหล่งข่าวกล่าวว่า LLM เชิงสนทนาได้รับเพียงเทมเพลต สองวันตัวอย่าง และใบเสนอราคาในแต่ละวัน ไม่ใช่คลังข้อมูลพื้นฐานของหัวเรื่อง เมื่อร่างหนังสือเกร็ดเล็กเกร็ดน้อยของบุคคลที่หนึ่งความยาว 366 วัน จากนั้นจะมีการประเมินทุกวันในระดับเหตุการณ์เล็กๆ น้อยๆ เทียบกับคลังข้อมูลการตรวจสอบอิสระ

บทความนี้ระบุความล้มเหลวในการตรวจสอบว่าเป็นวันที่ไม่ได้รับการจัดอันดับ VERIFIED ซึ่งหมายความว่าฉากดังกล่าวได้รับการยืนยันในเชิงบวก จากการวัดนั้น 354 วันจาก 366 วันล้มเหลวหรือ 96.7% โดยมีช่วงความเชื่อมั่นของ Wilson 95% ที่ 94.4% ถึง 98.1% มีเพียง 12 วันเท่านั้นที่มีฉากยืนยัน การตรวจสอบยังรายงานว่าการอ้างสิทธิ์ที่ยืนยันในช่วง 19 วันขัดแย้งกับบันทึกอย่างแข็งขัน

ข้อผิดพลาดที่รายงานหลักมีสาเหตุมาจากการเลื่อนลอย: ฉากที่ประดิษฐ์ขึ้นประกอบด้วยบุคคลจริง นายจ้าง และสภาพแวดล้อมจากชีวิตของบุคคลนั้น รูปแบบนั้นมีความสำคัญเนื่องจากข้อความที่สร้างขึ้นอาจดูเป็นไปได้ในขณะที่ยืมรายละเอียดที่แท้จริงจากบันทึกโดยรอบ รายงานระบุว่าส่วนแบ่งที่วัดได้ของโหมดความล้มเหลวนี้แตกต่างกันไปตามผู้ประเมิน ดังนั้นการค้นพบควรอ่านเป็นรูปแบบที่รายงาน ไม่ใช่สัดส่วนที่ตัดสินอย่างแม่นยำ

ผู้เขียนยังสร้างใหม่ในวันเดียวกันด้วยโมเดลที่มีชื่อปัจจุบันภายใต้อินพุตเดียวกัน และรายงานว่าการตรวจสอบล้มเหลว 100% เมื่อการสร้างอยู่ในคลังข้อมูลของผู้ถูกทดสอบ อัตราการตรวจสอบดีขึ้น แต่รายงานระบุว่าอัตราความล้มเหลวตกค้างยังคงอยู่ที่ 83.3% แหล่งที่มาไม่ได้ระบุแบบจำลองในบทคัดย่อหรือยืนยันว่าผลลัพธ์นั้นนำไปใช้กับทุกขั้นตอนการทำงาน LLM หรืออัตชีวประวัติ

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

การศึกษานี้นำเสนอวิธีที่เป็นรูปธรรมในการวัดการรวมกลุ่มในระดับฉาก แทนที่จะมองว่าชีวประวัติที่สร้างขึ้นทั้งหมดนั้นมีความถูกต้องแม่นยำหรือไม่ถูกต้อง ผลการวิจัยชี้ให้เห็นว่าการเขียนอัตชีวประวัติอย่างคล่องแคล่วสามารถผสมผสานคนจริงๆ นายจ้าง และสภาพแวดล้อมเข้ากับเหตุการณ์ที่ประดิษฐ์ขึ้น ทำให้เกิดรูปแบบข้อผิดพลาดที่ตรวจพบได้ยากเป็นพิเศษ

การศึกษานี้เปลี่ยนข้อกังวลในวงกว้างเกี่ยวกับภาพหลอนให้เป็นปัญหาการวัดผลการปฏิบัติงาน แทนที่จะถามว่าบันทึกความทรงจำทั้งหมด "ฟังดูเป็นเรื่องจริง" หรือไม่ ระบบจะประเมินฉากเล็กๆ น้อยๆ แต่ละฉากเทียบกับบันทึกเฉพาะเรื่อง วิธีการดังกล่าวสามารถช่วยให้นักวิจัยและผู้จัดพิมพ์แยกแยะฉากที่ได้รับการยืนยันอย่างสมบูรณ์จากฉากที่น่าเชื่อถือ ได้รับการสนับสนุนเพียงเล็กน้อยหรือขัดแย้งกัน

รูปแบบข้อผิดพลาดที่รายงานเป็นผลสืบเนื่องโดยเฉพาะอย่างยิ่งสำหรับชีวประวัติ ประวัติโดยบอกเล่า จดหมายเหตุของครอบครัว และการเล่าเรื่องส่วนตัวในรูปแบบอื่น ๆ แบบจำลองไม่จำเป็นต้องประดิษฐ์ทุกชื่อหรือสถานที่เพื่อบิดเบือนความจริงของชีวิต สามารถใส่รายละเอียดที่แท้จริงไว้ในเหตุการณ์ที่ไม่เคยเกิดขึ้นได้ ผู้อ่านอาจพบว่าเอาท์พุตประเภทนั้นยากต่อการท้าทาย เนื่องจากฉากที่สร้างขึ้นนั้นยึดอยู่กับข้อเท็จจริงที่เป็นที่รู้จัก

การทดลองต่อสายดินยังช่วยให้งานวิจัยนี้มีผลในทางปฏิบัตินอกเหนือจากการวินิจฉัยอีกด้วย การจัดหาคลังข้อมูลของอาสาสมัครได้รับการปรับปรุงให้ดีขึ้นอย่างมากเมื่อเทียบกับการสร้างจากการแจ้งเตือนแบบกระจัดกระจาย ตามแหล่งที่มา แต่อัตราความล้มเหลวที่เหลืออีก 83.3% แสดงให้เห็นว่าการเข้าถึงแหล่งข้อมูลเพียงอย่างเดียวไม่ได้ทำให้ผลลัพธ์เชื่อถือได้ในกรณีนี้ ดังนั้นการต่อสายดินจึงควรถือเป็นการบรรเทาผลกระทบซึ่งจะต้องวัดประสิทธิผล ไม่ใช่การรับประกันความเป็นจริง

ข้อควรระวังด้านระเบียบวิธีของบทความนี้เป็นศูนย์กลางในการตีความการมีส่วนร่วม การให้คะแนนซ้ำโดยอิสระทำให้เกิดอัตราความล้มเหลวของพาดหัวข่าว ซึ่งผู้เขียนกล่าวว่าไม่มีหลักฐานว่าอัตราเดิมสูงเกินจริง ในเวลาเดียวกัน อนุกรมวิธานสี่ระดับมีความน่าเชื่อถือเพียงปานกลางถึงปานกลาง และขอบเขตระหว่างอ่อนแอและไม่ได้ยืนยันก็ไม่น่าเชื่อถือ การศึกษานี้แสดงให้เห็นถึงคุณค่าของการตรวจสอบในขณะเดียวกันก็แสดงให้เห็นว่าเครื่องมือตรวจสอบต้องมีการปรับปรุง

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

จะดูอะไรต่อไป.

การค้นพบของรายงานนี้จำเป็นต้องมีการทดสอบในหัวข้อ เนื้อหา ข้อความแจ้ง และเวอร์ชันของแบบจำลองเพิ่มเติม งานในอนาคตควรชี้แจงด้วยว่าบันทึกการตรวจสอบมีความสมบูรณ์เพียงใด เกณฑ์การตรวจสอบที่เสนอสามารถทำให้เชื่อถือได้มากขึ้นหรือไม่ และประสิทธิภาพจะดีขึ้นมากเพียงใดเมื่อแบบจำลองได้รับวัสดุสายดินที่มีโครงสร้าง

สิ่งที่ไม่ทราบที่ใหญ่ที่สุดคือความสามารถทั่วไป นี่คือชีวิตของผู้เขียนหนึ่งคน หนังสือที่มีระยะเวลา 366 วันหนึ่งเล่ม และคลังเอกสารยืนยันหนึ่งฉบับ แหล่งที่มาไม่ได้กำหนดว่าอัตราความล้มเหลวที่คล้ายกันจะปรากฏขึ้นหรือไม่เมื่อมีการจัดทำเอกสารเรื่องไว้อย่างกว้างขวาง มีการจัดทำเอกสารไม่ดี มีการนำเสนอในบันทึกประเภทต่างๆ หรือไม่สามารถประเมินผลลัพธ์ได้ด้วยตนเอง

รายละเอียดรุ่นและรายละเอียดที่รวดเร็วยังต้องมีการตรวจสอบอย่างใกล้ชิด บทคัดย่อหมายถึง "โมเดลที่มีชื่อในปัจจุบัน" แต่ไม่ได้ตั้งชื่อ ให้ข้อมูลเวอร์ชัน หรือรายงานผลการเปรียบเทียบ ซึ่งจะเปิดทิ้งไว้ไม่ว่าความล้มเหลวจะสะท้อนถึงการตั้งค่ารุ่นใดรุ่นหนึ่ง พฤติกรรมของโมเดล กระบวนการสุ่มตัวอย่าง หรือการรวมกันของปัจจัยต่างๆ การจำลองควรเผยแพร่รายละเอียดเหล่านั้นและทดสอบหลายรุ่นภายใต้เงื่อนไขที่ตรงกัน

ความน่าเชื่อถือของกระบวนการตรวจสอบสมควรได้รับความสนใจอย่างต่อเนื่อง รายงานฉบับนี้รายงานว่าการให้คะแนนซ้ำโดยอิสระได้จำลองอัตราพาดหัวข่าวแต่ขอบเขตหมวดหมู่บางประเภทไม่เสถียร การตรวจสอบในอนาคตควรตรวจสอบข้อตกลงในระดับที่เกิดเหตุ กำหนดสิ่งที่นับเป็นการยืนยันที่เพียงพอ และคำนึงถึงบันทึกที่ไม่สมบูรณ์หรือคลุมเครือ หากไม่มีการดำเนินการดังกล่าว เปอร์เซ็นต์ที่แม่นยำอาจปรากฏชัดเจนมากกว่าการจำแนกประเภทที่เกี่ยวข้อง

ผู้ใช้เชิงปฏิบัติควรดูว่าการสร้างแบบมีเหตุผลได้รับการประเมินในงานที่นอกเหนือไปจากการเขียนบันทึกความทรงจำและมีการควบคุมที่แข็งแกร่งหรือไม่ การทดสอบที่เกี่ยวข้องจะเปรียบเทียบการเข้าถึงคลังข้อมูล ข้อกำหนดการอ้างอิง วิธีการดึงข้อมูล และการตรวจสอบโดยมนุษย์ ขณะเดียวกันก็ตรวจสอบทั้งเหตุการณ์ที่ประดิษฐ์ขึ้นและการละเว้น แหล่งที่มาสนับสนุนความจำเป็นในการทดสอบดังกล่าว แต่ไม่ได้แสดงว่าวิธีการแก้ไขที่เสนอนั้นเพียงพอสำหรับการตีพิมพ์ การเก็บถาวร หรือการใช้งานที่มีเดิมพันสูงอื่นๆ ซึ่งจะทำให้ผลลัพธ์ที่รายงานเชื่อมโยงกับการตั้งค่าและขอบเขตที่ระบุไว้ของการศึกษา แทนที่จะขยายออกไปนอกเหนือหลักฐานที่อธิบายไว้

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ChatGPT และ LLMอธิบายโมเดล AIจริยธรรม AIPrompt Engineeringทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?