กลยุทธ์การแยกส่วนเอกสาร
การแบ่งส่วนเอกสารคือวิธีแบ่งข้อความยาวออกเป็นส่วนๆ ที่สามารถเรียกค้นได้ ก่อนที่จะฝังเพื่อค้นหาหรือ RAG
ภาพรวม
The chunk size and boundaries quietly determine retrieval quality, so getting them right often matters more than picking a fancier model.
เจาะลึก
การแบ่งส่วนจะเปลี่ยนเอกสารขนาดใหญ่ให้เป็นข้อความขนาดพอดีคำซึ่งพอดีกับโมเดลที่ฝังไว้ และสอดคล้องกับวิธีการถามคำถาม การแยกชิ้นส่วนที่มีขนาดคงที่จะแบ่งตามโทเค็นหรือจำนวนอักขระ ซึ่งมักจะมีการทับซ้อนกัน ดังนั้นประโยคที่คร่อมขอบเขตจึงไม่ถูกละเลย การแยกส่วนแบบเรียกซ้ำจะแยกตามลำดับชั้นของตัวคั่น (ย่อหน้า ประโยค และคำ) เพื่อให้เคารพโครงสร้างตามธรรมชาติ การแบ่งกลุ่มความหมายเป็นกลุ่มประโยคโดยการฝังความคล้ายคลึงกัน ทำลายจุดที่หัวข้อเปลี่ยนไป การแบ่งส่วนตามเอกสารจะเป็นไปตามรูปแบบ โดยแยกส่วนส่วนหัวของ Markdown แท็ก HTML หรือฟังก์ชันโค้ด ความตึงเครียดหลักคือความละเอียด: ชิ้นเล็ก ๆ ให้การจับคู่ที่แม่นยำ แต่สูญเสียบริบทโดยรอบ ในขณะที่ชิ้นใหญ่มีบริบท แต่ลดความเกี่ยวข้องและอาจเกินขีดจำกัดโทเค็น ไปป์ไลน์จำนวนมากจัดเก็บชิ้นส่วนเล็กๆ ไว้สำหรับการดึงข้อมูล แต่ป้อนข้อความพาเรนต์ที่ขยายไปยังโมเดล
ข้อมูลเชิงลึกทางเทคนิค
การทับซ้อนเป็นเคล็ดลับความน่าเชื่อถือที่ง่ายที่สุด: การทำซ้ำประมาณ 10 ถึง 20 เปอร์เซ็นต์ของโทเค็นระหว่างชิ้นที่อยู่ติดกันทำให้แน่ใจได้ว่าข้อเท็จจริงที่แยกข้ามขอบเขตยังคงปรากฏไม่เสียหายในอย่างน้อยหนึ่งชิ้น การแบ่งส่วนความหมายดำเนินต่อไปอีกขั้นด้วยการฝังแต่ละประโยคและวัดระยะห่างโคไซน์ระหว่างเพื่อนบ้าน จากนั้นจึงตัดส่วนที่ระยะทางเกินเกณฑ์ที่กำหนด สิ่งนี้จะสร้างส่วนที่มีความยาวผันแปรได้สอดคล้องกันเฉพาะจุด โดยมีค่าใช้จ่ายในการคำนวณการฝังเพิ่มเติมระหว่างการจัดทำดัชนี
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของกลยุทธ์การแยกชิ้นส่วนเอกสาร
Chunking กำลังเปลี่ยนจากขั้นตอนการประมวลผลล่วงหน้าแบบตายตัวไปสู่สิ่งที่ปรับเปลี่ยนได้และคำนึงถึงโมเดล วิธีการเช่นการแบ่งส่วนตอนท้ายจะฝังเอกสารทั้งหมดก่อน จากนั้นจึงรวมเวกเตอร์ของส่วนต่างๆ เพื่อให้แต่ละส่วนยังคงรักษาบริบททั่วโลกไว้ ตัวแยกวิเคราะห์ที่ทราบเค้าโครงจะรักษาตาราง ส่วนหัว และรูปภาพมากขึ้น แทนที่จะทำให้เป็นข้อความที่มีเสียงดัง เมื่อหน้าต่างบริบทขยายใหญ่ขึ้น ไปป์ไลน์บางส่วนจะดึงข้อมูลชิ้นส่วนน้อยลงแต่มีขนาดใหญ่ขึ้น แต่การแยกชิ้นส่วนอย่างชาญฉลาดยังคงมีความสำคัญต่อต้นทุน เวลาแฝง และความแม่นยำในการระบุตำแหน่ง แทนที่จะหายไป
การใช้งานจริงในโลกแห่งความเป็นจริง
การแยกคู่มือผลิตภัณฑ์ 200 หน้าในส่วนหัวของส่วนเพื่อให้คำถามเกี่ยวกับ 'เงื่อนไขการรับประกัน' ดึงข้อมูลเฉพาะส่วนนั้น ไม่ใช่หนังสือทั้งเล่ม
การใช้ประโยคที่ทับซ้อนกันเพื่อให้คำจำกัดความที่ครอบคลุมส่วนท้ายของย่อหน้าหนึ่งและจุดเริ่มต้นของย่อหน้าถัดไปคงเหลือเพียงส่วนเดียวอย่างน้อย
การแบ่งบทความวิจัยตามความหมาย เพื่อให้การอภิปรายวิธีการและการอภิปรายผลลัพธ์แยกจากกันและสอดคล้องกันตามหัวข้อ
การแบ่งกลุ่มโค้ดเบสตามฟังก์ชันหรือขอบเขตของคลาส เพื่อให้แบบสอบถามของนักพัฒนาดึงข้อมูลหน่วยที่สมบูรณ์และรันได้ แทนที่จะเป็นเพียงครึ่งฟังก์ชัน
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Document Chunking Strategies quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การฝังเอกสารสมมุติของ HyDE
คำถามที่พบบ่อย
What is Document Chunking Strategies?
การแบ่งส่วนเอกสารคือวิธีแบ่งข้อความยาวออกเป็นส่วนๆ ที่สามารถเรียกค้นได้ ก่อนที่จะฝังเพื่อค้นหาหรือ RAG ขนาดและขอบเขตของก้อนจะกำหนดคุณภาพการดึงข้อมูลอย่างเงียบๆ ดังนั้นการทำให้ถูกต้องมักจะมีความสำคัญมากกว่าการเลือกรุ่นที่สูงกว่า
เหตุใดจึงมักเพิ่มการทับซ้อนกันระหว่างชิ้นส่วนที่อยู่ติดกัน
การทับซ้อนกันจะทำซ้ำชิ้นส่วนของโทเค็นระหว่างเพื่อนบ้าน ดังนั้นข้อมูลที่คร่อมการแยกจะไม่ถูกตัดออกครึ่งหนึ่งและสูญหาย
การแบ่งส่วนเชิงความหมายใช้อะไรในการตัดสินใจว่าจะแยกส่วนใด
การแยกส่วนความหมายจะฝังประโยคและแบ่งส่วนที่ระยะห่างโคไซน์ระหว่างเพื่อนบ้านเพิ่มขึ้น ทำให้เกิดชิ้นส่วนที่สอดคล้องกันเฉพาะที่
อะไรคือข้อแลกเปลี่ยนหลักระหว่างชิ้นเล็กและชิ้นใหญ่มาก?
ชิ้นเล็กๆ จับคู่ได้อย่างแม่นยำแต่แยกบริบทโดยรอบ ในขณะที่ชิ้นใหญ่จะรักษาบริบทไว้แต่อาจทำให้ความเกี่ยวข้องลดลงและถึงขีดจำกัดของโทเค็น
การแบ่งส่วนแบบเรียกซ้ำจะตัดสินใจได้อย่างไรว่าจะแยกข้อความไปที่ใด
การแบ่งส่วนแบบเรียกซ้ำจะเดินตามรายการตัวแยกเพื่อเคารพโครงสร้างตามธรรมชาติในขณะที่ยังคงอยู่ภายในเป้าหมายขนาด
แนวคิดเบื้องหลังรูปแบบการดึงข้อมูล 'เล็กไปใหญ่' หรือเอกสารหลักคืออะไร
คุณจับคู่ชิ้นส่วนเล็กๆ เพื่อความแม่นยำ จากนั้นขยายไปยังข้อความพาเรนต์ที่อยู่รอบๆ เพื่อให้โมเดลได้รับบริบทที่สมบูรณ์