คู่มือทางเทคนิค

การปรับแต่งโมเดลการฝังอย่างละเอียดเพื่อการดึงข้อมูล

การปรับแต่งโมเดลการฝังอย่างละเอียดหมายถึงการฝึกอบรมคู่ของการสืบค้นจริงและเอกสารที่ตอบคำถามเหล่านั้น เพื่อให้ข้อความที่เกี่ยวข้องกับโดเมนของคุณลงชิดกันในพื้นที่เวกเตอร์มากกว่าข้อความที่ไม่เกี่ยวข้อง

  • อ่าน 4 นาที
  • อัปเดตล่าสุด
บนหน้านี้อ่าน 4 นาที
  1. ภาพรวม
  2. เจาะลึก
  3. ผลกระทบเชิงกลยุทธ์
  4. อนาคตของการปรับแต่งโมเดลการฝังอย่างละเอียดเพื่อการดึงข้อมูล
  5. การใช้งานจริงในโลกแห่งความเป็นจริง
  6. ความเสี่ยงและรั้ว
  7. แผนงานการดำเนินงาน
  8. สำรวจต่อไป
  9. คำถามที่พบบ่อย

ภาพรวม

เป็นเรื่องสำคัญเนื่องจากคุณภาพการดึงข้อมูลจะจำกัดคุณภาพ RAG: หากไม่ดึงข้อความที่ถูกต้อง โมเดลภาษาจะใช้งานไม่ได้ และการฝังวัตถุประสงค์ทั่วไปมักจะพลาดคำศัพท์ในโดเมน ตัวย่อ และวิธีการถามคำถามของผู้ใช้

เจาะลึก

โมเดลการฝังจะเปลี่ยนข้อความให้เป็นเวกเตอร์ เพื่อให้ข้อความที่คล้ายคลึงกันทางความหมายมีเวกเตอร์ที่คล้ายกัน ซึ่งมักจะวัดจากความคล้ายคลึงของโคไซน์ ใน RAG ทั้งข้อความค้นหาและชิ้นเอกสารจะถูกฝังไว้ และชิ้นที่ใกล้ที่สุดจะถูกดึงออกมา โมเดลทั่วไปได้รับการฝึกบนเว็บแบบกว้างและข้อมูลคำถาม-คำตอบ พวกเขาทำงานได้ดีพอสมควรในทุกที่ แต่อาจประสบปัญหากับคำศัพท์เฉพาะ ชื่อผลิตภัณฑ์ภายใน และช่องว่างระหว่างวิธีที่ผู้ใช้ถามและวิธีการเขียนเอกสาร การปรับแต่งอย่างละเอียดจะปิดช่องว่างนั้นด้วยข้อมูลการฝึกอบรมในสามรูปแบบ คู่ที่เป็นบวกคือคำถามและข้อความที่ตอบ เชิงลบในชุดใช้ข้อความอื่นๆ ในชุดการฝึกอบรมเดียวกันเป็นตัวอย่างของสิ่งที่ควรได้คะแนนต่ำกว่า ข้อความเชิงลบที่ชัดเจนคือข้อความที่ดูเกี่ยวข้อง แบ่งปันคำหรือหัวข้อ แต่ไม่ตอบคำถาม ฟิล์มเนกาทีฟแบบฮาร์ดสอนให้แยกแยะอย่างละเอียดซึ่งมีความสำคัญมากที่สุด เนื่องจากฟิล์มเนกาทีฟแบบง่ายถูกแยกออกจากโมเดลพื้นฐานแล้ว แหล่งข้อมูลที่ดีได้แก่ บันทึกการค้นหาที่มีการคลิก ตั๋วสนับสนุนที่เชื่อมโยงกับบทความ หน้าคำถามที่พบบ่อย และคำค้นหาสังเคราะห์ที่สร้างจากเอกสารของคุณตามโมเดลภาษา ข้อมูลสังเคราะห์มีประโยชน์แต่ควรกรองออก เนื่องจากคำถามที่สร้างขึ้นมักจะคัดลอกถ้อยคำของเอกสารและทำให้งานง่ายเกินไป ความเข้าใจผิดที่พบบ่อยคือการปรับแต่งอย่างละเอียดเป็นวิธีแก้ปัญหาแรกสำหรับการดึงข้อมูลที่ไม่ดี มักจะแบ่งเป็นส่วนๆ ดีกว่า การเพิ่มการค้นหาคำหลัก เช่น BM25 ในการตั้งค่าแบบผสม หรือการเพิ่มการจัดอันดับใหม่จะช่วยให้ได้กำไรมากขึ้นโดยใช้ความพยายามน้อยลง การปรับแต่งอย่างละเอียดจะคุ้มค่าที่สุดเมื่อคุณวัดช่องว่างในการดึงข้อมูลและมีหรือสามารถสร้างคู่คุณภาพได้อย่างน้อยสองสามพันคู่ ข้อผิดพลาดอีกประการหนึ่งคือผลลบลวง: ผลลบเชิงลบที่ขุดขึ้นมาซึ่งตอบคำถามได้จริง การฝึกโมเดลเพื่อผลักดันคุณภาพความเสียหายออกไป โปรดทราบว่าการเปลี่ยนแปลงโมเดลการฝังจำเป็นต้องฝังคอลเลกชันเอกสารทั้งหมดอีกครั้ง เนื่องจากเวกเตอร์เก่าและใหม่ไม่สามารถเทียบเคียงได้

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการปรับแต่งโมเดลการฝังอย่างละเอียดเพื่อการดึงข้อมูล

โมเดลการฝังทั่วไปได้รับการปรับปรุงอย่างต่อเนื่องบนการวัดประสิทธิภาพสาธารณะ เช่น MTEB ซึ่งแคบลงแต่ไม่ได้ลบประโยชน์ของการปรับโดเมน เนื่องจากข้อมูลการวัดประสิทธิภาพแทบจะไม่ตรงกับคลังข้อมูลส่วนตัว การสร้างข้อมูลสังเคราะห์ด้วยแบบจำลองภาษาทำให้การปรับแต่งอย่างละเอียดเป็นประโยชน์สำหรับทีมที่ไม่มีชุดข้อมูลขนาดใหญ่ คาดหวังการใช้งานไปป์ไลน์แบบไฮบริดอย่างต่อเนื่อง โดยที่โมเดลการฝังที่ได้รับการปรับแต่งอย่างละเอียดจะจัดการการเรียกคืนในขั้นตอนแรก และผู้จัดอันดับใหม่จะจัดการอย่างแม่นยำ พฤติกรรมการวัดผลมีความสำคัญมากที่สุด: ทีมที่ติดตามการเรียกคืนจากการสืบค้นจริงจะรู้ว่าเมื่อการปรับแต่งแบบละเอียดได้ผลดี

การใช้งานจริงในโลกแห่งความเป็นจริง

บริษัทประกันภัยฝึกอบรมการฝังคำถามของลูกค้าคู่หนึ่งและข้อกำหนดของกรมธรรม์ที่ตอบคำถามเหล่านั้น ดังนั้น 'โทรศัพท์ของฉันจะได้รับการคุ้มครองหากฉันทำโทรศัพท์ตก' เพื่อเรียกคืนข้อความเสียหายจากอุบัติเหตุ

บริษัทซอฟต์แวร์ใช้ประวัติตั๋วสนับสนุน โดยจับคู่คำถามของตั๋วแต่ละใบกับตัวแทนบทความช่วยเหลือที่ลิงก์ไว้ในการตอบกลับ เป็นข้อมูลการฝึกอบรมฟรี

ทีมวิจัยด้านกฎหมายจะเจาะลึกประเด็นเชิงลบโดยการใช้ประโยคที่ใช้คำหลักร่วมกันกับข้อความค้นหา แต่ระบุถึงเขตอำนาจศาลอื่น โดยสอนแบบจำลองให้แยกคำเหล่านั้นออกจากกัน

ทีมเภสัชกรรมสร้างคำถามสังเคราะห์จากเอกสารภายในด้วยโมเดลภาษา กรองคำถามคุณภาพต่ำออก และใช้คู่เพื่อฝึกโมเดลการฝังโดเมน

ความเสี่ยงและรั้ว

  • การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

  • ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

  • ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

  1. กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

  2. เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

  3. การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

  4. เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fine-Tuning Embedding Models for Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

โมเดลการฝังแบบละเอียดสำหรับการเรียกค้นคืออะไร

การปรับแต่งโมเดลการฝังอย่างละเอียดหมายถึงการฝึกอบรมคู่ของการสืบค้นจริงและเอกสารที่ตอบคำถามเหล่านั้น เพื่อให้ข้อความที่เกี่ยวข้องกับโดเมนของคุณลงชิดกันในพื้นที่เวกเตอร์มากกว่าข้อความที่ไม่เกี่ยวข้อง เป็นเรื่องสำคัญเนื่องจากคุณภาพการดึงข้อมูลจะจำกัดคุณภาพ RAG: หากไม่ดึงข้อความที่ถูกต้อง โมเดลภาษาจะใช้งานไม่ได้ และการฝังวัตถุประสงค์ทั่วไปมักจะพลาดคำศัพท์ในโดเมน ตัวย่อ และวิธีการถามคำถามของผู้ใช้

อะไรคือสิ่งที่เป็นลบอย่างหนักในการฝังการปรับแต่งแบบละเอียด?

คำเชิงลบที่ชัดเจนจะใช้คำหรือหัวข้อร่วมกับคำถามแต่ไม่ถูกต้อง ซึ่งเป็นการสอนโมเดลให้แยกแยะความแตกต่างได้เป็นอย่างดี

เหตุใดฟิล์มเนกาทีฟแบบแข็งจึงมีประโยชน์มากกว่าฟิล์มเนกาทีฟแบบง่าย

เชิงลบแบบง่ายอยู่ไกลจากแบบสอบถามอยู่แล้ว เชิงลบอย่างหนักบังคับให้โมเดลเรียนรู้ความแตกต่างที่ลึกซึ้ง

ค่าลบลวงในบริบทนี้คืออะไร

หากแง่ลบที่เกี่ยวข้องกันจริง ๆ การฝึกอบรมจะผลักคำตอบที่ถูกต้องออกไปและส่งผลเสียต่อการเรียกค้นกลับคืนมา

การสูญเสียใดที่มักใช้สำหรับการฝึกโมเดลการฝังในคู่ข้อความค้นหา

ความสูญเสียที่ตรงกันข้ามจะให้ผลบวกต่อผลลบแบบในแบตช์และผลลบแบบฮาร์ด โดยผลักดันให้ผลบวกขึ้นไปอยู่ด้านบน

หลังจากเปลี่ยนมาใช้โมเดลการฝังที่ได้รับการปรับแต่งใหม่แล้ว คุณต้องทำอะไรกับดัชนีเอกสารของคุณ

เวกเตอร์จากโมเดลที่แตกต่างกันไม่สามารถเทียบเคียงได้ ดังนั้นคอลเลกชันทั้งหมดจึงต้องถูกฝังใหม่

เรียนรู้ต่อไป

คำแนะนำที่เกี่ยวข้อง

คำแนะนำเพิ่มเติมที่เลือกสำหรับหัวข้อนี้