คู่มือทางเทคนิค

RAG แบบเก็งกำไรและการร่างแบบดึงข้อมูลแบบเสริม

RAG แบบเก็งกำไรเพิ่มความเร็วและทำให้การสร้างการดึงข้อมูลเสริมคมชัดขึ้นโดยการใช้แบบจำลองขนาดเล็กที่รวดเร็วในการร่างคำตอบที่เป็นตัวเลือกหลายรายการจากเอกสารที่ดึงข้อมูล ซึ่งจากนั้นแบบจำลองที่ใหญ่กว่าจะตรวจสอบ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it cuts latency and reduces the confusion large models suffer when stuffed with many long passages.

เจาะลึก

Classic RAG ดึงเอกสารที่ดึงมาทั้งหมดมาไว้ในโมเดลภาษาเดียวขนาดใหญ่ ซึ่งช้าและมีแนวโน้มที่จะสูญเสียโฟกัสเมื่อบริบทมีความยาว เก็งกำไร RAG แบ่งงาน โมเดล 'ผู้ร่าง' ที่เชี่ยวชาญขนาดเล็กกว่าจะได้รับกลุ่มเอกสารที่ดึงมา และสร้างคำตอบของผู้สมัครหลายรายพร้อมกัน โดยแต่ละคำตอบมีพื้นฐานมาจากหลักฐานชุดย่อยที่แตกต่างกันและมาพร้อมกับเหตุผล โมเดล 'ผู้ตรวจสอบ' ที่ใหญ่ขึ้นจะให้คะแนนแบบร่างเหล่านี้และเลือกแบบร่างที่ดีที่สุด แทนที่จะอ่านเอกสารทั้งหมดเอง เนื่องจากรุ่นเล็กรองรับการอ่านค่าหนัก และรุ่นใหญ่ตัดสินเฉพาะฉบับร่างสั้น ระบบจึงเร็วกว่าและมักจะแม่นยำกว่า ขั้นตอนการจัดกลุ่มช่วยให้มั่นใจว่าฉบับร่างครอบคลุมมุมมองที่หลากหลาย แทนที่จะเป็นข้อความที่ซ้ำซ้อน

ข้อมูลเชิงลึกทางเทคนิค

เอกสารที่ดึงมาจะถูกจัดกลุ่มตามความคล้ายคลึงกันของเนื้อหา จากนั้นเอกสารหนึ่งชุดจะถูกสุ่มตัวอย่างจากแต่ละคลัสเตอร์เพื่อสร้างชุดย่อยที่หลากหลายและไม่ซ้ำซ้อน ตัวร่างแบบไลท์เวทจะสร้างคำตอบบวกเหตุผลสำหรับแต่ละเซตย่อยแบบขนาน ผู้ตรวจสอบจะคำนวณคะแนนความเชื่อมั่นโดยการรวมความสม่ำเสมอในตนเองของร่าง ความน่าจะเป็นแบบมีเงื่อนไขของเหตุผล และสัญญาณการสะท้อนกลับตนเอง จากนั้นเลือกร่างที่ได้คะแนนสูงสุด แผนกแรงงานนี้สะท้อนการถอดรหัสแบบเก็งกำไร: ข้อเสนอคู่ขนานราคาถูก เช็คที่เชื่อถือได้หนึ่งรายการ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการเก็งกำไร RAG และการร่างแบบดึงข้อมูลเพิ่มเติม

RAG แบบเก็งกำไรชี้ไปที่ระบบการดึงข้อมูลแบบโมดูลาร์ซึ่งมีการปรับแต่งเครื่องร่างกลั่นขนาดเล็กต่อโดเมนและสลับหลังเครื่องตรวจสอบที่ใช้ร่วมกัน คาดหวังการบูรณาการที่เข้มงวดยิ่งขึ้นกับไปป์ไลน์ตัวแทน จำนวนแบบร่างที่ปรับเปลี่ยนได้ตามความยากของคำถาม และผู้ตรวจสอบที่ทำเครื่องหมายหลักฐานที่ไม่เพียงพอด้วย เมื่อหน้าต่างบริบทเติบโตขึ้น ค่าจะเปลี่ยนจากการอัดแน่นข้อความมากขึ้นเป็นการให้เหตุผลแบบขนานอย่างชาญฉลาดเหนือหลักฐาน ทำให้สถาปัตยกรรมแบบร่างและตรวจสอบเป็นค่าเริ่มต้นที่มีแนวโน้มสำหรับการตอบคำถามที่มีพื้นฐาน

การใช้งานจริงในโลกแห่งความเป็นจริง

ผู้ช่วยถามตอบทางการแพทย์โดยที่ผู้ร่างรายย่อยอ่านแนวปฏิบัติทางคลินิกแบบกลุ่มพร้อมกัน และแบบจำลองที่ใหญ่กว่าจะตรวจสอบคำตอบที่ปลอดภัยที่สุดและได้รับการสนับสนุนที่ดีที่สุด

บอทการค้นหาระดับองค์กรที่ร่างคำตอบของผู้สมัครหลายรายจากกลุ่มเอกสารต่างๆ เพื่อลดเวลาแฝงในการตอบกลับบนฐานความรู้ที่ยาวนาน

เครื่องมือวิจัยทางกฎหมายที่สร้างการตีความที่แข่งขันกันซึ่งมีพื้นฐานอยู่ในชุดย่อยของ case-law ที่แตกต่างกัน จากนั้นจัดอันดับด้วยแบบจำลองผู้ตรวจสอบ

ระบบสนับสนุนลูกค้าที่กลั่นกรองผู้ร่างเฉพาะโดเมนเพื่อจัดการคู่มือผลิตภัณฑ์ ในขณะที่ผู้ตรวจสอบทั่วไปช่วยให้แน่ใจว่ามีพื้นฐานข้อเท็จจริง

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative RAG and Retrieval-Augmented Drafting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

Self-RAG และการดึงข้อมูลแบบสะท้อนแสง

คำถามที่พบบ่อย

What is Speculative RAG and Retrieval-Augmented Drafting?

RAG แบบเก็งกำไรเพิ่มความเร็วและทำให้การสร้างการดึงข้อมูลเสริมคมชัดขึ้นโดยการใช้แบบจำลองขนาดเล็กที่รวดเร็วในการร่างคำตอบที่เป็นตัวเลือกหลายรายการจากเอกสารที่ดึงข้อมูล ซึ่งจากนั้นแบบจำลองที่ใหญ่กว่าจะตรวจสอบ สิ่งสำคัญคือเนื่องจากจะลดเวลาในการตอบสนองและลดความสับสนที่โมเดลขนาดใหญ่ต้องเผชิญเมื่ออัดแน่นไปด้วยข้อความยาวๆ มากมาย

ใน Speculative RAG โมเดลขนาดเล็กมีบทบาทอย่างไร

'draft' แบบน้ำหนักเบาจะอ่านชุดย่อยของเอกสารแบบคลัสเตอร์และสร้างคำตอบของผู้สมัครที่มีการต่อสายดินหลายคำตอบพร้อมกัน

เหตุใดเอกสารที่ดึงมาจึงถูกรวมกลุ่มก่อนการร่าง

การจัดกลุ่มและการสุ่มตัวอย่างหนึ่งเอกสารต่อคลัสเตอร์ทำให้แต่ละร่างมีหลักฐานที่ชัดเจนและไม่ทับซ้อนกัน ซึ่งสนับสนุนคำตอบที่หลากหลาย

โมเดล 'ผู้ตรวจสอบ' ที่ใหญ่กว่าทำหน้าที่อะไรเป็นหลัก

แทนที่จะอ่านเอกสารทั้งหมด ผู้ตรวจสอบจะประเมินฉบับร่างและเหตุผลสั้นๆ และเลือกคำตอบที่ได้คะแนนสูงสุด

Speculative RAG ลดเวลาแฝงเมื่อเปรียบเทียบกับ RAG มาตรฐานอย่างไร

โมเดลขนาดใหญ่ราคาแพงไม่กินข้อความยาวๆ อีกต่อไป โดยจะตรวจสอบเฉพาะฉบับร่างสั้นๆ เท่านั้น ในขณะที่การร่างแบบขนานจะจัดการการอ่าน

โครงสร้างแบบร่างแล้วตรวจสอบของเก็งกำไร RAG มีแนวคิดคล้ายกับเทคนิคการถอดรหัสใด

ทั้งสองใช้ข้อเสนอคู่ขนานราคาถูกจากรุ่นขนาดเล็ก ตามด้วยการตรวจสอบที่เชื่อถือได้จากรุ่นใหญ่กว่า