คู่มือ AI ภาษา

การเพิ่มประสิทธิภาพการตั้งค่าโดยตรง

Direct Preference Optimization (DPO) เป็นวิธีหนึ่งในการจัดโมเดลภาษาให้สอดคล้องกับความชอบของมนุษย์ โดยไม่ต้องฝึกอบรมโมเดลการให้รางวัลแยกต่างหากหรือดำเนินการเรียนรู้แบบเสริมกำลัง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It collapses a complex multi-stage pipeline into a single, stable training loss.

เจาะลึก

DPO ซึ่งเปิดตัวโดย Rafailov และเพื่อนร่วมงานที่ Stanford ในปี 2023 คิดใหม่เกี่ยวกับวิธีที่เราสอนแบบจำลองตามที่ผู้คนชอบ วิธีการแบบดั้งเดิม (RLHF) ฝึกโมเดลการให้รางวัลโดยเปรียบเทียบกับมนุษย์ จากนั้นใช้การเรียนรู้แบบเสริมเพื่อเพิ่มรางวัลนั้นให้สูงสุด ข้อมูลเชิงลึกที่สำคัญของ DPO นั้นเป็นเรื่องเกี่ยวกับคณิตศาสตร์: นโยบายที่เหมาะสมที่สุดภายใต้วัตถุประสงค์ RLHF นั้นมีความสัมพันธ์ในรูปแบบปิดกับรางวัล ดังนั้นคุณจึงสามารถจัดเรียงสมการใหม่และปรับโมเดลภาษาให้เหมาะสมได้โดยตรงบนคู่การตั้งค่า คุณให้พรอมต์ การตอบสนองที่ 'เลือก' (ที่ต้องการ) และการตอบกลับที่ 'ถูกปฏิเสธ' และการสูญเสียรูปแบบการจำแนกประเภทอย่างง่ายจะสะกิดแบบจำลองเพื่อทำให้คำตอบที่เลือกมีโอกาสค่อนข้างมากขึ้น ไม่มีโมเดลการให้รางวัล ไม่มีการสุ่มตัวอย่าง ไม่มีการแฮ็กการให้รางวัล มันวิ่งง่ายกว่าและเสถียรกว่ามาก

ข้อมูลเชิงลึกทางเทคนิค

DPO ใช้การสูญเสียเอนโทรปีข้ามแบบไบนารีมากกว่าคู่การตั้งค่า โดยจะเพิ่มอัตราส่วนความน่าจะเป็นของบันทึกของคำตอบที่เลือกโดยสัมพันธ์กับคำตอบที่ถูกปฏิเสธ โดยแต่ละรายการจะวัดโดยเทียบกับโมเดลอ้างอิงที่ค้างอยู่ (โดยปกติจะเป็นจุดเริ่มต้นที่ได้รับการปรับแต่งอย่างละเอียดภายใต้การดูแล) พารามิเตอร์อุณหภูมิเบต้าจะควบคุมว่านโยบายอาจเบี่ยงเบนจากการอ้างอิงนั้นไปไกลแค่ไหน โดยบังคับใช้ข้อจำกัด KL ที่ RLHF นำไปใช้อย่างชัดเจนโดยปริยาย รางวัลจะไม่เกิดขึ้นจริง มันมีความหมายโดยนัยในบันทึกความน่าจะเป็นของนโยบายเอง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการเพิ่มประสิทธิภาพการตั้งค่าโดยตรง

DPO กลายเป็นวิธีการจัดตำแหน่งเริ่มต้นเนื่องจากมีราคาถูกและสามารถทำซ้ำได้ และได้สร้างกลุ่มของตัวแปรต่างๆ เช่น IPO แก้ไขการตั้งค่าที่มากเกินไปบนการตั้งค่าที่ใกล้กำหนดไว้ KTO เรียนรู้จากป้ายกำกับดีหรือไม่ดีเพียงป้ายเดียวแทนที่จะเป็นคู่ และ ORPO พับการเรียนรู้ตามความชอบเป็นการปรับแต่งอย่างละเอียดโดยไม่มีโมเดลอ้างอิง คาดหวังการทำงานอย่างต่อเนื่องในการรวม DPO เข้ากับข้อมูลตามนโยบายและการลดอคติด้านความยาว/คุณภาพ ซึ่งจะลดช่องว่างที่เหลือให้แคบลงด้วย RLHF ออนไลน์เต็มรูปแบบ

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับแต่งโมเดลการแชทแบบเปิดน้ำหนักอย่างละเอียด เช่น Zephyr และอนุพันธ์ของ Llama และ Mistral จำนวนมาก ซึ่งสอดคล้องกับ DPO บนชุดข้อมูลการตั้งค่า

การลดผลลัพธ์ที่เป็นอันตรายหรือไม่ช่วยเหลือโดยใช้คู่ที่ 'เลือก' คำตอบที่ปลอดภัยและเป็นประโยชน์มากกว่าคำตอบที่เป็นปัญหา

การสอนผู้ช่วยเขียนโค้ดให้เลือกโซลูชันที่ถูกต้องและมีเอกสารประกอบดีกว่าโซลูชันแบบบั๊กกี้โดยใช้การเปรียบเทียบที่ให้คะแนนโดยนักพัฒนา

ปรับแต่งรูปแบบการสรุปเพื่อให้แบบจำลองชอบการสรุปที่กระชับและน่าเชื่อถือมากกว่าแบบที่ละเอียดหรือหลอน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเพิ่มประสิทธิภาพการตั้งค่าอัตราส่วนอัตราต่อรอง

คำถามที่พบบ่อย

What is Direct Preference Optimization?

Direct Preference Optimization (DPO) เป็นวิธีหนึ่งในการจัดโมเดลภาษาให้สอดคล้องกับความชอบของมนุษย์ โดยไม่ต้องฝึกอบรมโมเดลการให้รางวัลแยกต่างหากหรือดำเนินการเรียนรู้แบบเสริมกำลัง โดยจะยุบไปป์ไลน์หลายขั้นตอนที่ซับซ้อนให้เป็นการสูญเสียการฝึกที่มั่นคงและมั่นคง

DPO กำจัดอะไรได้บ้างเมื่อเปรียบเทียบกับ RLHF แบบดั้งเดิม

ข้อได้เปรียบหลักของ DPO คือการถอดรูปแบบการให้รางวัลที่ชัดเจนและลูปการสุ่มตัวอย่าง RL ออก โดยปรับนโยบายให้เหมาะสมโดยตรงบนคู่การตั้งค่าแทน

ตัวอย่างการฝึกอบรม DPO เดียวประกอบด้วยข้อมูลอะไรบ้าง

DPO ฝึกคู่การตั้งค่า: พรอมต์บวกหนึ่งการตอบสนองที่ต้องการ ('เลือก') และอีกหนึ่งการตอบสนองที่ไม่พึงปรารถนา ('ปฏิเสธ')

โมเดลอ้างอิงมีบทบาทอย่างไรใน อ.ส.ค.?

การอ้างอิงที่หยุดนิ่ง (โดยทั่วไปคือรุ่น SFT) จะยึดการสูญเสีย พารามิเตอร์เบต้าจะควบคุมว่านโยบายที่ได้รับการฝึกจะเคลื่อนไปได้ไกลแค่ไหน

ใน DPO 'รางวัล' เป็นตัวแทนอยู่ที่ไหน

การได้มาของ DPO แสดงให้เห็นว่ารางวัลนั้นโดยนัยในอัตราส่วนความน่าจะเป็นของบันทึกระหว่างนโยบายและการอ้างอิง ดังนั้นจึงไม่จำเป็นต้องมีรูปแบบการให้รางวัลที่ชัดเจน

พารามิเตอร์เบต้า (อุณหภูมิ) ในการควบคุม DPO คืออะไร

เบต้าควบคุมข้อจำกัด KL โดยนัย: เบต้าที่สูงกว่าจะทำให้นโยบายใกล้เคียงกับข้อมูลอ้างอิงมากขึ้น เบต้าที่ต่ำกว่าทำให้เกิดการเบี่ยงเบนมากขึ้น