การเพิ่มประสิทธิภาพการตั้งค่าอัตราส่วนอัตราต่อรอง
Odds Ratio Preference Optimization (ORPO) เป็นวิธีการปรับแต่งที่สอนแบบจำลองภาษาพฤติกรรมที่ดีและความชอบของมนุษย์ในบัตรผ่านการฝึกอบรมใบเดียว
ภาพรวม
It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.
เจาะลึก
ORPO ซึ่งเปิดตัวโดย Hong, Lee และ Thorne ในปี 2024 ได้รวมการปรับแต่งอย่างละเอียดภายใต้การดูแลและการจัดตำแหน่งการตั้งค่าไว้ในขั้นตอนเดียว ไปป์ไลน์การจัดตำแหน่งส่วนใหญ่จะทำ SFT ตามตัวอย่างที่ดีก่อน จากนั้นจึงเรียกใช้วิธีที่สอง เช่น RLHF หรือ DPO ที่ต้องมีสำเนาของโมเดลที่ถูกแช่แข็ง (ข้อมูลอ้างอิง) บวกกับคู่การตั้งค่าที่เก็บไว้ ORPO จะลบโมเดลอ้างอิงออกทั้งหมด การสูญเสียจะเพิ่มโทษให้กับวัตถุประสงค์โทเค็นถัดไปมาตรฐาน: เพิ่มอัตราต่อรองที่แบบจำลองกำหนดให้กับการตอบสนองที่เลือก (ที่ต้องการ) ในขณะเดียวกันก็ลดโอกาสของการถูกปฏิเสธ เนื่องจากใช้อัตราส่วนอัตราต่อรองมากกว่าช่องว่างความน่าจะเป็นของบันทึกที่แข็งแกร่ง บทลงโทษจึงไม่รุนแรง ดังนั้นแบบจำลองจึงเรียนรู้ที่จะสนับสนุนคำตอบที่ดีโดยไม่ลืมการสร้างคล่องอย่างหายนะ
ข้อมูลเชิงลึกทางเทคนิค
การสูญเสียของ ORPO คือการสูญเสียเอนโทรปีข้าม SFT บวกกับบันทึกซิกมอยด์แบบถ่วงน้ำหนักของอัตราส่วนอัตราต่อรองของบันทึกระหว่างคำตอบที่เลือกและถูกปฏิเสธ อัตราต่อรองเท่ากับ p/(1-p) ดังนั้นอัตราส่วนจะเปรียบเทียบว่าแบบจำลองมีโอกาสมากน้อยเพียงใดที่จะพบคำตอบที่ดีกับคำตอบที่แย่ การใช้อัตราต่อรองแทนความน่าจะเป็นแบบดิบจะรักษาค่าคอนทราสต์ที่ไม่รุนแรง ซึ่งป้องกันการปราบปรามโทเค็นที่ถูกปฏิเสธมากเกินไป ซึ่งอาจทำให้โมเดลที่ไม่มีการอ้างอิงลดลงได้
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการเพิ่มประสิทธิภาพการตั้งค่าอัตราส่วนอัตราต่อรอง
ORPO กำลังได้รับความสนใจเนื่องจากจะตัดหน่วยความจำและการประมวลผลโดยการลดโมเดลอ้างอิงลง ซึ่งน่าสนใจสำหรับทีมที่ปรับแต่งฮาร์ดแวร์ที่มีจำกัด คาดว่าจะปรากฏบ่อยขึ้นในสูตรอาหารโอเพ่นซอร์สและเป็นตัวเลือกเริ่มต้นในไลบรารีเช่น Hugging Face TRL งานในอนาคตมีแนวโน้มที่จะปรับการถ่วงน้ำหนักแลมบ์ดาโดยอัตโนมัติ ผสมผสาน ORPO กับวัตถุประสงค์ที่ไม่มีการอ้างอิงอื่นๆ และขยายไปสู่โมเดลหลายรูปแบบและมีขนาดใหญ่มาก ซึ่งการเก็บสำเนาสองชุดในหน่วยความจำมีค่าใช้จ่ายสูง
การใช้งานจริงในโลกแห่งความเป็นจริง
ปรับแต่งโมเดลแชทโอเพ่นซอร์ส 7B บนคู่การตั้งค่าโดยไม่ต้องโหลดสำเนาอ้างอิงที่สอง ลดหน่วยความจำ GPU ลงครึ่งหนึ่ง
สตาร์ทอัพที่จัดผู้ช่วยฝ่ายสนับสนุนลูกค้าให้ต้องการคำตอบที่สุภาพและเป็นไปตามนโยบายในการฝึกอบรมครั้งเดียวแทน SFT-then-DPO
นักวิจัยเปรียบเทียบ ORPO กับ DPO บนชุดข้อมูลเดียวกันเพื่อแสดงการจัดตำแหน่งที่เทียบเคียงได้กับการประมวลผลที่ต่ำกว่า
การปรับแบบจำลองฐานให้เข้ากับโดเมนเฉพาะ (เช่น การร่างกฎหมาย) ซึ่งมีคู่ตัวอย่างที่ดีและไม่ดีให้เลือก แต่ไม่มีงบประมาณสำหรับแบบจำลองรางวัล
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Odds Ratio Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การเพิ่มประสิทธิภาพการตั้งค่าโดยตรง
คำถามที่พบบ่อย
What is Odds Ratio Preference Optimization?
Odds Ratio Preference Optimization (ORPO) เป็นวิธีการปรับแต่งที่สอนแบบจำลองภาษาพฤติกรรมที่ดีและความชอบของมนุษย์ในบัตรผ่านการฝึกอบรมใบเดียว เป็นเรื่องสำคัญเนื่องจากข้ามโมเดลการให้รางวัลและโมเดลอ้างอิงที่แยกจากกันตามปกติ ทำให้การจัดตำแหน่งถูกลงและง่ายขึ้น
ข้อได้เปรียบเชิงปฏิบัติหลักของ ORPO เหนือวิธีการเช่น DPO คืออะไร
ORPO พับการเรียนรู้ตามความชอบไปเป็นการสูญเสีย SFT และไม่จำเป็นต้องมีสำเนาอ้างอิงของโมเดลที่ค้าง ซึ่งช่วยประหยัดหน่วยความจำและการคำนวณ
'อัตราส่วนอัตราต่อรอง' ใน ORPO เปรียบเทียบอะไร
ORPO ใช้อัตราส่วนของอัตราต่อรอง (p/(1-p)) ที่แบบจำลองกำหนดให้กับคำตอบที่ต้องการเทียบกับคำตอบที่ไม่ต้องการ
ORPO ดำเนินการสองงานใดในบัตรฝึกอบรมใบเดียว
ORPO รวมวัตถุประสงค์โทเค็นถัดไป SFT มาตรฐานเข้ากับการลงโทษตามความชอบในการสูญเสียแบบรวมครั้งเดียว
เหตุใด ORPO จึงใช้อัตราต่อรองมากกว่าผลต่างบันทึกความน่าจะเป็นแบบดิบสำหรับการลงโทษ
การลงโทษตามอัตราต่อรองนั้นรุนแรงกว่า ช่วยให้โมเดลที่ไม่มีการอ้างอิงสามารถสร้างได้อย่างคล่องแคล่วในขณะที่ยังคงต้องการคำตอบที่ดี
การสูญเสีย ORPO อธิบายได้ดีที่สุดว่าเป็นค่าผสมใด
ORPO เพิ่มเงื่อนไขอัตราต่อรองแบบล็อก-ซิกมอยด์แบบถ่วงน้ำหนัก นอกเหนือจากการสูญเสียเอนโทรปีข้ามที่ได้รับการดูแล