การสร้างแบบจำลองรางวัลแบรดลีย์-เทอร์รี่
แบบจำลองแบรดลีย์-เทอร์รี่เป็นวิธีการทางสถิติที่มีมานับศตวรรษในการเปลี่ยนการเปรียบเทียบแบบคู่ (A เต้น B) ให้เป็นคะแนนตัวเลข
ภาพรวม
ใน AI สมัยใหม่ มันขับเคลื่อนโมเดลรางวัลที่เรียนรู้ความชอบของมนุษย์จากป้ายกํากับ 'คําตอบไหนดีกว่า?' ซึ่งเป็นแกนหลักของ RLHF
เจาะลึก
Bradley-Terry เปิดตัวในปี 1952 โดยถือว่าทุกรายการมีคะแนนความแข็งแกร่งที่ซ่อนอยู่ และความน่าจะเป็นที่รายการ A ชนะรายการ B คือฟังก์ชันลอจิสติกส์ของผลต่างของคะแนน ในการจัดตำแหน่ง AI การจับคู่นี้จะแม็ปเข้ากับข้อมูลการตั้งค่าอย่างเรียบร้อย: ผู้ติดป้ายกำกับที่เป็นมนุษย์จะเห็นการตอบสนองของแบบจำลองสองแบบและเลือกแบบจำลองที่ดีกว่า แทนที่จะให้คะแนนสัมบูรณ์ที่ยากต่อการสอบเทียบ โมเดลรางวัล ซึ่งโดยปกติจะเป็นโมเดลภาษาที่มีหัวเอาต์พุตแบบสเกลาร์ ได้รับการฝึกอบรมเพื่อให้การตอบสนองที่มนุษย์ต้องการจะได้รับรางวัลสเกลาร์ที่สูงกว่า การสูญเสียคือความเป็นไปได้ของบันทึกเชิงลบของความน่าจะเป็นของแบรดลีย์-เทอร์รี่: เพิ่มล็อกซิกมอยด์ให้สูงสุด (รางวัลของที่เลือกลบรางวัลของการปฏิเสธ) โมเดลการให้รางวัลที่ได้จะให้คะแนนเอาต์พุตตามอำเภอใจ โดยให้สัญญาณว่าการเสริมอัลกอริทึมการเรียนรู้ เช่น PPO ปรับให้เหมาะสมเพื่อให้โมเดลมีประโยชน์และสอดคล้องกันมากขึ้น
ข้อมูลเชิงลึกทางเทคนิค
การสูญเสียการฝึกสำหรับการเปรียบเทียบนั้นเป็นเพียงลบ log-sigmoid ของ (r_chosen − r_rejected) ดังนั้นแบบจำลองจะเรียนรู้เฉพาะความแตกต่างเชิงสัมพัทธ์เท่านั้น ซึ่งหมายความว่าสามารถระบุรางวัลได้จนถึงค่าคงที่บวกเท่านั้น ขนาดสัมบูรณ์เป็นไปตามอำเภอใจ เนื่องจากการเปรียบเทียบของมนุษย์ทำได้ง่ายกว่าและสม่ำเสมอมากกว่าคะแนน 1 ต่อ 10 ข้อมูลของแบรดลีย์-เทอร์รี่จึงมีสัญญาณรบกวนน้อยกว่า การเพิ่มประสิทธิภาพการกำหนดลักษณะโดยตรงแสดงให้เห็นว่าคุณสามารถข้ามรูปแบบการให้รางวัลที่แยกจากกันและเพิ่มประสิทธิภาพวัตถุประสงค์ของแบรดลีย์-เทอร์รี่ได้โดยตรงจากนโยบาย
ผลกระทบเชิงกลยุทธ์
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้
ต้นทุนและงบประมาณ
คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา
ทีมงานและขั้นตอนการทำงาน
ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น
อนาคตของการสร้างแบบจำลองรางวัลแบรดลีย์-เทอร์รี่
แบรดลีย์-เทอร์รี่ถือว่าการจัดอันดับและการตั้งค่าแบบสกรรมกริยาที่สอดคล้องกันเพียงรายการเดียว ซึ่งจะพังทลายลงเมื่อมนุษย์ไม่เห็นด้วยหรือวงจรการตั้งค่า การวิจัยกำลังมุ่งสู่โมเดลที่รวบรวมการกระจายความชอบ รางวัลหลายมิติ (ความช่วยเหลือ ความปลอดภัย ความซื่อสัตย์ให้คะแนนแยกกัน) และวิธีการต่างๆ เช่น การเรียนรู้ของแนชจากความคิดเห็นของมนุษย์ที่ละทิ้งสมมติฐานแบบคะแนนเดียว DPO และตัวแปรต่างๆ เชื่อมโยงวัตถุประสงค์ของแบรดลีย์-เทอร์รี่เข้ากับการฝึกอบรมด้านนโยบายโดยตรงมากขึ้นเรื่อยๆ คาดว่าจะมีรูปแบบการเปรียบเทียบที่สมบูรณ์ยิ่งขึ้น รวมถึงการจัดอันดับมากกว่าสองรายการและการตั้งค่าที่ถ่วงน้ำหนักด้วยความมั่นใจ เพื่อลดการแฮ็กรางวัล
การใช้งานจริงในโลกแห่งความเป็นจริง
ฝึกอบรมโมเดลรางวัลใน RLHF ที่จัดอันดับการตอบสนองแชทบอทสองตัว และป้อนสัญญาณที่ดีกว่าและแย่กว่านั้นไปยังการปรับแต่ง PPO อย่างละเอียด
การเพิ่มประสิทธิภาพการกำหนดลักษณะโดยตรง ปรับแต่งแบบจำลองโดยตรงในคู่คำตอบที่เลือกและถูกปฏิเสธโดยใช้การสูญเสียบันทึกซิกมอยด์ของแบรดลีย์-เทอร์รี่
จัดอันดับผู้เล่นหมากรุกหรือ esports ผ่าน Elo ซึ่งเป็นญาติสนิทของแบบจำลอง Bradley-Terry ในผลลัพธ์ของเกม
การสร้างอันดับการแนะนำเนื้อหาจากข้อมูลการคลิก 'ผู้ใช้ที่ต้องการ A มากกว่า B' แทนที่จะให้คะแนนดาวแบบสัมบูรณ์
ความเสี่ยงและรั้ว
แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ
เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน
การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง
แผนงานการดำเนินงาน
เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ
เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ
ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม
เอกสารที่ซึ่งการสร้างแบบจำลองรางวัลของ Bradley-Terry ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างแบบจำลองรางวัล
คำถามที่พบบ่อย
Bradley-Terry Reward Modeling คืออะไร?
แบบจำลองแบรดลีย์-เทอร์รี่เป็นวิธีการทางสถิติที่มีมานับศตวรรษในการเปลี่ยนการเปรียบเทียบแบบคู่ (A เต้น B) ให้เป็นคะแนนตัวเลข ใน AI สมัยใหม่ จะขับเคลื่อนโมเดลการให้รางวัลที่เรียนรู้ความชอบของมนุษย์จาก 'คำตอบไหนดีกว่ากัน' ฉลาก หัวใจของ RLHF
แบบจำลองแบรดลีย์-เทอร์รี่แปลงเป็นคะแนนตัวเลขเท่าใด
แบรดลีย์-เทอร์รี่ใช้การเปรียบเทียบ 'A เต้น B' แบบคู่ และอนุมานคะแนนความแข็งแกร่งที่ซ่อนอยู่สำหรับแต่ละรายการ ซึ่งเป็นเหตุผลว่าทำไมจึงเหมาะกับการติดป้ายกำกับความชอบของมนุษย์ได้เป็นอย่างดี
ในแบรดลีย์-เทอร์รี่ ความน่าจะเป็นที่ A ชนะ B เป็นฟังก์ชันของอะไร
แบบจำลองตั้งค่า P(A เต้น B) เท่ากับลอจิสติก (ซิกมอยด์) ของความแตกต่างระหว่างคะแนนความแข็งแกร่งที่ซ่อนอยู่ของ A และ B
เหตุใดรางวัลของแบรดลีย์-เทอร์รี่จึงสามารถระบุได้เฉพาะค่าคงที่บวกเท่านั้น
การสูญเสียการฝึกใช้เฉพาะส่วนต่างระหว่างรางวัลที่เลือกและรางวัลที่ถูกปฏิเสธ ดังนั้นการเปลี่ยนคะแนนทั้งหมดด้วยค่าคงที่เดียวกันจะทำให้การสูญเสียไม่เปลี่ยนแปลง ขนาดสัมบูรณ์เป็นไปตามอำเภอใจ
อะไรคือการสูญเสียมาตรฐานสำหรับการเปรียบเทียบการตั้งค่าเดียวในการสร้างแบบจำลองรางวัล?
โอกาสบันทึกเชิงลบของแบรดลีย์-เทอร์รี่ลดลงเหลือลบ log-sigmoid ของผลต่างรางวัลที่เลือก-ลบ-ปฏิเสธ ส่งผลให้รางวัลของคำตอบที่เลือกสูงขึ้น
วิธีใดที่ข้ามรูปแบบการให้รางวัลที่แยกจากกันโดยการเพิ่มประสิทธิภาพวัตถุประสงค์ของแบรดลีย์-เทอร์รี่ในนโยบายโดยตรง
DPO ปรับโครงสร้างวัตถุประสงค์การตั้งค่าของแบรดลีย์-เทอร์รี่ เพื่อให้สามารถนำไปใช้กับโมเดลนโยบายได้โดยตรง โดยไม่จำเป็นต้องฝึกอบรมและสอบถามโมเดลรางวัลแบบสแตนด์อโลน