คู่มือพื้นฐาน

การทำให้เป็นมาตรฐานความยาวในการเพิ่มประสิทธิภาพการตั้งค่า

การทำให้เป็นมาตรฐานของความยาวจะปรับวัตถุประสงค์ในการปรับแต่งตามความชอบ ดังนั้นโมเดลจะหยุดการอนุมัติเพียงแค่เขียนคำตอบที่ยาวขึ้นเท่านั้น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันสําคัญเพราะสัญญาณรางวัลที่ไม่ได้รับการแก้ไขจะผลักดันแชทบอทไปสู่คําตอบที่ยาวและยืดเยื้อแทนที่จะเป็นคําตอบที่ดีกว่าจริง ๆ

เจาะลึก

เมื่อแบบจำลองสอดคล้องกับวิธีการ เช่น RLHF หรือ DPO แบบจำลองจะเรียนรู้จากการเปรียบเทียบว่ามนุษย์ (หรือแบบจำลองการให้รางวัล) เลือกคำตอบที่ "ดีกว่า" จากสองคำตอบอย่างไร ข้อบกพร่องที่เกิดขึ้นอย่างต่อเนื่องคือคำตอบที่ยาวกว่ามีแนวโน้มที่จะได้รับความนิยม แม้ว่าจริงๆ แล้วจะไม่ดีกว่าก็ตาม ดังนั้นโมเดลจึงเรียนรู้ทางลัด: ใช้ถ้อยคำ การทำให้เป็นมาตรฐานของความยาวจะต่อต้านสิ่งนี้ ใน DPO รางวัลโดยนัยคือผลรวมของความแตกต่างความน่าจะเป็นของบันทึกต่อโทเค็น ซึ่งจะเพิ่มขึ้นตามความยาวโดยอัตโนมัติ ตัวแปรต่างๆ เช่น DPO และ SimPO ที่ปรับความยาวให้เป็นมาตรฐานจะหารรางวัลนั้นด้วยจำนวนโทเค็น โดยให้คะแนนตามค่าเฉลี่ยต่อโทเค็นแทน ผลลัพธ์ที่ได้คือโมเดลที่กระชับและตรงประเด็น แทนที่จะเพิ่มการตอบสนองต่อวัตถุประสงค์ของเกม

ข้อมูลเชิงลึกทางเทคนิค

รางวัลโดยนัยของ DPO คืออัตราส่วนบันทึกระหว่างนโยบายที่ได้รับการปรับแต่งและนโยบายอ้างอิง ซึ่งรวมเข้ากับทุกโทเค็นในการตอบกลับ เนื่องจากแต่ละโทเค็นจะเพิ่มคำอีกคำหนึ่ง (โดยปกติจะเป็นค่าบวก) รางวัลดิบจะปรับขนาดตามความยาวของลำดับ โดยจะปรับให้เหมาะสมเพื่อความสำเร็จที่นานขึ้น SimPO ยกเลิกโมเดลอ้างอิงและใช้ความน่าจะเป็นของบันทึกโดยเฉลี่ยต่อโทเค็นเป็นรางวัล บวกกับส่วนต่างรางวัลเป้าหมาย การหารด้วยความยาวจะทำให้ข้อดีของความยาวเชิงกลหายไป ดังนั้นการไล่ระดับตามความชอบจึงสะท้อนถึงคุณภาพมากกว่าจำนวนคำ

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของการทำให้ความยาวเป็นมาตรฐานในการเพิ่มประสิทธิภาพการตั้งค่า

คาดว่าการควบคุมความยาวจะกลายเป็นปุ่มมาตรฐานแทนที่จะเป็นสิ่งที่คิดในภายหลัง นักวิจัยกำลังรวมการปรับความยาวให้เป็นมาตรฐานเข้ากับบทลงโทษความยาวที่ชัดเจน รางวัลที่มีเงื่อนไขตามความยาว และชุดการประเมินที่คงความยาวคำตอบไว้คงที่เพื่อวัดคุณภาพที่เพิ่มขึ้นอย่างแท้จริง เมื่อโมเดลรางวัลได้รับการปรับปรุงให้ดีขึ้นในการตรวจจับอคติการใช้คำฟุ่มเฟือย ไปป์ไลน์การจัดแนวมีแนวโน้มที่จะรายงานอัตราการชนะแบบลดอคติด้านความยาวตามค่าเริ่มต้น และผู้ใช้จะสามารถควบคุมได้ดียิ่งขึ้นว่าคำตอบของโมเดลควรกระชับหรือละเอียดเพียงใด

การใช้งานจริงในโลกแห่งความเป็นจริง

ปรับแต่งผู้ช่วยสนับสนุนลูกค้าด้วย SimPO เพื่อให้การตอบกลับที่คมชัดและแม่นยำ แทนที่จะใช้ย่อหน้าที่ดูอย่างละเอียดเท่านั้น

การรายงาน 'อัตราการชนะที่ควบคุมความยาว' บน AlpacaEval 2 เพื่อแสดงแบบจำลองที่ได้รับการปรับปรุงอย่างแท้จริง แทนที่จะเพียงแค่พูดคุยมากขึ้น

การเพิ่มการทำให้เป็นมาตรฐานของความยาวให้กับ DPO เมื่อปรับแต่งโมเดลการเข้ารหัสอย่างละเอียด เพื่อที่จะส่งตัวอย่างข้อมูลที่ถูกต้องน้อยที่สุด ไม่ใช่สำเร็จรูปที่บวม

การวินิจฉัยรูปแบบการให้รางวัลที่ให้คะแนนเรียงความที่ยาวกว่าอย่างเป็นระบบ จากนั้นให้ลดอคติก่อนที่จะใช้เพื่อจัดตำแหน่งผู้ช่วยเขียน

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ซึ่งการปรับความยาวให้เป็นมาตรฐานในการเพิ่มประสิทธิภาพการตั้งค่าช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเพิ่มประสิทธิภาพการตั้งค่าอัตราส่วนอัตราต่อรอง

คำถามที่พบบ่อย

การทําให้เป็นมาตรฐานความยาวในการเพิ่มประสิทธิภาพความชอบคืออะไร?

การทำให้เป็นมาตรฐานของความยาวจะปรับวัตถุประสงค์ในการปรับแต่งตามความชอบ ดังนั้นโมเดลจะหยุดการอนุมัติเพียงแค่เขียนคำตอบที่ยาวขึ้นเท่านั้น สิ่งสำคัญคือเนื่องจากสัญญาณรางวัลที่ไม่ถูกต้องจะผลักดันให้แชทบอทหันไปตอบสนองแบบละเอียดและมีการตอบกลับ แทนที่จะเป็นสัญญาณที่ดีกว่าอย่างแท้จริง

การทำให้ความยาวเป็นมาตรฐานใน DPO นั้นมีพฤติกรรมที่ไม่พึงประสงค์อะไรบ้างที่มีจุดมุ่งหมายเพื่อป้องกันเป็นหลัก

รางวัลโดยนัยของ DPO จะเพิ่มขึ้นตามจำนวนโทเค็น ดังนั้นหากไม่มีโมเดลการทำให้เป็นมาตรฐานจะเรียนรู้ว่าการใช้รายละเอียดมากขึ้นมีแนวโน้มที่จะชนะการเปรียบเทียบตามความชอบ

เหตุใดรางวัลโดยนัยของ DPO มาตรฐานจึงมีแนวโน้มเพิ่มขึ้นตามระยะเวลาตอบกลับ

รางวัลโดยนัยจะรวมอัตราส่วนความน่าจะเป็นของบันทึกในทุกโทเค็น ดังนั้นโดยทั่วไปแล้ว โทเค็นที่มากขึ้นหมายถึงรางวัลรวมที่มากขึ้น

SimPO จัดการกับอคติด้านความยาวอย่างไร

SimPO ให้คะแนนการตอบสนองตามความน่าจะเป็นของบันทึกโดยเฉลี่ย (ความยาวปกติ) และเพิ่มส่วนต่างรางวัลเป้าหมาย โดยลบข้อได้เปรียบด้านความยาวเชิงกลออกไป

แนวทางปฏิบัติในการประเมินข้อใดที่ช่วยยืนยันว่าแบบจำลองมีการปรับปรุงคุณภาพมากกว่าแค่ความยาว

อัตราการชนะที่ควบคุมความยาว (เช่นเดียวกับ AlpacaEval 2) จะปรับตามความยาวของคำตอบ ดังนั้นกำไรที่ได้จะสะท้อนถึงคุณภาพ ไม่ใช่การใช้คำฟุ่มเฟือย