คู่มือ AI ภาษา

การเพิ่มประสิทธิภาพ Kahneman-Tversky

Kahneman-Tversky Optimization (KTO) เป็นวิธีการจัดตำแหน่งที่เรียนรู้จากป้ายกำกับแบบยกนิ้วโป้งขึ้นหรือลงแบบง่ายๆ แทนการเปรียบเทียบแบบจับคู่

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.

เจาะลึก

KTO ซึ่งเปิดตัวโดย Ethayarajh และเพื่อนร่วมงานที่ Stanford และ Contextual AI ในปี 2024 ยืมมาจากทฤษฎีโอกาส ซึ่งเป็นผลงานที่ได้รับรางวัลโนเบลของ Daniel Kahneman และ Amos Tversky เกี่ยวกับวิธีที่มนุษย์เห็นคุณค่าของกำไรและขาดทุน วิธีการมาตรฐาน เช่น DPO จำเป็นต้องมีคู่การตั้งค่า: คำตอบที่เลือกและคำตอบที่ถูกปฏิเสธสำหรับข้อความแจ้งเดียวกัน KTO ทำงานร่วมกับข้อมูลที่ไม่ได้จับคู่แทน โดยที่แต่ละเอาต์พุตจะถูกทำเครื่องหมายว่าเป็นที่ต้องการหรือไม่พึงประสงค์ โดยสร้างการสูญเสียโดยการรับรู้ของมนุษย์ ซึ่งถือว่าการปรับปรุงของแบบจำลองในตัวอย่างเป็นการได้หรือขาดทุนที่สัมพันธ์กับจุดอ้างอิง โดยใช้การหลีกเลี่ยงการสูญเสีย ดังนั้นผลลัพธ์ที่ไม่พึงประสงค์จะถูกลงโทษอย่างรุนแรงมากกว่าการได้รับรางวัลที่ต้องการ ซึ่งช่วยให้ทีมใช้สัญญาณยกนิ้วขึ้น/ลงมากมายที่รวบรวมไว้ในแอปที่ใช้งานจริงได้

ข้อมูลเชิงลึกทางเทคนิค

KTO กำหนดฟังก์ชันค่าที่สร้างแบบจำลองตามทฤษฎีโอกาส โดยวัดว่ารางวัลโดยนัยของคำตอบนั้นอยู่สูงหรือต่ำกว่าเส้นฐานอ้างอิงมากเพียงใด (มักจะเป็นค่าเฉลี่ยของความแตกต่างของ KL จากนโยบายอ้างอิง) ตัวอย่างที่พึงประสงค์จะดันค่าขึ้น ตัวอย่างที่ไม่พึงประสงค์จะดันลง และค่าสัมประสิทธิ์การหลีกเลี่ยงการสูญเสียจะทำให้การเบี่ยงเบนเชิงลบมีน้ำหนักมากขึ้น สิ่งสำคัญที่สุดคือต้องการเพียงป้ายกำกับต่อตัวอย่าง ไม่ใช่คู่ที่ตรงกัน

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการเพิ่มประสิทธิภาพ Kahneman-Tversky

KTO เหมาะอย่างยิ่งกับผลิตภัณฑ์จริง ซึ่งผู้ใช้จะคลิกชอบหรือไม่ชอบโดยธรรมชาติ แต่ไม่ค่อยจัดอันดับสองคำตอบเคียงข้างกัน คาดว่าจะมีการนำลูปการปรับปรุงอย่างต่อเนื่องมาใช้ในวงกว้างมากขึ้น ซึ่งนำผลตอบรับจากการผลิตกลับมาใช้ใหม่ รวมถึงการวิจัยที่ปรับอัตราส่วนข้อมูลที่พึงประสงค์ต่อไม่พึงประสงค์ และน้ำหนักการสูญเสีย-รังเกียจ การผสมผสานกรอบเศรษฐศาสตร์พฤติกรรมของ KTO เข้ากับวัตถุประสงค์อื่นๆ และนำไปใช้กับข้อเสนอแนะหลายรูปแบบ ถือเป็นทิศทางที่กระตือรือร้นในขณะที่ทีมแสวงหาแนวทางจากสัญญาณในโลกแห่งความเป็นจริงที่ยุ่งเหยิง

การใช้งานจริงในโลกแห่งความเป็นจริง

การใช้การคลิกแบบยกนิ้วขึ้น/นิ้วหัวแม่มือลงจากแชทบอทที่ปรับใช้เพื่อปรับแต่งโดยไม่ต้องสร้างคู่การตั้งค่า

การจัดแนวโมเดลเมื่อคุณมีกองคำตอบ 'ดี' และ 'ไม่ดี' แต่ไม่มีการเปรียบเทียบที่ตรงกันสำหรับข้อความแจ้งเดียวกัน

ทีมผลิตภัณฑ์รีไซเคิลธงการกลั่นกรอง (ไม่พึงประสงค์) และบันทึกคำตอบ (ที่พึงประสงค์) ไว้ในการฝึกอบรม KTO

การจัดการข้อเสนอแนะที่ไม่สมดุลซึ่งการไม่ชอบนั้นหายากกว่าการชอบโดยการปรับความเกลียดชังการสูญเสียและน้ำหนักคลาสของ KTO

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kahneman-Tversky Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเพิ่มประสิทธิภาพการตั้งค่าโดยตรง

คำถามที่พบบ่อย

What is Kahneman-Tversky Optimization?

Kahneman-Tversky Optimization (KTO) เป็นวิธีการจัดตำแหน่งที่เรียนรู้จากป้ายกำกับแบบยกนิ้วโป้งขึ้นหรือลงแบบง่ายๆ แทนการเปรียบเทียบแบบจับคู่ เป็นเรื่องสำคัญเพราะว่าผลป้อนกลับแบบไบนารีนั้นง่ายกว่ามากและถูกกว่ามากในการรวบรวมมากกว่าคู่อันดับตามที่วิธีการส่วนใหญ่ต้องการ

KTO ต้องการข้อมูลประเภทใด?

KTO เรียนรู้จากป้ายกำกับยกนิ้วขึ้น/ลงตัวอย่างง่ายๆ แทนที่จะจับคู่การตั้งค่าที่ตรงกัน

KTO ได้รับแรงบันดาลใจจากผลงานชิ้นไหน?

KTO ยืมแนวคิดของทฤษฎีโอกาสในการประเมินมูลค่ากำไรและขาดทุนแบบไม่สมมาตร จึงเป็นที่มาของชื่อ

'ความเกลียดชังการสูญเสีย' ที่ใช้ใน KTO คืออะไร

ทฤษฎีพรอสเพคกล่าวว่าการสูญเสียมีมากกว่ากำไร ดังนั้น KTO จึงให้น้ำหนักการเบี่ยงเบนเชิงลบมากขึ้น

เมื่อเทียบกับ อ.ส.ค. KTO มีประโยชน์อย่างยิ่งเมื่อคุณมีอะไรบ้าง?

KTO จะส่องสว่างเมื่อผลตอบรับเป็นสัญญาณไบนารีที่ไม่ได้จับคู่ ซึ่งผลิตภัณฑ์จะรวบรวมได้ง่ายกว่าคู่อันดับ

ใน KTO ค่าเบี่ยงเบนวัดสัมพันธ์กับอะไร?

ฟังก์ชันค่าของ KTO จะตัดสินว่าการตอบสนองอยู่เหนือหรือต่ำกว่าเส้นฐานอ้างอิง โดยถือว่าสิ่งนั้นเป็นกำไรหรือขาดทุน