คู่มือ AI ภาษา

การถอดรหัสความสม่ำเสมอในตนเอง

ความสม่ำเสมอในตนเองเป็นกลยุทธ์การถอดรหัสที่สุ่มตัวอย่างเส้นทางการให้เหตุผลที่แตกต่างกันมากมายจากแบบจำลองภาษา แล้วเลือกคำตอบที่ส่วนใหญ่เห็นด้วย

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because a single greedy answer can be wrong, while the consensus across diverse attempts is far more often correct.

เจาะลึก

เปิดตัวโดยนักวิจัย Google ในปี 2022 ความสม่ำเสมอในตนเองมาแทนที่การถอดรหัสแบบ 'โลภ' ตามปกติ โดยที่แบบจำลองจะยอมรับโทเค็นถัดไปที่น่าจะเป็นไปได้มากที่สุดในแต่ละขั้นตอน ด้วยแนวทางการสุ่มตัวอย่างและการโหวต แนวคิดนี้สร้างขึ้นจากการกระตุ้นแบบลูกโซ่แห่งความคิด: แบบจำลองจะถูกขอให้ให้เหตุผลทีละขั้นตอน แต่แทนที่จะสร้างห่วงโซ่เดียว โมเดลจะสุ่มตัวอย่างโซ่ที่หลากหลายจำนวนมากโดยใช้อุณหภูมิที่ไม่ใช่ศูนย์ แต่ละห่วงโซ่อาจใช้เส้นทางที่แตกต่างกัน แต่การให้เหตุผลที่ถูกต้องมีแนวโน้มที่จะมาบรรจบกันในคำตอบสุดท้ายเดียวกัน ในขณะที่ข้อผิดพลาดกระจัดกระจายไปในทิศทางที่ต่างกัน จากนั้นระบบจะใช้เสียงข้างมากเหนือคำตอบสุดท้าย การเปลี่ยนแปลงง่ายๆ นี้ทำให้ได้ประโยชน์อย่างมากจากเกณฑ์มาตรฐานทางคณิตศาสตร์และการใช้เหตุผลทั่วไป เช่น GSM8K ซึ่งมักจะเพิ่มการปรับปรุงความแม่นยำเป็นเลขสองหลักโดยไม่ต้องมีการฝึกอบรมใหม่

ข้อมูลเชิงลึกทางเทคนิค

วิธีการนี้ใช้ประโยชน์จากสัญชาตญาณว่ามีวิธีที่ถูกต้องหลายวิธีในการหาคำตอบที่ถูกต้อง แต่วิธีที่จะผิดนับไม่ถ้วน โดยการสุ่มตัวอย่างโซ่ 40 เส้นที่มีอุณหภูมิสูงกว่าศูนย์ แบบจำลองจะให้เหตุผลที่หลากหลาย เฉพาะคำตอบสุดท้ายเท่านั้นที่จะถูกรวบรวมโดยการลงคะแนนเสียงข้างมากแบบชายขอบ ข้อความการให้เหตุผลจะถูกละทิ้ง โดยทั่วไปความแม่นยำจะเพิ่มขึ้นเมื่อมีตัวอย่างมากขึ้นแต่ด้วยผลตอบแทนที่น้อยลง ต้องใช้การคำนวณการอนุมานเพิ่มเติมเพื่อความน่าเชื่อถือ ไม่จำเป็นต้องมีข้อมูลที่มีป้ายกำกับหรือการปรับแต่งอย่างละเอียด

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการถอดรหัสความสม่ำเสมอในตนเอง

ความสม่ำเสมอในตนเองเป็นตัวอย่างพื้นฐานของการปรับขนาดเวลาอนุมาน และตอนนี้รุ่นต่อๆ ไปของโมเดลนี้ขับเคลื่อนโมเดลการให้เหตุผลซึ่งใช้การประมวลผลเพิ่มเติมเพื่อคิดให้หนักขึ้น แนวทางในอนาคต ได้แก่ การถ่วงน้ำหนักคะแนนโดยผู้ตรวจสอบที่เรียนรู้หรือคะแนนความเชื่อมั่น แทนที่จะนับเท่ากัน การเลือกจำนวนตัวอย่างที่จะวาดตามความยากของคำถาม และการรวมการลงคะแนนเข้ากับกรอบการค้นหา เช่น Tree of Thoughts คาดว่าระบบจะยังคงเป็นพื้นฐานราคาถูกและไม่ต้องฝึกอบรมซึ่งระบบต่างๆ สามารถซ้อนกันได้ เมื่อความถูกต้องมีความสำคัญมากกว่าเวลาแฝง

การใช้งานจริงในโลกแห่งความเป็นจริง

เพิ่มความแม่นยำในการแก้ปัญหาคำศัพท์ทางคณิตศาสตร์ในโรงเรียนประถมศึกษา (GSM8K) โดยการสุ่มตัวอย่างเส้นทางการแก้ปัญหาจำนวนมากและการลงคะแนนเสียงในหมายเลขสุดท้าย

การปรับปรุงความน่าเชื่อถือของคำถามทั่วไปหลายขั้นตอนในการตอบคำถาม โดยที่ห่วงโซ่เดียวอาจลื่นไหลในการอนุมานเดียว

เพิ่มความมั่นใจในคำตอบการสร้างโค้ดด้วยการตรวจสอบว่าเอาต์พุตใดปรากฏขึ้นอย่างสม่ำเสมอที่สุดในกลุ่มตัวอย่าง

การเสริมสร้างความเข้มแข็งของงานการให้เหตุผลเชิงสัญลักษณ์หรือเชิงตรรกะ โดยที่การสืบค้นที่หลากหลายควรมาบรรจบกันด้วยข้อสรุปที่ถูกต้องเพียงข้อเดียว

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Consistency Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

หัวถอดรหัสเมดูซ่า

คำถามที่พบบ่อย

What is Self-Consistency Decoding?

ความสม่ำเสมอในตนเองเป็นกลยุทธ์การถอดรหัสที่สุ่มตัวอย่างเส้นทางการให้เหตุผลที่แตกต่างกันมากมายจากแบบจำลองภาษา แล้วเลือกคำตอบที่ส่วนใหญ่เห็นด้วย สิ่งสำคัญคือเพราะคำตอบที่โลภเพียงคำตอบเดียวอาจผิดได้ ในขณะที่ความเห็นพ้องต้องกันของความพยายามที่หลากหลายมักจะถูกต้องมากกว่ามาก

แนวคิดหลักเบื้องหลังการถอดรหัสความสอดคล้องในตนเองคืออะไร

ความสม่ำเสมอในตนเองสุ่มตัวอย่างห่วงโซ่การให้เหตุผลที่หลากหลาย และเลือกคำตอบสุดท้ายที่กลุ่มส่วนใหญ่เห็นด้วย

เหตุใดการสุ่มตัวอย่างเส้นทางการใช้เหตุผลที่หลากหลายจึงช่วยให้เกิดความแม่นยำ

มีวิธีที่ถูกต้องมากมายในการตอบคำถามที่ถูกต้องแต่มีวิธีทำผิดมากมายนับไม่ถ้วน ดังนั้นคำตอบที่ถูกต้องจะรวมกลุ่มกันในขณะที่ข้อผิดพลาดแตกต่างออกไป ทำให้คนส่วนใหญ่มีความน่าเชื่อถือมากขึ้น

ความสอดคล้องในตัวเองมาแทนที่วิธีการถอดรหัสแบบใด

แทนที่จะมุ่งมั่นอย่างตะกละตะกลามกับเส้นทางที่เป็นไปได้มากที่สุดเพียงเส้นทางเดียว ให้สุ่มตัวอย่างความสม่ำเสมอในตนเองและรวมกลุ่มกันในหลายเส้นทาง

ส่วนใดของแต่ละกลุ่มตัวอย่างที่ใช้จริงในการโหวตรอบสุดท้าย

การใช้เหตุผลระดับกลางจะถูกละทิ้งไป เฉพาะคำตอบสุดท้ายเท่านั้นที่จะรวมคะแนนเสียงข้างมาก

ต้นทุนหลักของการใช้ความสม่ำเสมอในตนเองคืออะไร?

การสร้างห่วงโซ่การให้เหตุผลหลายสิบรายการจะช่วยเพิ่มต้นทุนการอนุมาน ความแม่นยำเพิ่มขึ้นเมื่อมีตัวอย่างมากขึ้นแต่ผลตอบแทนลดลง