คู่มือ AI ภาษา

AI รัฐธรรมนูญ

Constitutional AI เป็นวิธีการของ Anthropic ในการจัดแนวโมเดลโดยใช้ชุดหลักการที่เป็นลายลักษณ์อักษร ซึ่งก็คือ 'รัฐธรรมนูญ' ดังนั้น AI จึงวิจารณ์และแก้ไขคำตอบของตัวเอง แทนที่จะอาศัยเพียงมนุษย์ในการติดป้ายกำกับเนื้อหาที่เป็นอันตราย

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It aims to make models helpful and harmless with far less human labor.

เจาะลึก

การจัดแนวแบบดั้งเดิมอาศัยการเรียนรู้แบบเสริมแรงจากผลตอบรับของมนุษย์ (RLHF) โดยที่ผู้คนจัดอันดับผลลัพธ์ของโมเดลจำนวนมาก รวมถึงผลลัพธ์ที่น่ารำคาญ เพื่อสอนโมเดลถึงสิ่งที่ควรหลีกเลี่ยง AI ตามรัฐธรรมนูญช่วยลดภาระดังกล่าวด้วยการมอบรายการหลักการที่เป็นลายลักษณ์อักษรที่ชัดเจนซึ่งดึงมาจากแหล่งข้อมูลต่างๆ เช่น ปฏิญญาสหประชาชาติว่าด้วยสิทธิมนุษยชน และแนวปฏิบัติที่ดีที่สุดด้านความไว้วางใจและความปลอดภัยแก่แบบจำลอง การฝึกอบรมมีสองขั้นตอน ขั้นแรก ขั้นที่มีการกำกับดูแล: แบบจำลองจะสร้างการตอบสนอง จากนั้นจึงวิพากษ์วิจารณ์หลักการที่ขัดกับรัฐธรรมนูญ และเขียนใหม่ให้ดีขึ้น คำตอบที่ปรับปรุงตนเองเหล่านี้ใช้เพื่อปรับแต่ง ประการที่สอง ระยะการเรียนรู้แบบเสริมกำลัง RLAIF ซึ่งตัวแบบจำลองจะจัดอันดับคู่การตอบสนองตามรัฐธรรมนูญ และข้อมูลการตั้งค่าที่ AI สร้างขึ้นจะฝึกโมเดลการให้รางวัล หลักการมีความโปร่งใสและแก้ไขได้ ทำให้ค่าที่ควบคุมแบบจำลองสามารถตรวจสอบได้ แทนที่จะซ่อนอยู่ในป้ายกำกับของมนุษย์ที่ทึบแสง

ข้อมูลเชิงลึกทางเทคนิค

ทั้งสองระยะมักเรียกว่า SL-CAI และ RL-CAI ในการเรียนรู้แบบมีผู้สอน วงจร 'วิจารณ์และแก้ไข' จะแจ้งให้โมเดลค้นหาว่าคำตอบของตัวเองละเมิดหลักการตัวอย่างหรือไม่ และเขียนใหม่ เพื่อสร้างข้อมูลการฝึกอบรมโดยไม่มีการติดฉลากอันตรายต่อมนุษย์ ในระยะ RL โมเดลที่สองจะตัดสินว่าคำตอบใดจากสองคำตอบใดที่เป็นไปตามรัฐธรรมนูญได้ดีกว่า โดยสร้างป้ายกำกับการตั้งค่า AI (RLAIF) ที่ฝึกโมเดลการให้รางวัลที่ใช้ใน RL มาตรฐาน โครงสร้างเป็นคำแนะนำแบบข้อความธรรมดาที่แทรกเข้าไปในข้อความแจ้ง ดังนั้นการเปลี่ยนแปลงพฤติกรรมของแบบจำลองจึงทำได้โดยตรงพอๆ กับการแก้ไขหลักการ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของ AI รัฐธรรมนูญ

AI ตามรัฐธรรมนูญชี้ไปที่ "การกำกับดูแลที่ปรับขนาดได้" โดยที่ AI ช่วยควบคุม AI เนื่องจากโมเดลเติบโตขึ้นเกินกว่าที่มนุษย์จะตรวจสอบทุกๆ ผลลัพธ์ได้ คาดหวังรัฐธรรมนูญที่สมบูรณ์ยิ่งขึ้นและเหมาะสมยิ่งขึ้น ข้อมูลสาธารณะและการมีส่วนร่วมในการเลือกหลักการ (Anthropic ได้ทำการทดลอง 'AI ตามรัฐธรรมนูญแบบรวม') และวิธีการแบบผสมผสานที่ผสมผสานความคิดเห็นของมนุษย์กับการวิจารณ์ตนเองของ AI ความโปร่งใสของหลักการที่เป็นลายลักษณ์อักษรทำให้สิ่งนี้น่าสนใจสำหรับหน่วยงานกำกับดูแลและผู้ตรวจสอบที่ต้องการเห็นคุณค่าของการเข้ารหัสระบบ เมื่อโมเดลชายแดนก้าวหน้า วิธีการที่ให้โมเดลสามารถวิพากษ์วิจารณ์ได้อย่างน่าเชื่อถือและปรับปรุงตนเองโดยเทียบกับกฎเกณฑ์ที่ชัดเจนอาจกลายเป็นศูนย์กลางด้านความปลอดภัย

การใช้งานจริงในโลกแห่งความเป็นจริง

ฝึกแชทบอทให้ปฏิเสธที่จะช่วยสร้างอาวุธโดยให้วิจารณ์ร่างคำตอบของตัวเองกับหลักการหลีกเลี่ยงอันตราย แล้วเขียนใหม่

แทนที่การติดฉลากผลลัพธ์ที่เป็นพิษโดยทีมแดงที่มีราคาแพงของมนุษย์ด้วยข้อมูลการตั้งค่าที่สร้างโดย AI (RLAIF) ตามแนวทางของรัฐธรรมนูญ

การแก้ไขหลักการที่เป็นลายลักษณ์อักษรเพื่อปรับความระมัดระวังของแบบจำลอง จากนั้นสังเกตการเปลี่ยนแปลงพฤติกรรมโดยไม่ต้องติดป้ายกำกับตัวอย่างนับพันตัวอย่าง

ดำเนินการฝึกซ้อมร่วมโดยให้สาธารณชนเสนอหลักการที่กำหนดรูปแบบรัฐธรรมนูญของแบบจำลอง

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การปรับแต่งคำสั่ง

คำถามที่พบบ่อย

What is Constitutional AI?

Constitutional AI เป็นวิธีการของ Anthropic ในการจัดแนวโมเดลโดยใช้ชุดหลักการที่เป็นลายลักษณ์อักษร ซึ่งก็คือ 'รัฐธรรมนูญ' ดังนั้น AI จึงวิจารณ์และแก้ไขคำตอบของตัวเอง แทนที่จะอาศัยเพียงมนุษย์ในการติดป้ายกำกับเนื้อหาที่เป็นอันตราย โดยมีจุดมุ่งหมายเพื่อสร้างแบบจำลองที่เป็นประโยชน์และไม่เป็นอันตรายโดยใช้แรงงานคนน้อยลง

'รัฐธรรมนูญ' ในรัฐธรรมนูญ AI คืออะไร?

รัฐธรรมนูญเป็นชุดหลักการที่เป็นลายลักษณ์อักษรที่โปร่งใส ซึ่งดึงมาจากแหล่งข้อมูลต่างๆ เช่น เอกสารสิทธิมนุษยชน ซึ่งแบบจำลองใช้เพื่อประเมินและปรับปรุงคำตอบ

ปัญหาสำคัญอะไรกับมาตรฐาน RLHF ที่ Constitutional AI ตั้งเป้าที่จะลด?

ด้วยการที่แบบจำลองวิจารณ์ตนเองต่อหลักการ Constitutional AI จึงสามารถลดการใช้แรงงานมนุษย์ในการตรวจสอบและติดป้ายกำกับผลลัพธ์ที่ก่อกวนหรือเป็นอันตรายได้

ในขั้นตอนการกำกับดูแลของ Constitutional AI โมเดลดังกล่าวทำอะไรกับผลลัพธ์ของตัวเอง

โมเดลดำเนินการวนรอบการวิจารณ์และแก้ไข: โดยจะระบุตำแหน่งที่แบบร่างละเมิดหลักการตัวอย่าง จากนั้นจึงเขียนคำตอบใหม่ เพื่อสร้างข้อมูลการฝึกอบรมที่ปรับปรุงตนเอง

RLAIF ย่อมาจากอะไรในระยะเสริม-การเรียนรู้?

RLAIF หมายถึงการเรียนรู้แบบเสริมแรงจากคำติชมของ AI: โมเดลจัดอันดับการตอบสนองตามรัฐธรรมนูญ โดยสร้างข้อมูลการตั้งค่าที่ AI สร้างขึ้นแทนป้ายกำกับของมนุษย์

เหตุใดการใช้หลักการที่เป็นลายลักษณ์อักษรจึงถือเป็นข้อได้เปรียบด้านความโปร่งใส

เนื่องจากค่าชี้นำถูกเขียนออกมา จึงสามารถตรวจสอบ ตรวจสอบ และแก้ไขได้โดยตรง ซึ่งแตกต่างจากการตั้งค่าที่เข้ารหัสโดยปริยายในการจัดอันดับโดยมนุษย์ที่กระจัดกระจาย