คู่มือ AI ภาษา

กฎหมายมาตราส่วนของชินชิลล่า

กฎหมายการปรับขนาด Chinchilla จาก DeepMind ในปี 2022 แสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่ส่วนใหญ่ไม่ได้รับการฝึกอบรมที่ไม่ดี สำหรับงบประมาณการประมวลผลคงที่ คุณควรปรับขนาดโมเดลและข้อมูลการฝึกโดยประมาณในสัดส่วนที่เท่ากัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

เจาะลึก

ก่อน Chinchilla แนวโน้มคือการสร้างแบบจำลองที่ใหญ่กว่าเดิม (เช่น พารามิเตอร์ 175B GPT-3) ในขณะที่ฝึกกับข้อมูลจำนวนที่ค่อนข้างน้อย DeepMind ฝึกฝนโมเดลมากกว่า 400 โมเดลในขนาดและงบประมาณข้อมูลที่หลากหลาย จากนั้นปรับเส้นโค้งที่คาดการณ์การสูญเสียให้เป็นฟังก์ชันของพารามิเตอร์และโทเค็นภายใต้งบประมาณการประมวลผลคงที่ (FLOP) การค้นพบของพวกเขา: พารามิเตอร์และโทเค็นการฝึกอบรมควรปรับขนาดร่วมกันโดยประมาณอัตราส่วน 1 ต่อ 1 ซึ่งหมายถึงข้อมูลการฝึกอบรมประมาณ 20 โทเค็นต่อพารามิเตอร์ เพื่อพิสูจน์สิ่งนี้ พวกเขาได้ฝึก Chinchilla ซึ่งเป็นโมเดลพารามิเตอร์ 70B บนโทเค็น 1.4 ล้านล้านโทเค็น ซึ่งมีประสิทธิภาพเหนือกว่า Gopher พารามิเตอร์ 280B ที่ใหญ่กว่ามากแม้จะใช้การคำนวณเดียวกันก็ตาม เนื่องจากได้รับการฝึกฝนโดยใช้ข้อมูลมากกว่ามาก

ข้อมูลเชิงลึกทางเทคนิค

กฎหมายมาจากการปรับฟังก์ชันการสูญเสียแบบพาราเมตริกให้เหมาะสม L(N, D) โดยที่ N คือพารามิเตอร์และ D คือโทเค็น รวมถึงข้อกำหนดการสูญเสียที่ลดไม่ได้ ขนาดแบบจำลอง และขนาดข้อมูล การลดการสูญเสียให้เหลือน้อยที่สุดภายใต้ข้อจำกัดในการประมวลผล (การคำนวณจะมีสัดส่วนโดยประมาณกับ N คูณ D) ทำให้ได้ผลลัพธ์ที่ N และ D ที่เหมาะสมที่สุดเติบโตเป็นกำลังของการคำนวณที่มีเลขชี้กำลังที่คล้ายกัน ดังนั้นอัตราส่วนที่เหมาะสมในการประมวลผลจะอยู่ที่ประมาณ 20 โทเค็นต่อพารามิเตอร์

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของกฎหมายมาตราส่วนของชินชิลล่า

Chinchilla เปลี่ยนฟิลด์จากการนับพารามิเตอร์ไล่ล่าไปเป็นการป้อนโมเดลข้อมูลคุณภาพสูงมากขึ้น และโมเดลสมัยใหม่มักจะฝึกฝนผ่านจุด 'เพิ่มประสิทธิภาพการประมวลผล' ได้ดีเพื่อทำให้การอนุมานถูกลง เนื่องจากข้อความเว็บคุณภาพสูงเริ่มหายากขึ้น ความสนใจจึงหันไปที่การดูแลจัดการข้อมูล ข้อมูลสังเคราะห์ ยุคต่างๆ และข้อมูลหลายรูปแบบเพื่อปรับขนาดต่อไป บทเรียนหลักยังคงอยู่: ข้อมูลและพารามิเตอร์ต้องมีความสมดุล และขนาดดิบเพียงอย่างเดียวก็ไม่ใช่เป้าหมายอีกต่อไป

การใช้งานจริงในโลกแห่งความเป็นจริง

Chinchilla พารามิเตอร์ 70B ของ DeepMind เอาชนะ Gopher 280B บนการวัดประสิทธิภาพโดยใช้การประมวลผลที่เท่าเทียมกัน โดยการฝึกอบรมเกี่ยวกับข้อมูลที่มากกว่ามาก

ให้คำแนะนำทีมจัดงบประมาณโทเค็นการฝึกอบรมประมาณ 20 รายการต่อพารามิเตอร์เมื่อวางแผนแบบจำลองตั้งแต่เริ่มต้น

การระบุโมเดลที่มีขนาดเล็กลงและมีข้อมูลมากมาย เช่น LLaMA ซึ่งมีราคาถูกกว่าเมื่อเรียกใช้ ณ เวลาอนุมาน

การประมาณว่าแบบจำลองที่วางแผนไว้นั้น 'ยังไม่ผ่านการฝึกอบรม' และจะได้รับประโยชน์จากข้อมูลเพิ่มเติมมากกว่าพารามิเตอร์เพิ่มเติมหรือไม่

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

กฎหมายการปรับขนาดสำหรับโครงข่ายประสาทเทียม

คำถามที่พบบ่อย

What is Chinchilla Scaling Laws?

กฎหมายการปรับขนาด Chinchilla จาก DeepMind ในปี 2022 แสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่ส่วนใหญ่ไม่ได้รับการฝึกอบรมที่ไม่ดี สำหรับงบประมาณการประมวลผลคงที่ คุณควรปรับขนาดโมเดลและข้อมูลการฝึกโดยประมาณในสัดส่วนที่เท่ากัน สิ่งสำคัญคือเนื่องจากได้ให้คำนิยามใหม่ว่าขนาดแบบจำลอง 'เหมาะสมที่สุด' หมายถึงอะไร และปรับโฉมวิธีการประมวลผลของห้องปฏิบัติการ

อะไรคือข้อค้นพบหลักของกฎมาตราส่วน Chinchilla

Chinchilla แสดงให้เห็นว่าสำหรับงบประมาณการประมวลผลแบบคงที่ พารามิเตอร์และโทเค็นการฝึกอบรมควรเติบโตไปด้วยกัน ประมาณ 1 ต่อ 1

Chinchilla แนะนำว่าโทเค็นการฝึกอบรมต่อพารามิเตอร์ประมาณจำนวนเท่าใดจึงเหมาะสมที่สุดในการประมวลผล

อัตราส่วนการประมวลผลที่เหมาะสมที่สุดจะใช้ได้กับโทเค็นการฝึกประมาณ 20 โทเค็นสำหรับพารามิเตอร์ทุกรุ่น

Chinchilla รุ่นใดมีประสิทธิภาพเหนือกว่าแม้จะมีขนาดเล็กกว่ามาก

Chinchilla พารามิเตอร์ 70B เอาชนะ Gopher พารามิเตอร์ 280B ของ DeepMind โดยใช้การประมวลผลเดียวกัน เพราะมันฝึกกับข้อมูลได้มากกว่ามาก

Chinchilla บอกเป็นนัยถึงโมเดลอย่าง GPT-3 ในขณะนั้นอย่างไร

โมเดลขนาดใหญ่หลายรุ่นในยุคนั้นไม่ได้รับการฝึกอบรม ซึ่งหมายความว่าโมเดลเหล่านี้จะทำงานได้ดีขึ้นโดยมีข้อมูลสำหรับการนับพารามิเตอร์มากขึ้น

การคำนวณโดยประมาณในการวิเคราะห์ Chinchilla เป็นอย่างไร

Training Compute (FLOP) จะเป็นสัดส่วนโดยประมาณกับจำนวนพารามิเตอร์คูณด้วยจำนวนโทเค็นการฝึก