คู่มือพื้นฐาน

การฝึกอบรมเพื่อประสิทธิภาพการประมวลผลของ Chinchilla

Chinchilla เป็นข้อมูลจาก DeepMind ในปี 2022 ที่พบว่าโมเดลภาษาขนาดใหญ่ส่วนใหญ่ได้รับการฝึกอบรมที่ไม่ดีนัก สำหรับงบประมาณการประมวลผลคงที่ คุณควรปรับขนาดพารามิเตอร์และข้อมูลโดยประมาณเท่าๆ กัน ไม่ใช่แค่สร้างโมเดลที่ใหญ่ขึ้นเท่านั้น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It reshaped how the industry balances model size against training data.

เจาะลึก

เอกสาร Chinchilla ของ DeepMind มาเยือนการปรับขนาดอีกครั้งและฝึกอบรมโมเดลมากกว่า 400 โมเดลเพื่อค้นหาสมดุลในการประมวลผลที่เหมาะสมที่สุด กฎทั่วไป: ขนาดโมเดลและโทเค็นการฝึกควรเพิ่มขึ้นแบบล็อกสเต็ป ประมาณ 20 โทเค็นการฝึกต่อพารามิเตอร์ เพื่อพิสูจน์สิ่งนี้ พวกเขาได้ฝึก Chinchilla ซึ่งเป็นโมเดลพารามิเตอร์ 70 พันล้านบนโทเค็น 1.4 ล้านล้าน โดยใช้การคำนวณเดียวกันกับที่ Gopher พารามิเตอร์ 280 พันล้านพารามิเตอร์ฝึกฝนด้วยโทเค็นน้อยกว่ามาก Chinchilla แม้จะเล็กกว่าถึงสี่เท่า แต่มีประสิทธิภาพเหนือกว่า Gopher, GPT-3 และยักษ์ใหญ่อื่นๆ ในเกือบทุกเกณฑ์มาตรฐาน บทเรียนพลิกกลับข้อสรุป OpenAI ก่อนหน้านี้ที่ให้ความสำคัญกับขนาดมากกว่าข้อมูล โดยแสดงให้เห็นว่ารุ่นเรือธงหลายรุ่นทิ้งประสิทธิภาพไว้บนโต๊ะเนื่องจากมีขนาดใหญ่เกินไปและขาดแคลนข้อมูลมากเกินไป

ข้อมูลเชิงลึกทางเทคนิค

การสูญเสียพอดีของชินชิลล่าเป็น L(N,D) = E + A·N^(-α) + B·D^(-β) โดยที่ α และ β ทั้งคู่อยู่ใกล้ 0.34 ซึ่งหมายความว่าพารามิเตอร์และข้อมูลมีส่วนสนับสนุนเกือบจะสมมาตร การปรับให้เหมาะสมที่สุดภายใต้ข้อจำกัดในการประมวลผลคงที่ (คำนวณ data 6·N·D สำหรับหม้อแปลงไฟฟ้า) ให้ผลลัพธ์ในการปรับสเกลที่เท่ากัน โมเดลที่เล็กกว่าและมีข้อมูลมากมายยังถูกกว่าเมื่อเรียกใช้แบบอนุมาน ดังนั้นข้อดีของโมเดลนี้จึงประกอบขึ้นในการปรับใช้ ไม่ใช่แค่การฝึกอบรมเท่านั้น

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของการฝึกอบรมที่เพิ่มประสิทธิภาพการประมวลผลของ Chinchilla

โมเดลสมัยใหม่อย่าง Llama 3 จงใจผลักดันอัตราส่วน 20 โทเค็นต่อพารามิเตอร์ของ Chinchilla อย่างมาก ฝึกฝนโมเดลขนาดเล็กด้วยโทเค็นหลายล้านล้านโทเค็นเพื่อทำให้การอนุมานมีราคาถูก และยอมรับการประมวลผลการฝึกที่ต่ำกว่ามาตรฐาน เมื่อข้อมูลที่ดีเริ่มหายากขึ้น ความสนใจก็เพิ่มขึ้นในยุคที่เกิดซ้ำ ข้อมูลสังเคราะห์ และการกรองคุณภาพ ชินชิลล่ายังคงเป็นจุดอ้างอิง แต่การเพิ่มประสิทธิภาพสูงสุดจะขึ้นอยู่กับต้นทุนการอนุมานตลอดอายุการใช้งาน ไม่ใช่แค่งบประมาณการฝึกอบรมเพียงครั้งเดียว

การใช้งานจริงในโลกแห่งความเป็นจริง

การเลือกฝึกโมเดล 7 พันล้านพารามิเตอร์บน 2 ล้านล้านโทเค็น แทนที่จะเป็นโมเดล 30 พันล้านด้วยข้อมูลน้อยเกินไปสำหรับงบประมาณเดียวกัน

การประมาณว่าโมเดล 10 พันล้านพารามิเตอร์ต้องการโทเค็นประมาณ 200 พันล้านโทเค็นเพื่อเข้าถึงจุดที่น่าสนใจในการคำนวณที่เหมาะสมที่สุด

การปรับใช้โมเดลที่มีขนาดเล็กลงเพื่อลดต้นทุนการอนุมานต่อการสืบค้น ขณะเดียวกันก็รักษาคุณภาพของคู่แข่งที่ใหญ่กว่า

การตรวจสอบโมเดลที่มีอยู่และสรุปว่าได้รับการฝึกอบรม จากนั้นจึงวางแผนการฝึกอบรมที่นานขึ้นแทนที่จะเพิ่มพารามิเตอร์

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ซึ่งการฝึกอบรมเพื่อเพิ่มประสิทธิภาพการประมวลผลของ Chinchilla ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝึกอบรมเวลาทดสอบ

คำถามที่พบบ่อย

What is Chinchilla Compute-Optimal Training?

Chinchilla เป็นข้อมูลจาก DeepMind ในปี 2022 ที่พบว่าโมเดลภาษาขนาดใหญ่ส่วนใหญ่ได้รับการฝึกอบรมที่ไม่ดีนัก สำหรับงบประมาณการประมวลผลคงที่ คุณควรปรับขนาดพารามิเตอร์และข้อมูลโดยประมาณเท่าๆ กัน ไม่ใช่แค่สร้างโมเดลที่ใหญ่ขึ้นเท่านั้น โดยปรับโฉมวิธีที่อุตสาหกรรมปรับสมดุลขนาดโมเดลกับข้อมูลการฝึก

กฎทั่วไปอันโด่งดังของ Chinchilla สำหรับการฝึกเพิ่มประสิทธิภาพการประมวลผลคืออะไร

DeepMind พบพารามิเตอร์และโทเค็นควรปรับขนาดร่วมกันที่ประมาณ 20 โทเค็นต่อพารามิเตอร์สำหรับงบประมาณการประมวลผลที่กำหนด

Chinchilla พารามิเตอร์ 70B เปรียบเทียบกับ Gopher พารามิเตอร์ 280B ได้อย่างไร

ด้วยการฝึกฝนบนโทเค็นที่มากกว่าด้วยการประมวลผลแบบเดียวกัน Chinchilla เอาชนะ Gopher ที่ใหญ่กว่ามากในการวัดประสิทธิภาพส่วนใหญ่

เอกสาร Chinchilla เปิดเผยปัญหาสำคัญอะไรเกี่ยวกับโมเดลขนาดใหญ่ก่อนหน้านี้

โมเดลอย่าง GPT-3 และ Gopher มีขนาดใหญ่เกินไปเมื่อเทียบกับข้อมูลการฝึก ทำให้ประสิทธิภาพไม่เกิดขึ้นจริง

กฎ Chinchilla แนะนำโทเค็นประมาณเท่าใดสำหรับโมเดล 1 หมื่นล้านพารามิเตอร์

ที่ 20 โทเค็นต่อพารามิเตอร์ 10 พันล้านพารามิเตอร์หมายถึงโทเค็นการฝึกอบรมประมาณ 200 พันล้านโทเค็น

นอกจากประสิทธิภาพในการฝึกอบรมแล้ว เหตุใดโมเดลที่เล็กกว่าและมีข้อมูลมากมายจึงน่าสนใจในการปรับใช้

พารามิเตอร์ที่น้อยลงหมายถึงการประมวลผลต่อการสืบค้นที่ลดลง ดังนั้นจะช่วยประหยัดทุกครั้งที่ใช้โมเดล