คู่มือพื้นฐาน

กฎหมายการปรับขนาดสำหรับโครงข่ายประสาทเทียม

กฎการปรับขนาดเป็นสูตรเชิงประจักษ์ที่แสดงให้เห็นว่าการสูญเสียของโครงข่ายประสาทเทียมลดลงอย่างคาดการณ์ได้เมื่อคุณเพิ่มขนาดโมเดล ขนาดชุดข้อมูล และการคำนวณ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They matter because they let researchers forecast performance before spending millions on training a giant model.

เจาะลึก

กฎหมายการปรับขนาดซึ่งได้รับความนิยมในรายงานปี 2020 ของ OpenAI โดย Kaplan และเพื่อนร่วมงาน พบว่าการสูญเสียจากการทดสอบลดลงเนื่องจากกฎกำลังที่ราบรื่นในสามปริมาณ: จำนวนพารามิเตอร์ (N), โทเค็นการฝึกอบรม (D) และการคำนวณทั้งหมด (C) เมื่อวาดบนแกนบันทึก-บันทึก การสูญเสียเทียบกับแต่ละปัจจัยจะสร้างเส้นตรงเกือบเป็นเส้นตรงซึ่งครอบคลุมหลายขนาด ความสัมพันธ์จะอยู่ในรูปแบบ Los µ a + b·X^(-c) โดยที่ X คือตัวประกอบมาตราส่วน งานต้นฉบับแนะนำว่าขนาดโมเดลมีความสำคัญมากกว่าข้อมูล กระตุ้นให้ต้องแข่งขันกับโมเดลที่ใหญ่ขึ้นเรื่อยๆ เช่น พารามิเตอร์ 175 พันล้านของ GPT-3 กฎหมายที่ปรับขนาดได้เปลี่ยนการเรียนรู้เชิงลึกจากการคาดเดาไปสู่ระเบียบวินัยทางวิศวกรรมที่คาดการณ์ได้ ช่วยให้ทีมคาดการณ์ผลลัพธ์จำนวนมากจากการทดลองขนาดเล็กและราคาถูก

ข้อมูลเชิงลึกทางเทคนิค

รูปแบบกฎกำลังหมายถึงการเพิ่มขึ้นของการคำนวณแบบทวีคูณคงที่แต่ละครั้งจะทำให้มีการสูญเสียการบวกลดลงคงที่โดยประมาณ การสูญเสียจะวัดเป็น nats หรือบิตต่อโทเค็นของ cross-entropy เนื่องจากเลขชี้กำลัง c มีค่าน้อย (มักประมาณ 0.05-0.1) กำไรจึงมีจริงแต่ลดลง การคำนวณแบบทวีคูณช่วยได้น้อยกว่าการเพิ่มทวีคูณแรกมาก ที่สำคัญ กฎหมายเหล่านี้อธิบายถึงการสูญเสียที่ลดไม่ได้บวกกับที่ลดลง โดยที่คำคงที่จะจับเอนโทรปีที่แท้จริงของข้อมูลซึ่งไม่มีแบบจำลองใดสามารถเอาชนะได้

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของกฎหมายการปรับขนาดสำหรับโครงข่ายประสาทเทียม

นักวิจัยกำลังขยายกฎการปรับขนาดนอกเหนือจากการฝึกการสูญเสียล่วงหน้าไปสู่ความแม่นยำของงานดาวน์สตรีม โมเดลหลายรูปแบบ และการคำนวณเวลาอนุมาน ซึ่งโมเดลการให้เหตุผลใช้เวลาคิดมากขึ้นต่อการสืบค้น เนื่องจากข้อความคุณภาพสูงเริ่มหายาก ความสนใจจึงเปลี่ยนไปอยู่ที่คุณภาพข้อมูล ข้อมูลสังเคราะห์ และกฎหมายการปรับขนาดข้อมูลซ้ำ บางคนแย้งว่าการปรับสเกลแบบดิบกำลังเกินขีดจำกัดในทางปฏิบัติทั้งด้านเงิน พลังงาน และข้อความที่มีอยู่ ผลักดันสนามไปสู่ประสิทธิภาพของอัลกอริทึมและสถาปัตยกรรมใหม่ แทนที่จะเพียงแค่สร้างให้ใหญ่ขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

คาดการณ์การสูญเสียครั้งสุดท้ายของโมเดลมูลค่า 7 หมื่นล้านพารามิเตอร์ที่วางแผนไว้จากชุดการทดสอบขนาดเล็กจำนวน 100 ล้านพารามิเตอร์ก่อนที่จะตัดสินใจใช้งบประมาณ GPU

การตัดสินใจว่าจะรวบรวมโทเค็นจำนวนกี่ล้านล้านโทเค็น เพื่อให้งบประมาณการประมวลผลคงที่ไม่สูญเปล่ากับโมเดลที่ไม่ได้รับการฝึกอบรม

การเปรียบเทียบสถาปัตยกรรมทั้งสองอย่างในราคาถูกโดยปรับเส้นโค้งการปรับขนาดให้เหมาะสมในขนาดเล็ก แทนที่จะฝึกทั้งสองแบบในขนาดเต็ม

ตั้งค่าความคาดหวังความแม่นยำที่สมจริงสำหรับนักลงทุนหรือผู้ตรวจสอบโดยคาดการณ์เส้นโค้งการสูญเสียไปยังระดับการคำนวณเป้าหมาย

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่กฎหมายการปรับขนาดสำหรับโครงข่ายประสาทเทียมช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โครงข่ายประสาทเทียมแบบ Convolutional

คำถามที่พบบ่อย

What is Scaling Laws for Neural Networks?

กฎการปรับขนาดเป็นสูตรเชิงประจักษ์ที่แสดงให้เห็นว่าการสูญเสียของโครงข่ายประสาทเทียมลดลงอย่างคาดการณ์ได้เมื่อคุณเพิ่มขนาดโมเดล ขนาดชุดข้อมูล และการคำนวณ สิ่งเหล่านี้มีความสำคัญเนื่องจากให้นักวิจัยคาดการณ์ประสิทธิภาพก่อนที่จะทุ่มเงินหลายล้านเพื่อฝึกฝนโมเดลขนาดยักษ์

บนแกนบันทึก-บันทึก โดยทั่วไปการสูญเสียจากการทดสอบจะทำงานอย่างไรเมื่อการคำนวณเพิ่มขึ้นภายใต้กฎหมายการปรับขนาด

การสูญเสียเทียบกับการประมวลผล ขนาดโมเดล หรือข้อมูลทำให้เกิดเส้นตรงใกล้กันบนแปลงบันทึก-บันทึก ซึ่งเป็นลายเซ็นของความสัมพันธ์ระหว่างกฎหมายกำลัง

กฎหมายมาตราส่วนดั้งเดิมเกี่ยวข้องกับการสูญเสียปริมาณสามปริมาณใด

แคปแลน และคณะ ศึกษาการสูญเสียเป็นกฎกำลังในการนับพารามิเตอร์ (N) โทเค็นการฝึกอบรม (D) และการคำนวณทั้งหมด (C)

เหตุใดการปรับขนาดกฎหมายจึงมีคุณค่าต่อห้องปฏิบัติการ AI

ด้วยการปรับเส้นโค้งให้เหมาะสมในขนาดที่เล็ก ทีมจะคาดการณ์ประสิทธิภาพของแบบจำลองขนาดยักษ์ก่อนที่จะใช้จ่ายเงินจำนวนมหาศาล

คำคงที่ (ลดไม่ได้) ในสูตรการสูญเสียกฎหมายมาตราส่วนแสดงถึงอะไร

การสูญเสียมีส่วนที่ลดลงได้ซึ่งจะหดตัวตามขนาดบวกกับพื้นที่ไม่สามารถลดได้ซึ่งกำหนดโดยการสุ่มโดยธรรมชาติของข้อมูล

เหตุใดการปรับขนาดกำไรจึงถูกอธิบายว่า 'ลดลง'

เนื่องจากเลขชี้กำลังกฎกำลังมีขนาดเล็ก การคำนวณแบบคูณที่เท่ากันจะทำให้ได้ค่าการลดการสูญเสียสัมบูรณ์น้อยลงอย่างต่อเนื่อง