โมเดลและความเท่าเทียมของท่อ
เมื่อโมเดลมีขนาดใหญ่เกินกว่าที่จะพอดีกับ GPU ตัวเดียว ความขนานของโมเดลและไปป์ไลน์จะแยกโมเดลออกจากอุปกรณ์ต่างๆ
ภาพรวม
This is what makes training giant language models with hundreds of billions of parameters physically possible.
เจาะลึก
โมเดลการทำงานแบบขนานจะแบ่งพาร์ติชันโมเดลเดียวบน GPU หลายตัว ดังนั้นจึงไม่จำเป็นต้องมีอุปกรณ์ใดรองรับน้ำหนักทั้งหมด มีสองรสชาติหลัก ความเท่าเทียมของเทนเซอร์ (ภายในเลเยอร์) จะแบ่งคณิตศาสตร์ภายในเลเยอร์ เช่น การตัดการคูณเมทริกซ์ขนาดใหญ่ข้าม GPU ที่แต่ละส่วนคำนวณเอาต์พุต การขนานกันของไปป์ไลน์ (ระหว่างเลเยอร์) จะกำหนดเลเยอร์ที่ต่อเนื่องกันให้กับ GPU ที่แตกต่างกัน ดังนั้นบล็อกเลเยอร์ 1 จะทำงานบน GPU 0 บล็อก 2 บน GPU 1 และอื่นๆ โดยการเปิดใช้งานจะส่งต่อไปข้างหน้าเหมือนกับสายการประกอบ ความท้าทายของการวางท่อแบบไร้เดียงสาคือ 'ฟองสบู่': ในขณะที่ GPU 0 ใช้งานได้ในชุดแรก แต่ GPU ดาวน์สตรีมจะไม่ได้ใช้งาน การวางท่อจะแบ่งแต่ละชุดออกเป็นชุดย่อยเพื่อให้ทุกขั้นตอนไม่ว่าง และปรับปรุงการใช้งานได้อย่างมาก
ข้อมูลเชิงลึกทางเทคนิค
การขนานของเทนเซอร์ (เช่นเดียวกับใน NVIDIA Megatron-LM) จะแยกเมทริกซ์น้ำหนักแบบคอลัมน์หรือแบบแถว และใช้การลดทั้งหมดเพื่อรวมผลลัพธ์บางส่วนเข้าด้วยกันใหม่ ทำให้การสื่อสารภายในโหนด NVLink ที่รวดเร็ว การขนานกันของไปป์ไลน์ (GPipe, PipeDream) แบ่งแบทช์ออกเป็นไมโครแบทช์ที่ไหลผ่านขั้นตอนต่างๆ ในกำหนดการที่เซ ส่งผลให้เวลา 'ฟองสบู่' ที่ไม่ได้ใช้งานลดลง ทั้งสองมักถูกวางซ้อนกันหลายชั้น โดยมีความขนานของเทนเซอร์ภายในโหนด และไปป์ไลน์มีความขนานกันข้ามโหนด
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของแบบจำลองและความเท่าเทียมของท่อ
เฟรมเวิร์กทำให้ปัญหาหนักๆ ในการตัดสินใจแบ่งพาร์ติชันโมเดลบนอุปกรณ์ต่างๆ โดยอัตโนมัติมากขึ้นเรื่อยๆ โดยใช้การทำโปรไฟล์และการค้นหาเพื่อสร้างสมดุลระหว่างการประมวลผลและการสื่อสาร คาดว่าจะมีการบูรณาการเทนเซอร์ ไปป์ไลน์ และความเท่าเทียมของข้อมูล (ความเท่าเทียม 3 มิติ) อย่างใกล้ชิดยิ่งขึ้น การตั้งเวลาแบบไมโครแบทช์ที่ชาญฉลาดยิ่งขึ้นเพื่อขจัดปัญหาฟองสบู่ของไปป์ไลน์ และฮาร์ดแวร์ที่มีการเชื่อมต่อระหว่างกันที่เร็วขึ้น ดังนั้นการแยกชั้นเดียวระหว่างชิปจึงมีราคาถูกลงและเป็นกิจวัตรมากขึ้นสำหรับรุ่นที่ใหญ่ขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
ฝึกฝนโมเดลสไตล์ GPT ด้วย NVIDIA Megatron-LM ซึ่งจะแยกความสนใจของเลเยอร์หม้อแปลงแต่ละเลเยอร์และเมทริกซ์ฟีดไปข้างหน้าใน GPU ผ่านทางเทนเซอร์แบบขนาน
การใช้ GPipe เพื่อวางเลเยอร์วิสัยทัศน์หรือโมเดลภาษาขนาดยักษ์ที่แตกต่างกันบนตัวเร่งความเร็วที่แยกจากกัน ในขณะที่ไมโครแบทช์จะทำให้พวกมันยุ่ง
ไปป์ไลน์เอ็นจิ้นของ DeepSpeed แบ่งพาร์ติชันโมเดลมูลค่าหลายพันล้านพารามิเตอร์ออกเป็นขั้นตอนต่างๆ ในหลายโหนด
การรวมความขนานของเทนเซอร์ภายในเซิร์ฟเวอร์ 8-GPU เดียว กับการขนานของไปป์ไลน์ซึ่งครอบคลุมเซิร์ฟเวอร์หลายเครื่องเพื่อฝึกโมเดลที่มีขนาดใหญ่เกินไปสำหรับเครื่องเดียว
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model and Pipeline Parallelism quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ความเท่าเทียมของเทนเซอร์สำหรับรุ่นขนาดใหญ่
คำถามที่พบบ่อย
What is Model and Pipeline Parallelism?
เมื่อโมเดลมีขนาดใหญ่เกินกว่าที่จะพอดีกับ GPU ตัวเดียว ความขนานของโมเดลและไปป์ไลน์จะแยกโมเดลออกจากอุปกรณ์ต่างๆ นี่คือสิ่งที่ทำให้การฝึกโมเดลภาษายักษ์ที่มีพารามิเตอร์นับแสนล้านเป็นไปได้ทางกายภาพ
ปัญหาพื้นฐานอะไรที่ทำให้โมเดลและความขนานของไปป์ไลน์แก้ปัญหาได้
โมเดลและไปป์ไลน์การทำงานแบบขนานแบ่งพาร์ติชันโมเดลระหว่างอุปกรณ์ต่างๆ ช่วยให้สามารถฝึกฝนเครือข่ายที่มีขนาดใหญ่กว่า GPU เดี่ยวๆ ที่จะสามารถรองรับได้
การแบ่งความเท่าเทียมของเทนเซอร์ (ในเลเยอร์) ทำงานอย่างไร
ความเท่าเทียมของเทนเซอร์จะแบ่งการคำนวณภายในเลเยอร์เดียว เช่น การแยกเมทริกซ์น้ำหนักขนาดใหญ่ เพื่อให้ GPU แต่ละตัวคำนวณส่วนหนึ่งของเอาท์พุต
'ฟองสบู่' ในความขนานของไปป์ไลน์ไร้เดียงสาคืออะไร?
ในช่วงต้นของขั้นตอนไปป์ไลน์ ขั้นตอนดาวน์สตรีมยังไม่มีอินพุตและไม่ได้ใช้งาน ทำให้เสียเวลา GPU ช่องว่างว่างนี้เรียกว่าฟอง
ความขนานของไปป์ไลน์ช่วยลดฟองสบู่ได้อย่างไร
การแบ่งแบทช์ออกเป็นไมโครแบทช์จะทำให้ไมโครแบทช์หลาย ๆ อยู่ในขั้นตอนที่แตกต่างกันไปพร้อม ๆ กัน ทำให้ GPU ทั้งหมดยุ่งและลดเวลาว่างลง
เหตุใดความเท่าเทียมของเทนเซอร์จึงถูกเก็บไว้ภายในโหนดเดียว
การขนานของเทนเซอร์จะสื่อสารบ่อยครั้งเพื่อรวมผลลัพธ์เมทริกซ์บางส่วนเข้าด้วยกันใหม่ ดังนั้นจึงถูกวางไว้ที่แบนด์วิดธ์การเชื่อมต่อระหว่างกันสูงสุด ภายในโหนดบน NVLink