FP8 และรูปแบบความแม่นยำต่ำ
FP8 เป็นรูปแบบตัวเลขทศนิยม 8 บิตที่ช่วยให้โมเดล AI เก็บน้ำหนักและคำนวณโดยใช้หน่วยความจำหนึ่งในสี่ของตัวเลขมาตรฐาน 32 บิต
ภาพรวม
It is a key trick for making giant models cheaper and faster to train and serve.
เจาะลึก
โครงข่ายประสาทเทียมประกอบด้วยตัวเลขหลายพันล้านตัว โดยปกติแล้วตัวเลขเหล่านั้นจะใช้ตัวเลขละ 32 บิต (FP32) หรือ 16 บิต (FP16/BF16) FP8 ย่อขนาดให้เหลือเพียง 8 บิต โดยลดหน่วยความจำและแบนด์วิธลงประมาณครึ่งหนึ่งเมื่อเทียบกับ 16 บิต มีโครงร่าง FP8 ทั่วไปสองแบบ: E4M3 (4 เลขชี้กำลังบิต, 3 บิตแมนทิสซา) ให้ความแม่นยำมากกว่าแต่มีช่วงที่เล็กกว่า และ E5M2 (5 เลขชี้กำลัง 2 แมนทิสซา) ให้ช่วงที่กว้างกว่าแต่มีขั้นตอนที่หยาบกว่า ข้อเสียเปรียบคือความเที่ยงตรง: บิตที่น้อยลงหมายถึงข้อผิดพลาดในการปัดเศษ เพื่อให้มีความถูกต้องแม่นยำ เฟรมเวิร์กจะใช้ปัจจัยการปรับขนาดต่อเทนเซอร์หรือต่อบล็อกที่จะรีสเกลค่าให้อยู่ในช่วงที่ใช้งานได้ของ FP8 Hopper และ Blackwell GPU ของ NVIDIA เพิ่มฮาร์ดแวร์เอ็นจิ้นเมทริกซ์ FP8 ทำให้ใช้งานได้จริงสำหรับทั้งการฝึกอบรมและการอนุมาน รูปแบบที่ใหม่กว่า เช่น MXFP8, MXFP4 และ NVFP4 ดันให้ต่ำลงอีกด้วยบล็อกไมโครสเกลที่ใช้ร่วมกัน
ข้อมูลเชิงลึกทางเทคนิค
ความท้าทายของ FP8 คือช่วงไดนามิก ด้วยบิตเอ็กซ์โพเนนต์เพียงไม่กี่บิต การเปิดใช้งานขนาดใหญ่หรือเล็กจะล้นหรืออันเดอร์โฟลว์เป็นศูนย์ การแก้ไขกำลังปรับขนาด: คูณเมตริกซ์ด้วยปัจจัยเพื่อให้ค่าของมันลงในหน้าต่างตัวแทนของ FP8 ทำ FP8 คูณสะสม จากนั้นหารกลับออก ซึ่งมักจะสะสมผลรวมบางส่วนด้วยความแม่นยำสูงกว่า (FP16/FP32) โดยทั่วไป E4M3 ใช้สำหรับน้ำหนักและการเปิดใช้งาน E5M2 สำหรับการไล่ระดับสีที่ช่วงมีความสำคัญมากกว่าความแม่นยำ
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของ FP8 และรูปแบบความแม่นยำต่ำ
ความแม่นยำกำลังลดลง หลังจาก FP8 มาถึงรูปแบบไมโครสเกล 4 บิต (MXFP4, NVFP4) ที่อัดสเกลที่ใช้ร่วมกันขนาดเล็กต่อบล็อกขนาดเล็ก และตอนนี้ฮาร์ดแวร์ Blackwell ก็เร่งความเร็ว FP4 ได้โดยตรง คาดว่าจะมีสูตรที่มีความแม่นยำแบบผสมโดยที่เลเยอร์ต่างๆ ใช้ความกว้างบิตต่างกัน พร้อมการฝึกอบรมที่คำนึงถึงปริมาณที่ดีกว่า ดังนั้น 4 บิตจึงกลายเป็นค่าเริ่มต้นสำหรับการอนุมาน เกมสุดท้ายกำลังบีบโมเดลระดับแนวหน้าลงบนชิปที่น้อยลงและราคาถูกลงโดยไม่มีการสูญเสียคุณภาพที่วัดได้
การใช้งานจริงในโลกแห่งความเป็นจริง
การฝึกอบรมโมเดลภาษาขนาดใหญ่บน NVIDIA Hopper/Blackwell GPU โดยใช้ FP8 เพื่อเพิ่มปริมาณงานเป็นสองเท่าเมื่อเทียบกับ BF16
ให้บริการการอนุมานแชทบอทใน FP8 ดังนั้นโมเดลจึงเหมาะกับ GPU น้อยลงและตอบคำขอต่อวินาทีได้มากขึ้น
การใช้ E5M2 สำหรับการสื่อสารแบบไล่ระดับระหว่างการฝึกแบบกระจายเพื่อลดแบนด์วิดท์เครือข่ายระหว่างโหนด
การปรับใช้โมเดลเชิงปริมาณ MXFP4/NVFP4 เพื่อให้พอดีกับโมเดลระดับแนวหน้าบน GPU หน่วยความจำสูงตัวเดียวเพื่อการอนุมานที่ถูกกว่า
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
รูปแบบการทำให้เป็นอนุกรมของโมเดล
คำถามที่พบบ่อย
What is FP8 and Low-Precision Formats?
FP8 เป็นรูปแบบตัวเลขทศนิยม 8 บิตที่ช่วยให้โมเดล AI เก็บน้ำหนักและคำนวณโดยใช้หน่วยความจำหนึ่งในสี่ของตัวเลขมาตรฐาน 32 บิต เป็นเคล็ดลับสำคัญในการทำให้โมเดลขนาดใหญ่ราคาถูกและเร็วกว่าในการฝึกฝนและให้บริการ
หมายเลข FP8 ใช้จำนวนบิตเท่าใดเมื่อเทียบกับหมายเลข FP32 มาตรฐาน
FP8 ใช้ 8 บิตในขณะที่ FP32 ใช้ 32 บิต ดังนั้น FP8 จึงใช้พื้นที่เก็บข้อมูลและแบนด์วิดท์ถึงหนึ่งในสี่
ป้ายกำกับ 'E4M3' และ 'E5M2' อธิบายอะไรเกี่ยวกับรูปแบบ FP8
E4M3 หมายถึง 4 บิตเอ็กซ์โปเนนต์ และ 3 บิตแมนทิสซา E5M2 หมายถึง 5 เลขชี้กำลังและ 2 บิตแมนทิสซา บิตเลขชี้กำลังเพิ่มเติมจะขยายช่วงให้กว้างขึ้น บิตแมนทิสซามากขึ้นเพิ่มความแม่นยำ
เหตุใดไปป์ไลน์ FP8 จึงใช้ปัจจัยสเกลกับเทนเซอร์
เนื่องจากมีบิตเลขชี้กำลังเพียงเล็กน้อย ค่าขนาดใหญ่จะล้นออกมา และค่าเล็กๆ จะลดลงจนเหลือศูนย์ การปรับขนาดเทนเซอร์ใหม่ในหน้าต่างที่ใช้งานได้ของ FP8 ก่อนคำนวณ
ข้อเสียเปรียบหลักของการใช้ FP8 คืออะไร
บิตที่น้อยลงหมายถึงการแสดงที่หยาบขึ้นและมีข้อผิดพลาดในการปัดเศษมากขึ้น ข้อดีคือมีหน่วยความจำและแบนด์วิธน้อยกว่ามาก และคำนวณได้เร็วกว่าบนฮาร์ดแวร์ที่รองรับ
NVIDIA GPU รุ่นใดที่เพิ่มการรองรับฮาร์ดแวร์เฉพาะสำหรับคณิตศาสตร์เมทริกซ์ FP8 เป็นครั้งแรก
GPU ที่ใช้ฮอปเปอร์เช่น H100 แนะนำการรองรับ FP8 Tensor Core และต่อมา Blackwell ได้ขยายสิ่งนี้เป็น FP4