แกนเทนเซอร์
Tensor Cores เป็นหน่วยฮาร์ดแวร์เฉพาะภายใน NVIDIA GPU สมัยใหม่ที่ดำเนินการเมทริกซ์คูณและสะสมอย่างรวดเร็วมาก
ภาพรวม
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
เจาะลึก
Tensor Core ซึ่งเปิดตัวพร้อมกับสถาปัตยกรรม Volta ในปี 2017 เป็นวงจรเฉพาะที่คำนวณการคูณเมทริกซ์ขนาดเล็กบวกกับการบวก (D = A x B + C) ในการดำเนินการครั้งเดียว แทนที่จะทำการคูณครั้งละหนึ่งคอร์บนคอร์ CUDA มาตรฐาน เนื่องจากแทบทุกเลเยอร์ของโครงข่ายประสาทเทียมลดการคูณเมทริกซ์ จึงตรงกับคณิตศาสตร์ที่ AI ต้องการจริงๆ GPU แต่ละรุ่นขยายสิ่งที่พวกเขาจัดการ: Volta ทำไทล์ 4x4 FP16 ในขณะที่สถาปัตยกรรม Ampere, Hopper และ Blackwell ในเวลาต่อมาได้เพิ่มรูปแบบที่มีความแม่นยำต่ำกว่า เช่น TF32, BF16, INT8, FP8 และ FP4 ความแม่นยำที่ลดลงหมายถึงจำนวนที่ประมวลผลต่อนาฬิกามากขึ้น ซึ่งช่วยเพิ่มปริมาณงานสำหรับการฝึกอบรมและการอนุมานได้อย่างมาก ขณะเดียวกันก็รักษาความแม่นยำที่ยอมรับได้
ข้อมูลเชิงลึกทางเทคนิค
Tensor Core จะคูณเมทริกซ์ขนาดเล็กสองตัวและสะสมผลลัพธ์ไว้ในขั้นตอนเดียว โดยใช้ประโยชน์จากข้อเท็จจริงที่ว่าค่าอินพุตเดียวกันจะถูกนำมาใช้ซ้ำในองค์ประกอบเอาต์พุตจำนวนมาก โดยทั่วไปจะอ่านอินพุตด้วยความแม่นยำลดลง (FP16, BF16 หรือ FP8) แต่จะสะสมผลรวมที่ทำงานด้วยความแม่นยำสูงกว่า (มักจะเป็น FP32) เพื่อจำกัดข้อผิดพลาดในการปัดเศษ ไลบรารีซอฟต์แวร์ เช่น cuBLAS และ cuDNN และเฟรมเวิร์ก เช่น PyTorch จะเรียงเมทริกซ์ขนาดใหญ่ลงในบล็อกขนาดเล็กเหล่านี้โดยอัตโนมัติ เพื่อให้โมเดลได้รับการเร่งความเร็วโดยไม่ต้องเขียนโค้ดด้วยตนเอง
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของเทนเซอร์คอร์
Tensor Cores มุ่งสู่ความแม่นยำที่ลดลงอย่างต่อเนื่อง: Hopper เพิ่ม FP8 และ Blackwell เปิดตัว FP4 4 บิตพร้อมการปรับขนาดที่จัดการด้วยฮาร์ดแวร์ โดยเพิ่มปริมาณงานเป็นสองเท่าโดยประมาณในแต่ละขั้นตอนสำหรับปริมาณงานที่ต้องใช้การอนุมานจำนวนมาก คาดหวังการสนับสนุนที่เข้มงวดยิ่งขึ้นสำหรับความกระจัดกระจาย (ข้ามน้ำหนักเป็นศูนย์) รูปแบบไมโครสเกลที่แนบปัจจัยขนาดเข้ากับบล็อกตัวเลขขนาดเล็ก และการบูรณาการที่ลึกยิ่งขึ้นกับระบบหน่วยความจำเพื่อให้คอร์ยังคงได้รับอาหาร เมื่อโมเดลเติบโตขึ้น เมทริกซ์เอ็นจิ้น (ไม่ใช่ความเร็วสัญญาณนาฬิกาดิบ) ยังคงเป็นสมรภูมิสำคัญสำหรับประสิทธิภาพของฮาร์ดแวร์ AI
การใช้งานจริงในโลกแห่งความเป็นจริง
ฝึกอบรมโมเดลภาษาขนาดใหญ่ เช่น หม้อแปลงแบบ GPT ซึ่งการคูณเมทริกซ์นับพันล้านครั้งต่อขั้นตอนทำงานบน Tensor Cores ใน BF16 หรือ FP8
เรียกใช้การอนุมานแบบเรียลไทม์สำหรับแชทบอทและเครื่องสร้างรูปภาพ โดยใช้การวัดปริมาณ INT8 หรือ FP8 เพื่อให้บริการผู้ใช้ต่อ GPU มากขึ้น
การเร่งความเร็ว NVIDIA DLSS ในวิดีโอเกม โดยโครงข่ายประสาทเทียมจะอัปสเกลเฟรมที่มีความละเอียดต่ำลงโดยใช้ Tensor Cores แต่ละเฟรม
เร่งการประมวลผลทางวิทยาศาสตร์ เช่น การพับโปรตีน (AlphaFold) และแบบจำลองสภาพอากาศที่ได้รับการจัดรูปแบบใหม่ให้เป็นปริมาณงานของระบบประสาทที่เน้นเมทริกซ์
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ความเท่าเทียมของเทนเซอร์สำหรับรุ่นขนาดใหญ่
คำถามที่พบบ่อย
What is Tensor Cores?
Tensor Cores เป็นหน่วยฮาร์ดแวร์เฉพาะภายใน NVIDIA GPU สมัยใหม่ที่ดำเนินการเมทริกซ์คูณและสะสมอย่างรวดเร็วมาก นี่เป็นเหตุผลหลักที่ทำให้ GPU ตัวเดียวสามารถฝึกและรันโครงข่ายประสาทเทียมขนาดใหญ่ได้เร็วกว่าการคำนวณทั่วไป
การดำเนินการทางคณิตศาสตร์หลักใดคือ Tensor Cores ที่ออกแบบมาเพื่อเร่งความเร็วโดยเฉพาะ
Tensor Cores ทำการคูณเมทริกซ์แบบหลอมรวมและการสะสมในขั้นตอนเดียว ซึ่งเป็นการดำเนินการที่ครอบงำเลเยอร์เครือข่ายประสาทอย่างแน่นอน
สถาปัตยกรรม NVIDIA GPU ใดที่เปิดตัว Tensor Cores เป็นครั้งแรก
Tensor Cores เปิดตัวครั้งแรกพร้อมกับสถาปัตยกรรม Volta ในปี 2017 โดยเริ่มต้นด้วยการดำเนินการเมทริกซ์ FP16 4x4
เหตุใด Tensor Core จึงมักใช้ความแม่นยำลดลง เช่น FP16 หรือ FP8
การใช้บิตต่อตัวเลขน้อยลงหมายถึงค่าจะไหลผ่านฮาร์ดแวร์มากขึ้นในแต่ละรอบ ซึ่งเพิ่มความเร็วได้อย่างมากโดยสูญเสียความแม่นยำเพียงเล็กน้อยเท่านั้น ซึ่งปกติจะยอมรับได้
เพื่อรักษาความแม่นยำ โดยทั่วไป Tensor Cores จะใช้ความแม่นยำเท่าใดสำหรับผลรวมรัน (การสะสม)
อินพุตอาจมีความแม่นยำต่ำ แต่ตัวสะสมมักจะทำงานด้วยความแม่นยำสูงกว่าเช่น FP32 เพื่อจำกัดการสะสมของข้อผิดพลาดในการปัดเศษ
เฟรมเวิร์ก AI ในชีวิตประจำวันอย่าง PyTorch ใช้ประโยชน์จาก Tensor Cores ได้อย่างไร
ไลบรารีพื้นฐานแบ่งการดำเนินการเมทริกซ์ขนาดใหญ่ออกเป็นไทล์ขนาด Tensor-Core โดยอัตโนมัติ ดังนั้นเฟรมเวิร์กจึงเร่งความเร็วได้โดยไม่ต้องเขียนโค้ดด้วยตนเอง