คู่มือทางเทคนิค

หน่วยความจำแบนด์วิธสูง

หน่วยความจำแบนด์วิธสูง (HBM) คือหน่วยความจำแบบสแต็กที่วางอยู่ข้างๆ GPU ซึ่งส่งข้อมูลได้เร็วกว่า RAM ทั่วไปมาก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันคือสิ่งที่ทําให้ AI accelerator มีพลังงานเพียงพอ ป้องกันไม่ให้แกนประมวลผลที่ทรงพลังต้องรอน้ําหนักและข้อมูลของโมเดล

เจาะลึก

HBM แก้ปัญหาคอขวดขั้นพื้นฐาน: ชิป AI สมัยใหม่สามารถดำเนินการได้นับล้านล้านรายการต่อวินาที แต่เฉพาะในกรณีที่ข้อมูลมาถึงเร็วเพียงพอเท่านั้น หน่วยความจำ GDDR มาตรฐานเชื่อมต่อผ่านบัสที่ค่อนข้างแคบ ในขณะที่ HBM จะซ้อน DRAM หลายตัวในแนวตั้ง และเชื่อมต่อกับสายไฟแนวตั้งเล็กๆ หลายพันเส้นที่เรียกว่า Through-silicon Vias (TSV) สแต็คเหล่านี้ตั้งอยู่บนซิลิคอนอินเตอร์โพเซอร์มิลลิเมตรจาก GPU ซึ่งให้เส้นทางข้อมูลที่กว้างมาก คิดหลายพันบิตในคราวเดียวแทนที่จะเป็นหลายร้อย ผลลัพธ์คือแบนด์วิธวัดเป็นเทราไบต์ต่อวินาที เจเนอเรชั่นต่างๆ ได้พัฒนาจาก HBM2 เป็น HBM2e, HBM3 และ HBM3e ซึ่งแต่ละรุ่นเพิ่มทั้งความจุและความเร็ว สำหรับโมเดลภาษาขนาดใหญ่ที่ต้องสตรีมน้ำหนักอย่างต่อเนื่อง ความจุและแบนด์วิดท์ของ HBM มักมีความสำคัญมากกว่าการประมวลผลแบบดิบ

ข้อมูลเชิงลึกทางเทคนิค

HBM บรรลุความเร็วด้วยความเท่าเทียมที่รุนแรงมากกว่าอัตรานาฬิกาที่สูงขึ้น โดยการสแต็ก DRAM ตายและเชื่อมโยงกับ TSV นับพัน จะทำให้มีอินเทอร์เฟซที่กว้างมาก (1,024 บิตต่อสแต็กขึ้นไป) ไบต์จำนวนมากจึงเคลื่อนที่พร้อมกัน การวางสแต็กบนอินเทอร์โพเซอร์ที่ใช้ร่วมกันข้าง GPU จะทำให้สายไฟสั้น ลดกำลังต่อบิตและเวลาแฝง ตัวเร่งความเร็วเพียงตัวเดียว เช่น NVIDIA H100 หรือ H200 จับคู่สแต็ก HBM หลายสแต็กเพื่อเข้าถึงแบนด์วิธหน่วยความจำทั้งหมดหลายเทราไบต์ต่อวินาที

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของหน่วยความจำแบนด์วิธสูง

แบนด์วิธหน่วยความจำกลายเป็นข้อจำกัดชั้นนำของ AI ดังนั้น HBM จึงก้าวหน้าอย่างรวดเร็ว HBM3e จำหน่ายในรุ่นเรือธง โดยที่ HBM4 คาดว่าจะมีอินเทอร์เฟซที่กว้างขึ้น สแต็กที่สูงขึ้น และความจุต่อแพ็คเกจที่มากขึ้น คาดว่าจะมีการออกแบบร่วมกันที่ใกล้ชิดยิ่งขึ้นระหว่างหน่วยความจำและตรรกะ ซึ่งอาจเป็นไปได้ที่ฐานดายแบบกำหนดเองและการประมวลผลที่ใกล้หน่วยความจำ รวมถึงการแข่งขันที่รุนแรงระหว่างซัพพลายเออร์เช่น SK hynix, Samsung และ Micron เมื่อโมเดลเติบโตขึ้น การได้รับข้อมูลที่ใกล้เคียงกับการประมวลผลมากขึ้น เร็วขึ้น และใช้พลังงานน้อยลง ยังคงเป็นศูนย์กลางของความก้าวหน้าของฮาร์ดแวร์ AI

การใช้งานจริงในโลกแห่งความเป็นจริง

ถือน้ำหนักหลายสิบหรือหลายร้อยกิกะไบต์สำหรับโมเดลภาษาขนาดใหญ่ใกล้กับ GPU เพื่อให้สามารถสตรีมได้ในทุกขั้นตอนการอนุมาน

เปิดใช้งาน GPU ศูนย์ข้อมูล NVIDIA H100 และ H200 เพื่อเข้าถึงแบนด์วิดท์หน่วยความจำหลายเทราไบต์ต่อวินาทีสำหรับการฝึกอบรม

ขับเคลื่อนคลัสเตอร์การฝึกฝน AI โดยที่ GPU จำนวนมากแต่ละตัวอาศัย HBM เพื่อหลีกเลี่ยงการหยุดชะงักระหว่างการดำเนินการแบบเมทริกซ์

รองรับโมเดลรูปภาพและวิดีโอที่มีความละเอียดสูงซึ่งจะต้องย้ายเทนเซอร์การเปิดใช้งานขนาดใหญ่เข้าและออกจากหน่วยความจำอย่างรวดเร็ว

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the High Bandwidth Memory quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การจัดการหน่วยความจำ GPU และการกระจายตัว

คำถามที่พบบ่อย

หน่วยความจําแบนด์วิดท์สูงคืออะไร?

หน่วยความจำแบนด์วิธสูง (HBM) คือหน่วยความจำแบบสแต็กที่วางอยู่ข้างๆ GPU ซึ่งส่งข้อมูลได้เร็วกว่า RAM ทั่วไปมาก นี่คือสิ่งที่คอยป้อนอาหารให้กับตัวเร่งความเร็ว AI เพื่อป้องกันไม่ให้แกนประมวลผลอันทรงพลังไม่ได้ใช้งานในขณะที่รอน้ำหนักและข้อมูลของโมเดล

ปัญหาหลักที่หน่วยความจำแบนด์วิธสูงระบุถึงปัญหาหลักสำหรับตัวเร่งความเร็ว AI คืออะไร

ชิป AI สามารถทำงานได้หลายล้านล้านรายการต่อวินาทีก็ต่อเมื่อข้อมูลมาถึงเร็วเพียงพอเท่านั้น HBM จัดหาแบนด์วิธนั้นเพื่อให้คอร์ไม่อดอาหาร

HBM สร้างขึ้นทางกายภาพแตกต่างจากหน่วยความจำ GDDR ทั่วไปอย่างไร

HBM ซ้อน DRAM ซ้อนกันและเชื่อมโยงเข้ากับสายแนวตั้ง (TSV) หลายพันเส้น ทำให้เกิดเส้นทางข้อมูลที่กว้างมาก

HBM พึ่งพาอะไรเป็นหลักเพื่อให้ได้แบนด์วิธสูง

แทนที่จะตอกบัตรเร็วขึ้น HBM เปิดเผยอินเทอร์เฟซที่กว้างมาก (1,024 บิตต่อสแต็กขึ้นไป) จึงมีไบต์จำนวนมากที่ย้ายในคราวเดียว

เหตุใด HBM Stacks จึงถูกวางไว้บน Silicon Interposer ถัดจาก GPU

สายไฟสั้นบนอินเทอร์โพเซอร์ที่ใช้ร่วมกันจะช่วยลดพลังงานที่ต้องการต่อบิตที่ถ่ายโอน และลดความหน่วงระหว่างหน่วยความจำและการประมวลผล

สำหรับโมเดลภาษาขนาดใหญ่โดยเฉพาะ เหตุใด HBM จึงมีความสำคัญพอๆ กับการประมวลผลแบบดิบ

การอนุมาน LLM จะสตรีมเมทริกซ์น้ำหนักมากอย่างต่อเนื่อง ดังนั้นความจุของหน่วยความจำและแบนด์วิดท์จึงมักกลายเป็นปัจจัยจำกัดมากกว่าปริมาณการประมวลผล