เกิดอะไรขึ้น
NVIDIA เปิดตัวการกู้คืนกลไกเงาเป็นคุณลักษณะการแสดงตัวอย่างใน Dynamo ซึ่งเป็นแพลตฟอร์มสำหรับให้บริการโมเดลภาษาขนาดใหญ่ การออกแบบนี้ทำให้เอ็นจิ้นที่ไม่ได้ใช้งานและเริ่มต้นอย่างสมบูรณ์อยู่ข้างๆ เอ็นจิ้นที่ทำงานอยู่ และใช้บริการหน่วยความจำ GPU เพื่อรักษาและแบ่งปันน้ำหนักโมเดลตลอดความล้มเหลวของกระบวนการ
NVIDIA อธิบายการกู้คืน Shadow Engine ในบล็อกทางเทคนิคลงวันที่ 25 ส.ค. 2026 เพื่อเป็นการแสดงตัวอย่างใน NVIDIA Dynamo บริษัทกล่าวว่าการกู้คืนแบบเดิมหลังจากกระบวนการเอ็นจิ้น LLM ล้มเหลวนั้น จำเป็นต้องโหลดน้ำหนักของโมเดลลงในหน่วยความจำแบนด์วิธสูง รวบรวมเคอร์เนล ปรับขนาดแคชคีย์-ค่า ปรับแต่งเอ็นจิ้น และนำกราฟ CUDA กลับมาใช้ใหม่ ลำดับการสตาร์ทขณะเครื่องเย็นอาจใช้เวลาไม่กี่นาทีสำหรับโมเดลขนาดใหญ่ ปล่อยให้ผู้ปฏิบัติงานที่เหลือต้องรับภาระการรับส่งข้อมูลของผู้ปฏิบัติงานที่ล้มเหลว
การออกแบบที่เสนอจะวางกระบวนการของเครื่องยนต์สองกระบวนการบน GPU ของพนักงานแต่ละคน เอ็นจิ้นหนึ่งให้บริการคำขอในขณะที่อีกเครื่องหนึ่งดำเนินการเตรียมใช้งานให้เสร็จสมบูรณ์ จากนั้นรอในสถานะที่ไม่มีการเคลื่อนไหว GPU Memory Service หรือ GMS ของ NVIDIA เป็นเจ้าของหน่วยความจำกายภาพที่ใช้สำหรับน้ำหนักโดยไม่ขึ้นอยู่กับกระบวนการของเครื่องยนต์ เอ็นจิ้นแมปหน้าน้ำหนักจริงเดียวกันลงในพื้นที่ที่อยู่ CUDA ของตัวเอง ดังนั้นการสแตนด์บายจึงไม่จำเป็นต้องมีสำเนาน้ำหนักโมเดลชุดที่สองใน HBM NVIDIA กล่าวว่า GMS เป็นผู้ช่วยต่อ GPU ที่จัดสรรเพจจริงและจัดเตรียมการจัดการ มันไม่ได้อยู่ในเส้นทางของเคอร์เนลที่อ่านในภายหลัง
ก่อนที่จะหยุดนิ่ง โปรแกรมเงาจะสร้างบริบท CUDA นำเข้าการแมปน้ำหนัก สร้างเครื่องมือสื่อสาร NCCL และ NIXL บันทึกกราฟ CUDA และดำเนินการอุ่นเครื่อง มันจะไม่สร้างแคช KV ขึ้นมาขณะจอด หากกระบวนการที่ใช้งานอยู่ออก ระบบปฏิบัติการจะปล่อยการล็อกไฟล์ POSIX ที่ใช้ร่วมกัน ซึ่งจะทำให้เงาสามารถรับการล็อก ทำการแมปน้ำหนักใหม่ สร้างแคชให้เป็นรูปธรรม และลงทะเบียนกับเราเตอร์ NVIDIA กล่าวว่าเอ็นจิ้นที่ล้มเหลวจะถูกรีสตาร์ทในเบื้องหลังและกลายเป็นเงาถัดไป
NVIDIA วัดการออกแบบโดยจงใจยุติคนงานหนึ่งคนในการปรับใช้ GLM-5.2 คนงานสองคน การตั้งค่าใช้น้ำหนัก NVFP4 เชิงปริมาณ, โหนด NVIDIA B200, ความขนานของเทนเซอร์ 8 รายการ, บริบทสูงสุด 200,000 โทเค็น, แคช FP8 KV และคำขอสังเคราะห์ที่มีโทเค็นอินพุต 32,000 รายการและโทเค็นเอาต์พุต 1,000 รายการ คำขอมาถึงที่ 0.7 ต่อวินาทีและกระจายแบบวนซ้ำ ในการทดสอบนั้น พนักงานคนที่สองกลับมาให้บริการต่อหลังจาก 7.3 วินาทีด้วย Shadow Recovery เทียบกับ 283 วินาทีสำหรับการรีสตาร์ทแบบ Cold NVIDIA รายงานเวลาเฉลี่ยหลังความล้มเหลวสำหรับโทเค็นแรกและอัตราการถอดรหัสต่อผู้ใช้ที่สูงขึ้นในการกำหนดค่าเงา
รายละเอียดที่มา: developer.nvidia.com ↗
ทำไมมันถึงสำคัญ
คุณลักษณะนี้มุ่งเป้าไปที่จุดอ่อนในทางปฏิบัติในการปรับใช้ LLM: ความล้มเหลวของซอฟต์แวร์อาจทำให้พนักงานที่รอดชีวิตต้องรับส่งข้อมูลทั้งหมด ในขณะที่กระบวนการทดแทนจะโหลดน้ำหนักใหม่และสร้างสถานะการดำเนินการใหม่ การกู้คืนที่เร็วขึ้นสามารถลดความล่าช้าและการหยุดชะงักของระดับบริการ แม้ว่าผลลัพธ์ของ NVIDIA จะมาจากเกณฑ์มาตรฐานเดียวที่ดำเนินการโดยบริษัท และไม่ครอบคลุมถึงความล้มเหลวของฮาร์ดแวร์หรือโหนด
ค่าทันทีคือความต่อเนื่องของการบริการสำหรับคลาสของความล้มเหลวที่ไม่ทำให้ฮาร์ดแวร์เสียหาย NVIDIA อธิบายโดยเฉพาะถึงการหยุดทำงานของกระบวนการ ข้อผิดพลาด CUDA ที่สามารถกู้คืนได้ และความล้มเหลวโดยรวมชั่วคราว เนื่องจากเป็นกรณีที่โหนดและ GPU อาจยังคงอยู่ในสภาพปกติในขณะที่สถานะของกระบวนการสูญหาย ในระหว่างการรีสตาร์ทขณะเย็น คนงานที่รอดชีวิตอาจมีภาระงานมากเกินไป การทดสอบของบริษัทรายงานเวลาเฉลี่ยหลังความล้มเหลวไปยังโทเค็นแรกที่ 23,815 มิลลิวินาทีในช่วงพื้นฐาน เทียบกับ 1,311 มิลลิวินาทีที่มีการกู้คืนเงา
ผลลัพธ์ก็คือการเปลี่ยนแปลงการจัดการหน่วยความจำโดยมีผลกระทบต่อวิธีที่ระบบอนุมานใช้ความจุ GPU ที่มีราคาแพง โดยปกติแล้ว เอ็นจิ้นสแตนด์บายจะต้องมีสำเนาน้ำหนักฉบับเต็มอีกชุด ซึ่งจะทำให้หน่วยความจำที่พร้อมใช้งานสำหรับการประมวลผลคำขอลดลง NVIDIA กล่าวว่า GMS อนุญาตให้เอ็นจิ้นที่ทำงานพร้อมกันแบ่งปันสำเนาทางกายภาพหนึ่งสำเนา ในขณะที่เงาที่จอดไว้จะคงไว้เพียงบริบท กราฟที่บันทึกไว้ เครื่องมือสื่อสาร และการแมป บริษัทกำหนดลักษณะของสิ่งนี้ว่าเป็นต้นทุนส่วนเพิ่มเป็นศูนย์สำหรับเอ็นจิ้นรอง แต่แหล่งที่มาไม่ได้จัดเตรียมบัญชีที่สมบูรณ์ของต้นทุนหน่วยความจำ, CPU, พื้นที่จัดเก็บ หรือการจัดการที่เพิ่มทั้งหมด
เกณฑ์มาตรฐานชี้ให้เห็นว่าวิศวกรรมความพร้อมใช้งานสามารถส่งผลกระทบอย่างมีนัยสำคัญต่อประสบการณ์ผู้ใช้ แม้ว่าตัวโมเดลจะไม่เปลี่ยนแปลงก็ตาม NVIDIA รายงานว่าคำขอพื้นฐาน 201 รายการจาก 399 รายการใช้เวลาเกินห้าวินาทีในโทเค็นแรกหลังจากข้อผิดพลาดที่ฉีดเข้าไป เปรียบเทียบกับคำขอรายการใดรายการหนึ่งจาก 398 รายการใน Shadow Arm นอกจากนี้ ยังรายงานว่าคำขอพื้นฐาน 226 รายการลดลงต่ำกว่า 20 โทเค็นต่อวินาทีต่อผู้ใช้ เมื่อเทียบกับไม่มีใน Shadow Arm ตัวเลขเหล่านี้เป็นการวัดจากการทดสอบสังเคราะห์ที่ระบุของ NVIDIA ไม่ใช่หลักฐานอิสระที่บ่งชี้ว่าการปรับปรุงแบบเดียวกันนี้จะเกิดขึ้นกับโมเดล รูปแบบการรับส่งข้อมูล หรือสภาพแวดล้อมการผลิต
การเรียกร้องมีขอบเขตที่สำคัญ คุณลักษณะนี้เป็นการแสดงตัวอย่างและจัดการกับความล้มเหลวของกระบวนการกลไก ไม่ใช่ความล้มเหลวของฮาร์ดแวร์ โหนด หรือหลายโหนด ผู้ที่ยังคงใช้การกำหนดเวลาใหม่แบบมาตรฐาน เงาที่ได้รับการเลื่อนขั้นเริ่มต้นด้วยแคช KV ที่ว่างเปล่า ดังนั้น NVIDIA จึงบอกว่ามีเวลาเพิ่มขึ้นเล็กน้อยหลังการตัดโทเค็นถึงโทเค็นแรก บริษัทกำลังดำเนินการถ่ายโอนทั้งดัชนีแคชคำนำหน้าและหน่วยความจำแคช แต่ไม่ได้ระบุวันที่เสร็จสมบูรณ์ แหล่งที่มายังไม่ได้ระบุราคา ระยะเวลาความพร้อมใช้งานทั่วไป การตรวจสอบอิสระ หรือผลลัพธ์สำหรับปริมาณงานที่เกินกว่าการกำหนดค่าที่อธิบายไว้
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
NVIDIA กล่าวว่าฟีเจอร์นี้จะเปิดตัวเพิ่มขึ้นเรื่อยๆ ในอีกไม่กี่เดือนข้างหน้า การทดสอบที่สำคัญจะรวมถึงปริมาณงานจริง การสนับสนุนแบ็กเอนด์ที่กว้างขึ้น ค่าใช้จ่ายในการดำเนินงาน และเวอร์ชันในอนาคตสามารถรักษาสถานะ KV-cache ในระหว่างที่เกิดข้อผิดพลาด แทนที่จะสร้างใหม่หลังจากการเลื่อนระดับหรือไม่
NVIDIA กล่าวว่าการกู้คืน Shadow Engine จะเปิดตัวเพิ่มขึ้นเรื่อยๆ ในอีกไม่กี่เดือนข้างหน้า โดยมี vLLM เป็นแบ็กเอนด์หลักที่ได้รับการสนับสนุน บล็อกระบุว่า vLLM, SGLang และ TensorRT-LLM ต่างก็รวม GMS ผ่านทางตัวจัดสรร CUDA-pluggable แบบกำหนดเองสำหรับพูลหน่วยความจำน้ำหนัก แต่ตัวอย่างการกู้คืนเอกสารนั้นสร้างขึ้นจาก vLLM บันทึกประจำรุ่นในอนาคตควรชี้แจงว่าแบ็กเอนด์ใดที่สามารถใช้เวิร์กโฟลว์การกู้คืนที่สมบูรณ์ได้ และภายใต้เงื่อนไขการใช้งานแบบใด
เหตุการณ์สำคัญทางเทคนิคครั้งต่อไปคือความต่อเนื่องของแคช ปัจจุบัน โหมดสำรองจะสงวนช่วงที่อยู่แคช KV โดยไม่มีการสำรองข้อมูลจริง และสร้างแคชหลังจากเลื่อนระดับแล้วเท่านั้น ซึ่งจะช่วยลดรอยเท้าที่จอดไว้ แต่ยังหมายถึงกลไกที่ได้รับการเลื่อนระดับขาดการสนทนาก่อนหน้าและสถานะแคชคำนำหน้า การรักษาสถานะดังกล่าวสามารถลดการชนของประสิทธิภาพในช่วงสั้นๆ ได้อีกหลังจากการตัดโอเวอร์ ขณะเดียวกันก็แนะนำข้อกำหนดการซิงโครไนซ์และการจัดการหน่วยความจำเพิ่มเติมที่แหล่งที่มายังไม่มีรายละเอียด
ผู้ปฏิบัติงานจะต้องประเมินคุณสมบัติเทียบกับโหมดความล้มเหลวและโครงสร้างพื้นฐานของตนเอง การใช้งานที่อธิบายไว้ต้องใช้ Kubernetes 1.34 หรือใหม่กว่า เปิดใช้งานการจัดสรรทรัพยากรแบบไดนามิก และไดรเวอร์ NVIDIA GPU DRA NVIDIA รายงาน 1.7 วินาทีในการตรวจจับข้อผิดพลาดที่ฉีดเข้าไป และ 5.6 วินาทีในการเพิ่มเงาในการทดสอบ แต่การกำหนดเวลาเหล่านั้นอาจขึ้นอยู่กับโพรบ เราเตอร์ ขนาดโมเดล การกำหนดค่าคลัสเตอร์ และการรับส่งข้อมูล แหล่งที่มาไม่ได้จัดเตรียมข้อกำหนดทรัพยากรเชิงเปรียบเทียบสำหรับการรันเอ็นจิ้นที่อยู่เฉยๆ
การทดสอบอิสระควรตรวจสอบว่ารายงานที่ได้รับยังคงมีอยู่กับโมเดล ความยาวบริบท คำขอแบบผสม ลักษณะการทำงานแบบปรับขนาดอัตโนมัติ และเค้าโครงแบบหลาย GPU หรือหลายโหนด นอกจากนี้ ควรวัดความถี่ที่ตรวจพบความล้มเหลวได้อย่างหมดจด แฮนด์ออฟแบบล็อคยังคงเชื่อถือได้ในระหว่างเกิดข้อผิดพลาดบางส่วนหรือไม่ และความเร็วที่เครื่องยนต์ที่รีสตาร์ทสามารถกลับเข้าสู่สถานะเงาอีกครั้งได้หรือไม่ จนกว่าคำถามเหล่านั้นจะได้รับคำตอบ คุณลักษณะนี้ถือเป็นที่เข้าใจได้ดีที่สุดว่าเป็นการแสดงตัวอย่างที่มีแนวโน้มสำหรับการกู้คืนความล้มเหลวของซอฟต์แวร์ แทนที่จะเป็นวิธีแก้ปัญหาทั่วไปสำหรับการหยุดทำงานของการอนุมาน