Kembali ke Berita
produkAI Understanding taklimat

NVIDIA pratonton pemulihan enjin bayangan untuk kegagalan LLM yang lebih pantas

NVIDIA mengatakan ciri pratonton dalam platform inferens Dynamonya boleh memulihkan pekerja LLM dalam beberapa saat dengan mengekalkan enjin siap sedia prainisial pada GPU yang sama dan berkongsi berat model dalam ingatan. Dalam penanda aras syarikat, pemulihan mengambil masa 7.3 saat dan bukannya 283 saat selepas kegagalan pekerja.

6 min readRead the primary source
Primary-source image accompanying NVIDIA previews shadow-engine recovery for faster LLM failover
Dokumen sumber utamaSumber direkodkan
Penerbit
developer.nvidia.com
Pautan sumber
developer.nvidia.comhttps://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

NVIDIA memperkenalkan pemulihan enjin bayangan sebagai ciri pratonton dalam Dynamo, platformnya untuk menyajikan model bahasa yang besar. Reka bentuk mengekalkan enjin terbiar yang dimulakan sepenuhnya di sebelah enjin aktif dan menggunakan Perkhidmatan Memori GPU untuk memelihara dan berkongsi berat model merentas kegagalan proses.

NVIDIA menyifatkan pemulihan enjin bayangan dalam blog teknikal bertarikh 25 Ogos 2026, sebagai keupayaan pratonton dalam NVIDIA Dynamo. Syarikat itu berkata pemulihan konvensional selepas proses enjin LLM gagal memerlukan pemuatan berat model ke dalam memori lebar jalur tinggi, menyusun kernel, saiz cache nilai kunci, menala enjin dan menangkap semula graf CUDA. Urutan permulaan sejuk itu boleh mengambil masa beberapa minit untuk model besar, meninggalkan pekerja yang tinggal untuk menyerap trafik pekerja yang gagal.

Reka bentuk yang dicadangkan meletakkan dua proses enjin pada setiap GPU pekerja. Satu enjin menyediakan permintaan manakala yang lain melengkapkan pemulaan dan kemudian menunggu dalam keadaan tidak aktif. Perkhidmatan Memori GPU NVIDIA, atau GMS, memiliki memori fizikal yang digunakan untuk pemberat secara bebas daripada proses enjin. Enjin memetakan halaman berat fizikal yang sama ke dalam ruang alamat CUDA mereka sendiri, jadi siap sedia tidak memerlukan salinan kedua berat model dalam HBM. NVIDIA berkata GMS ialah kereta sampingan per-GPU yang memperuntukkan halaman fizikal dan menyediakan pemegang; ia tidak berada di laluan bacaan kernel kemudiannya.

Sebelum menjadi tidak aktif, enjin bayangan menetapkan konteks CUDAnya, mengimport pemetaan berat, mencipta komunikator NCCL dan NIXL, menangkap graf CUDA dan melakukan pemanasan. Ia tidak menjadi cache KV semasa diletakkan. Jika proses aktif keluar, kunci fail POSIX yang dikongsi dikeluarkan oleh sistem pengendalian, membenarkan bayang memperoleh kunci, memetakan semula beratnya, merealisasikan cachenya dan mendaftar dengan penghala. NVIDIA berkata enjin yang gagal kemudiannya dimulakan semula di latar belakang dan menjadi bayang-bayang seterusnya.

NVIDIA mengukur reka bentuk dengan sengaja menamatkan seorang pekerja dalam penempatan dua pekerja GLM-5.2. Persediaan menggunakan pemberat NVFP4 terkuantisasi, nod NVIDIA B200, selari tensor lapan, konteks maksimum 200,000 token, cache FP8 KV dan permintaan sintetik yang mengandungi 32,000 token input dan 1,000 token output. Permintaan tiba pada 0.7 sesaat dan diedarkan secara round-robin. Dalam ujian itu, pekerja kedua menyambung semula perkhidmatan selepas 7.3 saat dengan pemulihan bayang, berbanding dengan 283 saat untuk memulakan semula sejuk. NVIDIA melaporkan masa median selepas kegagalan yang lebih rendah kepada token pertama dan kadar penyahkod setiap pengguna yang lebih tinggi dalam konfigurasi bayang-bayang.

Butiran sumber: developer.nvidia.com ↗

Mengapa ia penting

Ciri ini menyasarkan kelemahan praktikal dalam penggunaan LLM: kegagalan perisian boleh menyebabkan pekerja yang masih hidup membawa semua trafik manakala proses penggantian memuatkan semula pemberat dan membina semula keadaan pelaksanaannya. Pemulihan yang lebih pantas boleh mengurangkan lonjakan kependaman dan gangguan peringkat perkhidmatan, walaupun keputusan NVIDIA datang daripada satu penanda aras yang dikendalikan oleh syarikat dan tidak meliputi perkakasan atau kegagalan nod.

Nilai segera ialah kesinambungan perkhidmatan untuk kelas kegagalan yang tidak merosakkan perkakasan asas. NVIDIA secara khusus menerangkan ranap proses, ralat CUDA boleh pulih dan kegagalan kolektif sementara sebagai kes di mana nod dan GPU mungkin kekal sihat semasa keadaan proses hilang. Semasa memulakan semula sejuk, pekerja yang masih hidup boleh menjadi lebih beban; ujian syarikat melaporkan masa median selepas kegagalan kepada token pertama sebanyak 23,815 milisaat dalam garis dasar, berbanding dengan 1,311 milisaat dengan pemulihan bayang-bayang.

Hasilnya juga ialah perubahan pengurusan memori dengan implikasi bagaimana sistem inferens menggunakan kapasiti GPU yang mahal. Enjin siap sedia biasanya memerlukan satu lagi salinan penuh pemberat, mengurangkan memori yang tersedia untuk pemprosesan permintaan. NVIDIA berkata GMS membenarkan enjin serentak berkongsi satu salinan fizikal, manakala bayang yang diletakkan hanya mengekalkan konteksnya, graf yang ditangkap, komunikator dan pemetaan. Syarikat menyifatkan ini sebagai kos berat marginal sifar untuk enjin sekunder, tetapi sumbernya tidak menyediakan perakaunan lengkap semua kos memori tambahan, CPU, penyimpanan atau orkestrasi.

Penanda aras menunjukkan bahawa kejuruteraan ketersediaan boleh menjejaskan pengalaman pengguna secara material walaupun model itu sendiri tidak berubah. NVIDIA melaporkan bahawa 201 daripada 399 permintaan garis dasar melebihi lima saat kepada token pertama selepas kesalahan yang disuntik, berbanding dengan satu daripada 398 permintaan dalam lengan bayangan. Ia juga melaporkan bahawa 226 permintaan garis dasar jatuh di bawah 20 token sesaat bagi setiap pengguna, berbanding dengan tiada dalam lengan bayangan. Angka-angka ini adalah ukuran daripada ujian sintetik yang dinyatakan NVIDIA, bukan bukti bebas bahawa peningkatan yang sama akan berlaku merentas model, corak trafik atau persekitaran pengeluaran.

Terdapat sempadan penting untuk tuntutan itu. Ciri ini ialah pratonton dan menangani kegagalan proses enjin, bukan perkakasan, nod atau kegagalan berbilang nod; mereka masih menggunakan penjadualan semula standard. Bayang yang digalakkan bermula dengan cache KV kosong, jadi NVIDIA mengatakan terdapat sedikit peningkatan masa-ke-pertama-token selepas pemotongan. Syarikat sedang berusaha untuk memindahkan kedua-dua indeks cache awalan dan memori cache, tetapi tidak memberikan tarikh siap. Sumber juga tidak menyatakan harga, masa ketersediaan umum, pengesahan bebas atau keputusan untuk beban kerja di luar konfigurasi yang diterangkan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

NVIDIA mengatakan ciri ini akan dilancarkan secara berperingkat dalam beberapa bulan akan datang. Ujian penting akan merangkumi beban kerja sebenar, sokongan bahagian belakang yang lebih luas, overhed operasi dan sama ada versi akan datang boleh mengekalkan keadaan cache KV semasa failover dan bukannya membina semula selepas promosi.

NVIDIA berkata pemulihan enjin bayangan akan dilancarkan secara berperingkat dalam beberapa bulan akan datang, dengan vLLM sebagai bahagian belakang yang disokong utama. Blog tersebut mengatakan vLLM, SGLang dan TensorRT-LLM masing-masing mengintegrasikan GMS melalui pengalokasi tersuai CUDA-pluggable untuk kumpulan memori berat, tetapi contoh pemulihan yang didokumenkan dibina di sekitar vLLM. Nota keluaran masa hadapan harus menjelaskan bahagian belakang yang boleh menggunakan aliran kerja pemulihan lengkap dan di bawah keadaan penggunaan.

Pencapaian teknikal seterusnya ialah kesinambungan cache. Hari ini, tunggu sedia menyimpan julat alamat cache KV tanpa sokongan fizikal dan mencipta cache hanya selepas promosi. Ini mengurangkan jejak yang diletakkan, tetapi ini juga bermakna enjin yang dipromosikan tidak mempunyai perbualan awal dan keadaan cache awalan. Mengekalkan keadaan itu boleh mengurangkan lagi bonjolan prestasi pendek selepas pemotongan, sambil memperkenalkan penyegerakan tambahan dan keperluan pengurusan memori yang belum diperincikan oleh sumber.

Operator perlu menilai ciri tersebut terhadap mod dan infrastruktur kegagalan mereka sendiri. Arahan yang diterangkan memerlukan Kubernetes 1.34 atau lebih baharu, Peruntukan Sumber Dinamik didayakan dan pemacu DRA GPU NVIDIA. NVIDIA melaporkan 1.7 saat untuk mengesan kerosakan yang disuntik dan 5.6 saat untuk mempromosikan bayang dalam ujiannya, tetapi pemasaan tersebut mungkin bergantung pada probe, penghala, saiz model, konfigurasi kelompok dan trafik. Sumber tidak menyediakan keperluan sumber perbandingan untuk menjalankan enjin tidak aktif.

Ujian bebas harus memeriksa sama ada keuntungan yang dilaporkan berterusan dengan model yang berbeza, panjang konteks, campuran permintaan, tingkah laku penskalaan automatik dan susun atur berbilang GPU atau berbilang nod. Ia juga harus mengukur kekerapan kegagalan dikesan dengan bersih, sama ada handoff berasaskan kunci kekal andal semasa kerosakan separa, dan seberapa cepat enjin yang dimulakan semula boleh memasuki semula keadaan bayang-bayang. Sehingga soalan tersebut dijawab, ciri ini paling baik difahami sebagai pratonton yang menjanjikan untuk pemulihan kegagalan perisian dan bukannya penyelesaian umum kepada gangguan inferens.

Panduan & kuiz berkaitan

Model AI DiterangkanChatGPT & LLMEjen AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?