Kembali ke Berita
produkAI Understanding taklimat

Databricks menggariskan alat latihan PyTorch yang tahan terhadap kesalahan untuk Masa Jalan AI

Databricks berkata pengedaran, pusat pemeriksaan tak segerak dan pemuatan data cache boleh mengurangkan masa pemulihan dan masa melahu GPU semasa latihan PyTorch berskala besar, sambil memberi amaran bahawa pusat pemeriksaan saluran paip data yang tidak lengkap boleh memesongkan kerja yang disambung semula secara senyap.

5 min readRead the primary source
Primary-source image accompanying Databricks outlines fault-tolerant PyTorch training tools for AI Runtime
Dokumen sumber utamaSumber direkodkan
Penerbit
databricks.com
Pautan sumber
databricks.comhttps://www.databricks.com/blog/fast-fault-tolerant-pytorch-training-ai-runtime
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Parameter
Berat yang dipelajari dalam model yang mempengaruhi outputnya.
Saluran paip
Aliran kerja tertib prapemprosesan, langkah model dan peringkat pasca pemprosesan.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Dalam jawatan kejuruteraan pada 28 Ogos 2026, Databricks menerangkan AI Runtime API untuk menjadikan kerja latihan PyTorch yang besar lebih berdaya tahan terhadap kegagalan GPU dan saluran paip input yang lebih perlahan. Syarikat itu mengesyorkan pemeriksaan diedarkan, penjimatan tak segerak, pemulihan automatik, caching dan prefetching setempat, dan periksa saluran paip data dan keadaan penjana nombor rawak bersama berat model.

Siaran itu kemudiannya mengesyorkan operasi simpan tak segerak PyTorch. Dalam reka bentuk ini, latihan membayar untuk salinan pantas ke dalam penimbal pementasan sementara muat naik diteruskan di latar belakang. Databricks berkata UCVolumeWriter dan UCVolumeReader AI Runtime menggunakan pementasan NVMe tempatan dan menandakan pusat pemeriksaan selesai hanya selepas semua data sampai ke destinasinya. Oleh itu, pendekatan itu memisahkan titik di mana latihan boleh diteruskan dari penyiapan kemudian kerja penyimpanan, sambil masih mengikat penyiapan pusat pemeriksaan ke destinasi dan bukannya hanya kepada salinan tempatan. Perbezaan ini adalah penting kepada perihalan siaran latihan toleran kesalahan dan aliran kerja pemulihannya.

Dalam perbandingan yang dilaporkan syarikat, model bahasa DDP 2.8 bilion pada 32 GPU H100 mengambil masa 36 saat dengan async_save berbanding 66 saat dengan torch.save, atau 1.8 kali lebih pantas. Untuk model 20 bilion parameter pada 32 GPU H100, jadual melaporkan 9 saat berbanding 522 saat atau 58 kali lebih pantas. Angka ini menerangkan perbandingan masa pemeriksaan yang dibentangkan oleh Databricks untuk model dan perkakasan yang dinyatakan. Ia ditawarkan sebagai bukti untuk nilai penjimatan tak segerak, sambil kekal terikat pada konfigurasi dan konteks pengukuran yang diterangkan dalam siaran.

Siaran itu mengatakan perbandingan itu tidak termasuk masa storan rangkaian torch.save. Kelayakan itu mentakrifkan apa yang dilakukan dan tidak dilindungi oleh perbandingan masa yang dilaporkan. Oleh itu, pengesyoran adalah lebih luas daripada angka kelajuan tunggal: titik semakan yang diedarkan, penjimatan latar belakang, pemulihan automatik, pementasan tempatan, caching dan prefetching dibentangkan sebagai bahagian berkaitan reka bentuk daya tahan. Bersama-sama, butiran menunjukkan cara Databricks menghubungkan mekanik pusat pemeriksaan dengan masalah praktikal untuk memastikan kerja latihan yang besar bergerak selepas gangguan atau penghantaran input yang perlahan, tanpa mengubah ukuran yang dilaporkan dalam sumber.

Butiran sumber: databricks.com ↗

Mengapa ia penting

Latihan AI yang besar boleh membuang masa pemecut yang banyak apabila kerja gagal, menunggu data atau menyambung semula dari tempat yang salah dalam set data. Databricks mempersembahkan ukuran khusus yang menunjukkan bahawa pendekatannya boleh meningkatkan masa pusat pemeriksaan dan pemprosesan imej-latihan, walaupun angka itu dilaporkan syarikat dan bergantung pada perkakasan, beban kerja dan laluan storan yang diuji.

Databricks juga mengenal pasti risiko ketepatan yang mungkin tidak menghasilkan kegagalan yang jelas. Jika kerja menyimpan model, pengoptimum dan langkah latihan tetapi bukan kedudukan pemuat data, mulakan semula boleh mengulangi contoh yang telah dilihat dan melangkau contoh yang belum diproses. Siaran itu mengatakan bahawa mula semula berulang boleh mengubah pengedaran data yang berkesan tanpa menghasilkan ralat. Oleh itu, kebimbangan adalah mengenai proses kerja yang disambung semula, bukan sahaja sama ada kerja dimulakan semula dengan jayanya. Pusat pemeriksaan boleh kelihatan boleh digunakan sementara hubungan antara keadaan latihan yang disimpan dan kedudukan data tidak lengkap.

Pemulihan yang dicadangkan termasuk rakaman sampel atau serpihan offset, bersiri kedudukan set data, atau pemeriksaan di sempadan zaman. Pemulihan ini menangani maklumat kedudukan yang hilang yang diterangkan dalam siaran dengan menjadikan saluran paip data sebahagian daripada keadaan boleh pulih. Pilihan di antara mereka kekal dalam panduan pelaksanaan yang dibentangkan Databricks, dan keperluan asas ialah kerja yang disambung semula mengekalkan hubungan yang dimaksudkan antara kemajuan latihan dan kemajuan set data. Inilah sebabnya mengapa siaran itu menganggap pusat pemeriksaan saluran paip data sebagai sebahagian daripada ketepatan pemulihan dan bukannya sebagai butiran prestasi pilihan.

Ia selanjutnya mengatakan benih shuffle dan pembesaran dan keadaan penjana nombor rawak mesti disimpan supaya susunan data yang disambung semula kekal boleh dihasilkan. Menyelamatkan keadaan tersebut memanjangkan pusat pemeriksaan melangkaui berat model, maklumat pengoptimum dan langkah latihan. Dalam pembingkaian sumber, kebolehulangan bergantung pada mengekalkan kedudukan pemuat data bersama-sama dengan keadaan yang mengawal pesanan dan penambahan. Implikasi praktikal ialah pemulihan harus dinilai untuk kedua-dua kesinambungan dan ketepatan: kerja mesti kembali kepada keadaan yang boleh digunakan dan pemprosesan yang disambung semula mesti mencerminkan keadaan yang dimaksudkan untuk disimpan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Tindakan susulan yang penting ialah sama ada keputusan ini berada di luar konfigurasi Databricks yang dinyatakan dan sama ada API tersedia secara meluas dengan keserasian yang jelas, harga dan panduan operasi. Pengguna juga harus mencari ujian bebas bagi ketepatan pemulihan, ketahanan pusat pemeriksaan, saiz semula kluster dan pemeliharaan pesanan data, bukan hanya penanda aras yang lebih pantas dijalankan.

Databricks mengatakan DataLoadernya merekodkan fetch_seconds dalam MLflow, memberikan operator cara untuk mengenal pasti kelompok yang menyebabkan GPU menunggu. Metrik itu boleh menjadikan sistem lebih mudah untuk didiagnosis, tetapi ia tidak dengan sendirinya mewujudkan jumlah kos yang lebih rendah atau kualiti model yang lebih baik. Ia memberikan pemerhatian tentang masa pengambilan dan kemungkinan menunggu GPU, manakala hasil yang lebih besar bergantung pada baki latihan dan laluan penyimpanan. Oleh itu, metrik berguna sebagai isyarat operasi dalam sistem yang dicadangkan, tetapi ia tidak dibentangkan sebagai ukuran lengkap nilai sistem.

Pengguna memerlukan perakaunan hujung ke hujung yang merangkumi kapasiti NVMe tempatan, pemanasan cache, pemindahan rangkaian, caj storan, kekerapan kerja gagal dan kos pengiraan bagi sebarang data latihan pendua atau diubah. Pertimbangan tersebut menghubungkan perbincangan prestasi dengan isu ketepatan yang diterangkan di atas. Aktiviti pusat pemeriksaan yang lebih pantas atau kelewatan input yang lebih ketara tidak akan menyelesaikan soalan tentang sumber, tingkah laku pemulihan dan pengendalian data dengan sendirinya. Perakaunan yang diminta akibatnya harus meliputi aliran kerja penuh yang diwakili dalam sumber, termasuk kos dan kesan yang berada di luar pemasaan penanda aras individu.

Sumbernya menyediakan tesis operasi yang kukuh dan panduan pelaksanaan yang berguna, sambil membiarkan perbandingan yang lebih luas itu tidak diketahui. Oleh itu, susulan penting adalah untuk memeriksa konfigurasi yang dinyatakan, ketersediaan dan keadaan operasi bersama ukuran yang dilaporkan. Pengguna harus mencari ujian bebas bagi ketepatan pemulihan, ketahanan pusat pemeriksaan, saiz semula kluster dan pemeliharaan pesanan data, bukan hanya penanda aras yang lebih pantas berjalan. Semakan tersebut akan membantu menentukan sama ada API yang diterangkan memberikan gelagat yang sama di luar konfigurasi laporan Databricks, sambil mengekalkan ketidakpastian yang dikenal pasti dalam sumber.

Panduan & kuiz berkaitan

Model AI DiterangkanLatihan AITransformerMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?