Apa yang terjadi
NVIDIA menerbitkan tutorial teknis yang menjelaskan COMPASS, atau Kebijakan Mobilitas Lintas Perwujudan melalui Residual RL dan Sintesis Keterampilan. Kerangka kerja ini dimulai dengan kebijakan navigasi X-Mobility yang telah dilatih sebelumnya dan melatih spesialis pembelajaran penguatan sisa untuk robot dan lingkungan tertentu. Tutorial ini menggunakan Spot quadruped Boston Dynamics sebagai robot referensinya dan mencakup adegan simulasi bawaan, dihasilkan, dan direkonstruksi.
Blog teknis NVIDIA pada 26 Agustus memperkenalkan COMPASS sebagai kerangka kerja terpadu untuk mobilitas robot lintas perwujudan. Titik awalnya adalah kebijakan Mobilitas X NVIDIA yang telah dilatih sebelumnya, yang menyediakan perilaku navigasi yang telah dipelajari sebelumnya. Daripada mempelajari kembali navigasi dari awal untuk setiap kombinasi adegan robot, COMPASS melatih spesialis sisa menggunakan pembelajaran penguatan. Spesialis tersebut dimaksudkan untuk memperbaiki tindakan kebijakan dasar untuk robot dan lingkungan yang dipilih. NVIDIA mengatakan bahwa beberapa spesialis nantinya dapat disaring menjadi kebijakan lintas perwujudan bersama, meskipun postingan tersebut tidak melaporkan hasil dari proses penyulingan tersebut.
Tutorial ini menjadikan agen AI sebagai bagian dari alur kerja pengembangan, bukan sebagai pengontrol runtime robot. Agen pengkodean diinstruksikan untuk memvalidasi dependensi, menyiapkan aset simulasi, menjalankan pengujian asap, meluncurkan pelatihan, mendiagnosis kegagalan, membandingkan pos pemeriksaan, dan menyimpan bukti. Gerbang persetujuan manusia ditempatkan setelah validasi lingkungan, persiapan lokasi, uji asap satu lingkungan, dan evaluasi pos pemeriksaan. NVIDIA secara eksplisit menyatakan bahwa agen pengkodean mengoordinasikan pengembangan dan validasi, sedangkan kebijakan terlatih dan pengontrol robot menjalankan navigasi saat runtime tanpa agen pengkodean.
Jalur referensi menggunakan Spot di NVIDIA Isaac Sim dan Isaac Lab. Pengembang dapat memulai dengan gudang gabungan_multi_rak terdaftar, menggunakan pemandangan dalam ruangan yang dihasilkan dari kumpulan data SAGE-10K, atau menyiapkan lingkungan yang ditangkap melalui NVIDIA Omniverse NuRec. Postingan tersebut menjelaskan SAGE-10K sebagai kumpulan data dari 10.000 pemandangan dalam ruangan yang dihasilkan di 50 tipe ruangan, bukan sebagai kebijakan atau simulator. Untuk adegan yang dihasilkan, alur kerja memerlukan pemeriksaan geometri, material, skala, jerat tabrakan, registrasi, peta hunian, dan pratinjau visual sebelum pelatihan penuh. NuRec disajikan sebagai jalur opsional untuk lingkungan penerapan yang direkonstruksi.
NVIDIA mencantumkan pengaturan perangkat lunak dan perangkat keras referensi yang mencakup Ubuntu 22.04 atau 24.04, setidaknya 32 GB RAM, GPU berkemampuan RTX dengan setidaknya 16 GB VRAM, driver Linux 580.95.05, Docker Engine 24 atau lebih baru, NVIDIA Container Toolkit, Isaac Lab 3.0, dan Isaac Sim 6.0. Postingan tersebut mengatakan pengguna memerlukan akses ke repositori COMPASS dan X-Mobility yang terjaga keamanannya dan harus menyediakan token baca Hugging Face di luar obrolan agen. Panduan ini juga menjelaskan odometri cuVSLAM opsional untuk robot yang tidak memiliki odometri dan transformasi tervalidasi yang kompatibel, sambil mencatat bahwa cuVSLAM terpisah dari pelatihan kebijakan.
Detail sumber: developer.nvidia.com ↗
Mengapa itu penting
Pendekatan ini menargetkan hambatan utama dalam AI fisik: mengadaptasi perilaku navigasi ke berbagai badan robot dan lingkungan tanpa melatih ulang seluruh kebijakan dari awal. Alur kerja juga memperlakukan penyiapan simulasi, validasi aset, pelatihan, evaluasi, dan penerapan sebagai proses rekayasa yang terkendali, dengan gerbang persetujuan manusia sebelum pelatihan penuh dan promosi pos pemeriksaan.
Manfaat yang diklaim adalah berkurangnya duplikasi dalam pengembangan pembelajaran robot. Adaptasi kebijakan navigasi biasanya melibatkan lebih dari sekadar mengubah model pos pemeriksaan: robot baru mungkin memerlukan pemetaan tindakan baru, masukan kamera, transformasi, aset simulasi, penanganan tabrakan, dan prosedur evaluasi. COMPASS mengemas tugas-tugas tersebut ke dalam alur kerja berulang yang berpusat pada kebijakan dasar yang dapat digunakan kembali dan tahap pembelajaran sisa yang lebih kecil. Jika pendekatan ini berhasil pada berbagai perwujudan, hal ini dapat menurunkan biaya teknis dalam memperluas sistem navigasi ke platform robot baru.
Penekanan pada gerbang persetujuan sangatlah penting karena kegagalan navigasi fisik dapat timbul dari sistem di sekitarnya dan bukan dari kebijakan yang dipelajari saja. Sebuah adegan mungkin memiliki skala yang salah atau hubungan yang bertabrakan; robot mungkin muncul di lokasi yang tidak valid; observasi kamera mungkin tidak tersedia; atau antarmuka tindakan dapat menyebabkan terpotong atau jatuh. Uji asap satu lingkungan yang ditentukan oleh NVIDIA dimaksudkan untuk mengungkap masalah tersebut sebelum pengembang berkomitmen untuk melakukan pelatihan jangka panjang dan intensif sumber daya.
Proses ini juga memerlukan kondisi evaluasi yang sesuai dan penyimpanan perintah, konfigurasi, log, pos pemeriksaan, video, dan manifes artefak. Kerangka kerja ini juga dapat membuat eksperimen lebih mudah direproduksi bagi tim yang bekerja di seluruh lingkungan simulasi dan penerapan. Postingan tersebut memerlukan revisi repositori yang disematkan, adegan terdaftar, peta hunian, perintah pelatihan eksplisit, interval pos pemeriksaan, dan kriteria penghentian yang terdokumentasi. Evaluasi yang diusulkan melaporkan tingkat pencapaian tujuan, tingkat penurunan, dan waktu perjalanan, sambil meminta pengembang untuk memberi label pada langkah-langkah tambahan seperti kemajuan tujuan atau perilaku kontak sebagai analisis turunan atau instrumentasi khusus. Praktik-praktik tersebut membantu memisahkan metrik standar dari bukti yang dipilih secara lokal.
Nilai publik tetap bersyarat karena sumbernya adalah tutorial teknis yang dibuat oleh vendor, bukan evaluasi independen. NVIDIA tidak memberikan tingkat keberhasilan agregat, perbandingan terhadap pelatihan ulang penuh, biaya pelatihan, tingkat kegagalan di seluruh perwujudan, atau bukti bahwa kebijakan yang dilatih dalam simulasi akan beroperasi dengan aman pada robot fisik. Postingan tersebut juga menyatakan bahwa kualitas adegan, durasi pelatihan, kinerja pos pemeriksaan, desain hadiah, dan persyaratan komputasi bervariasi, dan COMPASS tidak menentukan ambang batas keberhasilan universal. Oleh karena itu, kesimpulan terkuat yang didukung adalah bahwa NVIDIA telah mendokumentasikan kerangka kerja dan alur kerja yang konkret, bukan bahwa NVIDIA telah menetapkan navigasi robot untuk tujuan umum.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang harus ditonton selanjutnya
Signifikansi praktisnya akan bergantung pada bukti di luar tutorial, termasuk seberapa baik spesialis sisa melakukan transfer ke seluruh robot dan adegan, apakah kebijakan yang disaring mempertahankan kinerja keselamatan, dan bagaimana kinerja metode ini pada perangkat keras fisik. NVIDIA tidak memberikan ambang batas keberhasilan universal, jaminan waktu pelatihan, atau hasil perbandingan yang luas dalam postingan ini.
Bukti penting berikutnya adalah eksperimen yang disesuaikan dengan beberapa perwujudan robot dan tipe pemandangan. Pengujian tersebut harus membandingkan kebijakan dasar X-Mobility yang telah dilatih sebelumnya, spesialis sisa, dan kebijakan bersama yang disaring dalam tujuan, status awal, jangka waktu peluncuran, benih, dan kondisi penghentian aktif yang sama. Sumber merekomendasikan protokol evaluasi ini tetapi tidak melaporkan hasil pengukuran. Tanpa perbandingan tersebut, tidak jelas seberapa besar sisa pembelajaran yang dapat meningkatkan navigasi atau seberapa sering kebijakan dasar sudah berjalan dengan baik.
Validasi fisik adalah pertanyaan terbuka lainnya. NVIDIA menjelaskan integrasi ROS 2 di mana kebijakan yang diekspor menggunakan gambar kamera depan, target atau rute navigasi, dan kecepatan robot yang diperoleh dari odometri, lalu menerbitkan perintah kecepatan linier dan sudut di /cmd_vel. Postingan tersebut menginstruksikan pengembang untuk memvalidasi bingkai koordinat, kecepatan pembaruan, normalisasi, batas perintah, perilaku penghentian, kalibrasi, stempel waktu, dan perilaku pengontrol. Ini tidak memberikan hasil pengujian fisik robot, ketersediaan perangkat keras, atau bukti tentang kinerja dalam kondisi pencahayaan, medan, oklusi, kegagalan sensor, atau hambatan yang tidak terduga yang berubah-ubah.
Peran agen dalam pengembangan robotika juga patut mendapat perhatian. Alur kerja memberikan wewenang kepada agen pengkodean untuk menjalankan pemeriksaan, menyiapkan aset, memulai pelatihan, mendiagnosis kegagalan, dan membandingkan titik pemeriksaan, namun tetap mempertahankan persetujuan manusia untuk transisi penting. Implementasi di masa depan harus membuat gerbang tersebut dapat diaudit dan memastikan bahwa agen tidak dapat secara diam-diam mengubah ketergantungan, penghargaan, aset adegan, atau pengaturan pelatihan. Tutorial NVIDIA mengatakan bahwa pengembang harus memerlukan persetujuan sebelum melakukan perubahan tersebut dan menggunakan alur kerja diagnostik hanya-baca ketika proses gagal.
Terakhir, klaim penerapan harus diperlakukan secara terpisah dari klaim pelatihan. Postingan tersebut mengatakan ekspor ke ONNX, JIT, atau TensorRT, integrasi ROS 2, dan penerapan perangkat keras fisik memerlukan validasi terpisah. Hal ini juga membedakan odometri cuVSLAM dari kebijakan navigasi dan menyatakan bahwa peta cuVSLAM bukanlah masukan kebijakan. Yang masih belum diketahui adalah apakah alur kerja yang didokumentasikan mengarah pada operasi yang kuat di luar pengaturan referensi Spot, berapa banyak rekayasa manusia yang diperlukan untuk setiap perwujudan baru, dan apakah penyulingan kebijakan mempertahankan metrik keselamatan yang digunakan untuk menyetujui masing-masing spesialis.