Tillbaka till Nyheter
InnovationAI Understanding genomgång

NVIDIA beskriver COMPASS-arbetsflödet för anpassning av robotnavigering i olika utföranden

NVIDIA beskriver COMPASS, ett ramverk som anpassar en förutbildad robotnavigeringspolicy till nya robotar och miljöer genom återstående förstärkningsinlärning, agentassisterad utveckling och mänskliga godkännandeportar.

6 min readRead the primary source
Source-provided image accompanying NVIDIA details COMPASS workflow for adapting robot navigation across embodiments
Primärt källdokumentKälla inspelad
Förläggare
developer.nvidia.com
Källlänk
developer.nvidia.comhttps://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Förstärkningsinlärning
Träning genom belöningssignaler där en agent lär sig handlingar som maximerar långsiktig avkastning.
Normalisering
Omvandla värden till en konsekvent skala för att förbättra optimeringsstabiliteten.
Destillation
Komprimera kunskap från en stor lärarmodell till en mindre elevmodell.
Testa dig självAI Agents Quiz

Vad hände

NVIDIA publicerade en teknisk handledning som beskriver COMPASS, eller Cross-Embodiment Mobility Policy via Residual RL och Skill Synthesis. Ramverket börjar med en förutbildad X-Mobility-navigeringspolicy och utbildar en återstående förstärkningsinlärningsspecialist för en viss robot och miljö. Handledningen använder Boston Dynamics Spot quadruped som referensrobot och täcker inbyggda, genererade och rekonstruerade simuleringsscener.

NVIDIA:s tekniska blogg den 26 augusti introducerar COMPASS som ett enhetligt ramverk för robotmobilitet i olika kroppar. Dess utgångspunkt är den förtränade NVIDIA X-Mobility-policyn, som tillhandahåller tidigare inlärt navigeringsbeteende. Istället för att lära om navigering från början för varje kombination av robot-scen, tränar COMPASS en kvarvarande specialist med hjälp av förstärkningsinlärning. Den specialisten är avsedd att korrigera grundpolicyns åtgärd för en utvald robot och miljö. NVIDIA säger att flera specialister senare kan destilleras till en delad tvärförkroppsligande policy, även om inlägget inte rapporterar resultat från en sådan destillationsprocess.

Handledningen gör AI-agenter till en del av utvecklingsarbetsflödet snarare än robotens körtidskontroller. En kodningsagent instrueras att validera beroenden, förbereda simuleringstillgångar, köra röktester, lansera utbildning, diagnostisera fel, jämföra kontrollpunkter och bevara bevis. Mänskliga godkännandegrindar placeras efter miljövalidering, scenförberedelse, röktestet i en miljö och kontrollpunktsutvärdering. NVIDIA anger uttryckligen att kodningsagenten koordinerar utveckling och validering, medan den tränade policyn och robotstyrenheten kör navigering vid körning utan kodningsagenten.

Referenssökvägen använder Spot i NVIDIA Isaac Sim och Isaac Lab. Utvecklare kan börja med ett registrerat combined_multi_rack-lager, använda en genererad inomhusscen från SAGE-10K-datauppsättningen eller förbereda en fångad miljö genom NVIDIA Omniverse NuRec. Inlägget beskriver SAGE-10K som en datauppsättning av 10 000 genererade inomhusscener över 50 rumstyper, inte som en policy eller simulator. För genererade scener kräver arbetsflödet kontroll av geometri, material, skala, kollisionsmaskor, registrering, beläggningskartor och en visuell förhandsvisning innan full träning. NuRec presenteras som en valfri väg för rekonstruerade distributionsmiljöer.

NVIDIA listar en referensmjukvara och hårdvaruinställning som inkluderar Ubuntu 22.04 eller 24.04, minst 32 GB RAM, en RTX-kompatibel GPU med minst 16 GB VRAM, Linux-drivrutin 580.95.05, Docker Engine 24 eller senare, ZXQAIU1QX0-verktyget, ZXQAIU1QX0-verktyget och Isaac-verktyget, Isaac och Isaac Tool. 6,0. Inlägget säger att användare behöver tillgång till gated COMPASS- och X-Mobility-förråd och måste tillhandahålla en Hugging Face-läs-token utanför agentchatten. Den beskriver också valfri cuVSLAM-odometri för robotar som saknar kompatibel validerad distansmätning och transformationer, samtidigt som det noteras att cuVSLAM är separat från policyutbildning.

Källinformation: developer.nvidia.com ↗

Varför det spelar roll

Tillvägagångssättet riktar sig mot en central flaskhals inom fysisk AI: att anpassa navigeringsbeteendet till olika robotkroppar och miljöer utan att omskola en hel policy från grunden. Arbetsflödet behandlar också simuleringsinställning, tillgångsvalidering, utbildning, utvärdering och driftsättning som en kontrollerad ingenjörsprocess, med mänskliga godkännandeportar innan fullständig utbildning och befordran av checkpoints.

Den påstådda fördelen är minskad dubbelarbete i utvecklingen av robotinlärning. Anpassning av navigeringspolicy innebär normalt mer än att ändra en modellkontrollpunkt: en ny robot kan kräva nya åtgärdskartor, kameraingångar, transformationer, simuleringstillgångar, kollisionshantering och utvärderingsprocedurer. COMPASS paketerar dessa uppgifter i ett repeterbart arbetsflöde centrerat på en återanvändbar baspolicy och ett mindre resterande inlärningsstadium. Om tillvägagångssättet fungerar över ett meningsfullt urval av utföranden kan det sänka konstruktionskostnaderna för att utöka navigationssystemen till nya robotplattformar.

Tonvikten på godkännandeportar är betydande eftersom fysiska navigeringsfel kan uppstå från det omgivande systemet snarare än från den inlärda policyn ensam. En scen kan ha felaktig skala eller kollisionsnät; en robot kan leka på en ogiltig plats; kameraobservationer kan vara otillgängliga; eller ett åtgärdsgränssnitt kan orsaka klippning eller fall. NVIDIA:s föreskrivna röktest för en miljö är avsett att avslöja dessa problem innan utvecklare förbinder sig till långvarig, resurskrävande utbildning.

Processen kräver också matchade utvärderingsvillkor och bibehållande av kommandon, konfigurationer, loggar, kontrollpunkter, videor och artefaktmanifest. Ramverket skulle också kunna göra experiment mer reproducerbart för team som arbetar över simulerings- och distributionsmiljöer. Inlägget kräver revideringar av fasta förvar, registrerade scener, beläggningskartor, explicita träningskommandon, kontrollpunktsintervall och dokumenterade stoppkriterier. Dess föreslagna utvärdering rapporterar uppnådda mål, fall-down-frekvens och restid, samtidigt som utvecklarna uppmanas att märka ytterligare åtgärder som målframsteg eller kontaktbeteende som härledd analys eller anpassad instrumentering. Dessa metoder hjälper till att skilja standardmått från lokalt valda bevis.

Det offentliga värdet förblir villkorat eftersom källan är en leverantörsförfattad teknisk handledning, inte en oberoende utvärdering. NVIDIA tillhandahåller inte aggregerade framgångsfrekvenser, jämförelser mot fullständig omskolning, utbildningskostnader, misslyckandefrekvenser i olika utföranden eller bevis för att en policy som tränas i simulering säkert fungerar på fysiska robotar. Inlägget säger också att scenkvalitet, träningslängd, kontrollpunktsprestanda, belöningsdesign och beräkningskrav varierar, och att COMPASS inte definierar en universell framgångströskel. Den starkast stödda slutsatsen är därför att NVIDIA har dokumenterat ett konkret ramverk och arbetsflöde, inte att den har etablerat robotnavigering för allmänt bruk.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Vad du ska titta på härnäst

Den praktiska betydelsen kommer att bero på bevis bortom handledningen, inklusive hur väl kvarvarande specialister överför över robotar och scener, om destillerade policyer bibehåller säkerhetsprestanda och hur metoden fungerar på fysisk hårdvara. NVIDIA tillhandahåller inte en universell framgångströskel, utbildningstidsgaranti eller breda jämförande resultat i det här inlägget.

Nästa viktiga bevis skulle vara matchade experiment över flera robotutföranden och scentyper. Dessa tester bör jämföra den förutbildade X-Mobility-baspolicyn, kvarvarande specialister och alla destillerade policyerna under samma mål, initiala tillstånd, utrullningslängder, frön och aktiva avslutningsvillkor. Källan rekommenderar detta utvärderingsprotokoll men rapporterar inte de resulterande mätningarna. Utan dessa jämförelser är det oklart hur mycket kvarvarande inlärning förbättrar navigeringen eller hur ofta baspolicyn redan fungerar adekvat.

Fysisk validering är en annan öppen fråga. NVIDIA beskriver ROS 2-integrering där den exporterade policyn konsumerar bilder från frontkameran, ett navigeringsmål eller en rutt och robothastighet härledd från odometri, och sedan publicerar linjära och vinkelhastighetskommandon på /cmd_vel. Inlägget instruerar utvecklare att validera koordinatramar, uppdateringshastigheter, normalisering, kommandogränser, stoppbeteende, kalibrering, tidsstämplar och kontrollerbeteende. Den tillhandahåller inte fysiska robottestresultat, maskinvarutillgänglighet eller bevis om prestanda under ändrad belysning, terräng, ocklusion, sensorfel eller oväntade hinder.

Agenternas roll i robotutvecklingen förtjänar också att granskas. Arbetsflödet ger en kodningsagent behörighet att köra kontroller, förbereda tillgångar, starta utbildning, diagnostisera fel och jämföra kontrollpunkter, men behåller mänskligt godkännande för nyckelövergångar. Framtida implementeringar bör göra dessa grindar kontrollerbara och säkerställa att agenter inte tyst kan ändra beroenden, belöningar, scentillgångar eller träningsinställningar. NVIDIA:s handledning säger att utvecklare bör kräva godkännande innan sådana ändringar och använda ett skrivskyddat diagnostiskt arbetsflöde när körningar misslyckas.

Slutligen bör utbyggnadsanspråk behandlas separat från utbildningsanspråk. Inlägget säger att export till ONNX, JIT eller TensorRT, ROS 2-integration och fysisk hårdvaruinstallation kräver separat validering. Den skiljer också cuVSLAM:s vägmätning från navigationspolicyn och säger att cuVSLAMs karta inte är en policyinmatning. Det som förblir okänt är huruvida det dokumenterade arbetsflödet leder till robust drift utanför referenspunktsinställningen, hur mycket mänsklig ingenjörskonst som varje ny utföringsform kräver och om policydestillation bevarar säkerhetsmåtten som används för att godkänna enskilda specialister.

Relaterade guider och frågesporter

AI-agenterAI-modeller förklarasAI utbildningAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?