Terug naar Nieuws
OndernemingAI Understanding-briefing

Salesforce gebruikt SageMaker-besturingselementen om Agentforce-modellen over beschikbaarheidszones te verspreiden

AWS zegt dat Salesforce een nieuwe plaatsingsmogelijkheid van SageMaker Inference Components heeft gebruikt om Agentforce-modelkopieën in evenwicht te brengen over de beschikbaarheidszones, terwijl de besparingen op het delen van GPU's behouden blijven.

5 min readRead the primary source
Primary-source image accompanying Salesforce uses SageMaker controls to spread Agentforce models across availability zones
Primair brondocumentBron opgenomen
Uitgever
aws.amazon.com
Bronlink
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/spreading-the-load-how-salesforce-met-multi-az-ha-with-sagemaker-inference-components/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
algoritme
Een gedefinieerde reeks regels of stappen die een computer volgt om een probleem op te lossen of een taak te voltooien.
Gevolgtrekking
De runtimefase waarin een getraind model voorspellingen of uitvoer genereert.
Test jezelfAI-agentenquiz

Wat is er gebeurd

AWS zegt dat Salesforce Agentforce-modellen heeft geïmplementeerd met SageMaker Components en de nieuwe SchedulingConfig-parameter heeft gebruikt om modelkopieën te distribueren over beschikbaarheidszones en instanties. Salesforce rapporteerde een achtvoudige verlaging van de infrastructuurkosten door het co-hosten van meerdere modellen op gedeelde GPU's, maar het standaardplaatsingsgedrag garandeerde niet de veerkracht in twee zones die vereist is voor de productiemodellen.

AWS en Salesforce beschrijven een productieprobleem waarbij Agentforce betrokken is, de AI-basis van Salesforce voor agenten. Met SageMaker Components kunnen meerdere modellen een door GPU ondersteunde infrastructuur delen, waardoor de infrastructuurkosten van Salesforce volgens de bron acht keer lager zijn geworden. De wisselwerking was dat het standaard plaatsingsalgoritme van SageMaker elke implementatieoperatie afzonderlijk evalueerde. Kopieën van een bepaald model kunnen daarom ongelijkmatig worden verdeeld, zelfs als het eindpunt zelf meerdere beschikbaarheidszones gebruikt. Hierdoor was de configuratie met meerdere zones op eindpuntniveau onvoldoende om distributie op modelniveau te garanderen. Het ging met name om de relatie tussen gedeelde infrastructuur en de plaatsing van individuele modelkopieën.

Het nieuwe besturingselement wordt weergegeven via de parameter SchedulingConfig in de CreateInferenceComponent API. De AvailabilityZoneBalance-instelling bepaalt hoe gelijkmatig kopieën tussen zones worden verdeeld, terwijl PlacementStrategy de plaatsing binnen elke zone regelt. SPREAD distribueert kopieën over zoveel mogelijk exemplaren om de foutisolatie te verbeteren; BINPACK plaatst kopieën op minder exemplaren om het gebruik te verbeteren. De bron zegt dat Salesforce SPREAD heeft gekozen vanwege de hoge beschikbaarheidsvereisten voor de productie. Deze instellingen maken het beoogde plaatsingsgedrag expliciet tijdens de inzet en verbinden de distributiekeuze met het nagestreefde operationele doel.

AWS geeft een voorbeeld met twee zones met vier exemplaren en vier kopieën van een model. Bij SPREAD en een maximale onbalans van één kopie is het beoogde resultaat twee kopieën in elke zone. Voor een model dat slechts twee exemplaren nodig heeft, is een maximale onbalans van nul precies één exemplaar per zone. Het is de bedoeling dat dezelfde planningsinstellingen van kracht blijven tijdens het uitschalen, inschalen en updates van eindpunten of inferentiecomponenten. De bron beveelt ook een consolidatiestrategie aan voor opruiming op langere termijn na herhaalde opschalingsoperaties. Samen beschrijven deze details de plaatsing als een voortdurend planningsprobleem en niet als een instelling die slechts één keer wordt toegepast bij de eerste implementatie.

Brongegevens: aws.amazon.com ↗

Waarom het ertoe doet

De implementatie pakt een praktisch probleem aan bij het bedienen van AI-systemen: een eindpunt met meerdere zones kan nog steeds alle kopieën van één model geconcentreerd laten in één zone of exemplaar. De configuratie geeft bedrijfsteams expliciete controles voor het balanceren van de plaatsing van beschikbaarheidszones en het kiezen tussen foutisolatie en hoger gebruik.

Het onderscheid tussen veerkracht op eindpuntniveau en op modelniveau is belangrijk voor organisaties die veel AI-modellen op gedeelde infrastructuur gebruiken. Een eindpunt met meerdere zones zorgt er niet automatisch voor dat elk model in elke zone een kopie heeft. Als de kopieën van een model geconcentreerd zijn, kan een instancefout of zone-uitval dat model verwijderen, ook al blijven andere workloads op het eindpunt beschikbaar. Dit betekent dat een ontwerp met een brede beschikbaarheidszone veerkrachtig kan lijken, terwijl een bepaald model zichtbaar blijft. De plaatsingsvraag moet daarom worden beoordeeld op het niveau van de kopieën van elk model.

De plaatsingsfunctie koppelt betrouwbaarheidsvereisten aan een expliciete afweging van middelen. SPREAD kan het aantal modelkopieën dat verloren gaat bij een instancefout verminderen, terwijl BINPACK het gebruik van de accelerator kan verbeteren door de werklast te concentreren. Voor Salesforce presenteert de bron de keuze als een manier om het economische voordeel van GPU-hosting met meerdere modellen te behouden en tegelijkertijd te voldoen aan de interne vereiste dat elk productiemodel ondersteuning voor twee zones heeft. De configuratie neemt de afweging niet weg; het geeft teams een directe manier om te kiezen hoe hun kopieën de beschikbare exemplaren en zones bezetten.

Het gerapporteerde resultaat is van grote betekenis voor AI-operaties in ondernemingen, omdat het hoge beschikbaarheid verplaatst van een algemeen architectuurdoel naar implementatie-instellingen die kunnen worden geïnspecteerd en beheerd. De bron zegt dat Salesforce compliance in twee zones voor zijn modelvloot heeft bereikt, de besparingen op co-hosting heeft behouden, de distributie tijdens het schalen heeft gehandhaafd en heeft voorkomen dat de zonebalans tijdens modelupdates wordt verbroken. Dit zijn beweringen uit het AWS-klantsuccesaccount, en geen onafhankelijk gecontroleerde prestatiebevindingen. De post stelt niet vast hoe het systeem zich gedroeg tijdens een echte zonestoring en of elk model en elke regio identieke omstandigheden had. Het implementatieverslag is daarom nuttig voor het begrijpen van de controle en de aangegeven uitkomst ervan, terwijl onafhankelijke validatie open blijft.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Wat je nu moet bekijken

De bron biedt geen onafhankelijke uptimemetingen, uitvaltestresultaten, latentiegegevens of een volledige boekhouding van de gerapporteerde kostenbesparing. Teams die dit patroon toepassen, moeten de capaciteit in elke doelzone verifiëren, de plaatsing na het schalen monitoren en bepalen of de beste plaatsing aan hun eigen compliance-eisen voldoet.

Capaciteit blijft een centrale beperking. AWS raadt capaciteitsreserveringen op aanvraag aan in elke doelbeschikbaarheidszone voor regio's met beperkte zones, en de bron zegt dat Salesforce vooraf gereserveerde GPU-capaciteit heeft ingericht om een ​​evenwichtige plaatsing te helpen verkrijgen. Zonder voldoende capaciteit kan SageMaker gedeeltelijk kopieën implementeren op beschikbare exemplaren, omdat de beschreven handhavingsmodus tolerant is. Dat maakt de functie onder beperkingen bruikbaar, maar kan de uiteindelijke verdeling minder evenwichtig maken dan bedoeld. De gewenste configuratie en de plaatsing die daadwerkelijk wordt gerealiseerd kan daardoor verschillen wanneer de benodigde capaciteit niet in iedere doelzone aanwezig is.

Exploitanten zullen moeten monitoren of de gewenste plaatsing in de loop van de tijd blijft bestaan. De bron verwijst naar SageMaker AI Insights en CloudWatch-statistieken met betrekking tot scheefheid van de beschikbaarheidszone, het aantal kopieën van gevolgtrekkingscomponenten per zone, het opnieuw in evenwicht brengen van gebeurtenissen en duur, en fouten met onvoldoende capaciteit. Het waarschuwt ook dat een HA-kritische component niet mag worden gereduceerd tot één kopie, omdat één kopie niet twee zones kan bestrijken. De praktische vraag is hoe snel teams een onevenwichtigheid detecteren en verhelpen voordat het een beschikbaarheidsprobleem wordt. Monitoring moet zowel het aantal exemplaren als de distributie ervan omvatten, vooral omdat schaalvergroting en updates de implementatie veranderen.

Belangrijke details blijven onbekend bij de bron. Het vermeldt niet de betrokken geografische regio's, het aantal gedekte productie-eindpunten of -modellen, de kosten van gereserveerde capaciteit, het effect op latentie en doorvoer, of het beschikbaarheidsdoel dat Salesforce probeerde te bereiken. Het biedt ook geen vergelijkende fouttests met het standaardalgoritme. Enterprise-teams moeten de post daarom beschouwen als een implementatiepatroon en door de klant gerapporteerde resultaten, en vervolgens de capaciteit, het failover-gedrag, de monitoring en de totale kosten in hun eigen omgevingen valideren. Deze controles zijn nodig om te bepalen of het gerapporteerde evenwicht tussen veerkracht en benutting van toepassing is op hun eigen werklast en bedrijfsomstandigheden.

Gerelateerde gidsen en quizzen

AI-agentenAI-modellen uitgelegdToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-financieringstracker
Vond je dit nuttig?