Kembali ke Berita
PerusahaanAI Understanding pengarahan

Salesforce menggunakan kontrol SageMaker untuk menyebarkan model Agentforce di seluruh zona ketersediaan

AWS mengatakan Salesforce menggunakan kemampuan penempatan Komponen Inferensi SageMaker baru untuk menyeimbangkan salinan model Agentforce di seluruh Availability Zone sambil menjaga penghematan berbagi GPU.

5 min readRead the primary source
Primary-source image accompanying Salesforce uses SageMaker controls to spread Agentforce models across availability zones
Dokumen sumber utamaSumber direkam
Penerbit
aws.amazon.com
Tautan sumber
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/spreading-the-load-how-salesforce-met-multi-az-ha-with-sagemaker-inference-components/
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

API (Antarmuka Pemrograman Aplikasi)
Cara terstruktur bagi satu sistem perangkat lunak untuk mengirim permintaan dan menerima tanggapan dari sistem lain.
Algoritma
Seperangkat aturan atau langkah yang diikuti komputer untuk memecahkan masalah atau menyelesaikan tugas.
Kesimpulan
Fase runtime saat model terlatih menghasilkan prediksi atau keluaran.
Uji diri Anda sendiriKuis Agen AI

Apa yang terjadi

AWS mengatakan Salesforce menyebarkan model Agentforce dengan Komponen Inferensi SageMaker dan menggunakan parameter SchedulingConfig baru untuk mendistribusikan salinan model di seluruh Availability Zone dan instans. Salesforce melaporkan pengurangan biaya infrastruktur sebesar 8x lipat dari hosting bersama beberapa model pada GPU bersama, namun perilaku penempatan default tidak menjamin ketahanan dua zona yang diperlukan untuk model produksinya.

AWS dan Salesforce menjelaskan masalah penyajian produksi yang melibatkan Agentforce, landasan AI Salesforce untuk agen. Komponen Inferensi SageMaker memungkinkan beberapa model untuk berbagi infrastruktur yang didukung GPU, yang menurut sumber tersebut mengurangi biaya infrastruktur Salesforce hingga delapan kali lipat. Keuntungannya adalah algoritma penempatan default SageMaker mengevaluasi setiap operasi penerapan secara independen. Oleh karena itu, salinan model tertentu dapat didistribusikan secara tidak merata bahkan ketika titik akhir itu sendiri menggunakan beberapa Availability Zone. Konfigurasi multi-zona tingkat titik akhir kiri ini tidak cukup untuk menjamin distribusi tingkat model. Permasalahannya khususnya adalah hubungan antara infrastruktur bersama dan penempatan salinan model individual.

Kontrol baru diekspos melalui parameter SchedulingConfig di API CreateInferenceComponent. Pengaturan AvailabilityZoneBalance mengatur bagaimana salinan didistribusikan secara merata antar zona, sementara PlacementStrategy mengontrol penempatan dalam setiap zona. SPREAD mendistribusikan salinan ke sebanyak mungkin instance untuk meningkatkan isolasi kesalahan; BINPACK menempatkan salinan dalam jumlah yang lebih sedikit untuk meningkatkan pemanfaatan. Sumber tersebut mengatakan Salesforce memilih SPREAD karena persyaratan ketersediaan tinggi produksinya. Pengaturan ini membuat perilaku penempatan yang diinginkan menjadi eksplisit pada waktu penerapan dan menghubungkan pilihan distribusi dengan tujuan operasional yang ingin dicapai.

AWS memberikan contoh dua zona dengan empat instance dan empat salinan model. Dengan SPREAD dan ketidakseimbangan maksimum satu salinan, hasil yang diharapkan adalah dua salinan di setiap zona. Untuk model yang hanya memerlukan dua salinan, ketidakseimbangan maksimum nol menargetkan tepat satu salinan per zona. Pengaturan penjadwalan yang sama dimaksudkan untuk tetap berlaku selama pembaruan penskalaan keluar, penskalaan masuk, dan titik akhir atau komponen inferensi. Sumber tersebut juga merekomendasikan strategi konsolidasi untuk pembersihan jangka panjang setelah operasi penskalaan berulang kali. Secara keseluruhan, rincian ini menjelaskan penempatan sebagai masalah penjadwalan yang berkelanjutan, bukan pengaturan yang diterapkan hanya sekali pada penerapan awal.

Detail sumber: aws.amazon.com ↗

Mengapa itu penting

Penerapan ini mengatasi masalah praktis dalam melayani sistem AI: titik akhir multi-zona masih dapat membiarkan semua salinan dari satu model terkonsentrasi di satu zona atau instans. Konfigurasi ini memberikan kontrol eksplisit kepada tim perusahaan untuk menyeimbangkan penempatan zona ketersediaan dan memilih antara isolasi kesalahan dan pemanfaatan yang lebih tinggi.

Perbedaan antara ketahanan tingkat titik akhir dan tingkat model penting bagi organisasi yang mengoperasikan banyak model AI pada infrastruktur bersama. Titik akhir multi-zona tidak secara otomatis memastikan bahwa setiap model memiliki salinan di setiap zona. Jika salinan model terkonsentrasi, kegagalan instans atau pemadaman zona dapat menghapus model tersebut meskipun beban kerja lain di titik akhir tetap tersedia. Artinya, desain zona ketersediaan yang luas dapat terlihat tangguh namun tetap membiarkan model tertentu tetap terbuka. Oleh karena itu, pertanyaan penempatan harus dievaluasi pada tingkat salinan masing-masing model.

Fitur penempatan menghubungkan persyaratan keandalan dengan pengorbanan sumber daya yang eksplisit. SPREAD dapat mengurangi jumlah salinan model yang hilang dalam suatu kegagalan, sementara BINPACK dapat meningkatkan pemanfaatan akselerator dengan memusatkan beban kerja. Bagi Salesforce, sumber tersebut menyajikan pilihan tersebut sebagai cara untuk mempertahankan manfaat ekonomi dari hosting GPU multi-model sekaligus memenuhi persyaratan internal bahwa setiap model produksi memiliki dukungan dua zona. Konfigurasi ini tidak menghilangkan trade-off; ini memberi tim cara langsung untuk memilih bagaimana salinan mereka menempati instans dan zona yang tersedia.

Hasil yang dilaporkan ini penting bagi operasi AI perusahaan karena mengubah ketersediaan tinggi dari tujuan arsitektur umum menjadi pengaturan penerapan yang dapat diperiksa dan dikelola. Sumber tersebut mengatakan Salesforce mencapai kepatuhan dua zona untuk armada modelnya, mempertahankan penghematan co-hosting, mempertahankan distribusi selama penskalaan, dan menghindari pelanggaran keseimbangan zona selama pembaruan model. Itu adalah klaim dari akun kesuksesan pelanggan AWS, bukan temuan kinerja yang diaudit secara independen. Postingan tersebut tidak menetapkan bagaimana sistem berperilaku selama pemadaman zona sebenarnya atau apakah setiap model dan wilayah memiliki kondisi yang sama. Oleh karena itu, akun implementasi berguna untuk memahami pengendalian dan hasil yang dinyatakan, sekaligus membiarkan validasi independen tetap terbuka.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang harus ditonton selanjutnya

Sumber tersebut tidak memberikan pengukuran waktu aktif independen, hasil pengujian pemadaman, data latensi, atau perhitungan lengkap mengenai pengurangan biaya yang dilaporkan. Tim yang mengadopsi pola ini perlu memverifikasi kapasitas di setiap zona target, memantau penempatan setelah penskalaan, dan menentukan apakah penempatan upaya terbaik memenuhi persyaratan kepatuhan mereka.

Kapasitas masih menjadi batasan utama. AWS merekomendasikan Reservasi Kapasitas Sesuai Permintaan di setiap Availability Zone target untuk wilayah dengan zona terbatas, dan sumber tersebut mengatakan bahwa Salesforce telah menyediakan kapasitas GPU cadangan untuk membantu mendapatkan penempatan yang seimbang. Tanpa kapasitas yang memadai, SageMaker mungkin menyebarkan sebagian salinan pada instans yang tersedia karena mode penegakan yang dijelaskan bersifat permisif. Hal ini membuat fitur dapat digunakan dalam batasan, namun dapat menyebabkan distribusi akhir menjadi kurang seimbang dari yang diharapkan. Konfigurasi yang diinginkan dan penempatan yang sebenarnya dicapai dapat berbeda ketika kapasitas yang dibutuhkan tidak tersedia di setiap zona target.

Operator perlu memantau apakah penempatan yang diinginkan tetap ada seiring waktu. Sumbernya menunjuk ke metrik SageMaker AI Insights dan CloudWatch yang mencakup kemiringan zona ketersediaan, jumlah salinan komponen inferensi berdasarkan zona, penyeimbangan ulang peristiwa dan durasi, serta kesalahan kapasitas yang tidak mencukupi. Hal ini juga memperingatkan bahwa komponen HA-kritis tidak boleh direduksi menjadi satu salinan, karena satu salinan tidak dapat menjangkau dua zona. Pertanyaan praktisnya adalah seberapa cepat tim mendeteksi dan memulihkan ketidakseimbangan sebelum menjadi masalah ketersediaan. Pemantauan harus mencakup jumlah salinan dan distribusinya, terutama karena penskalaan dan pembaruan mengubah penerapannya.

Detail penting masih belum diketahui dari sumbernya. Ini tidak menyatakan wilayah geografis yang terlibat, jumlah titik akhir produksi atau model yang dicakup, biaya kapasitas cadangan, dampak terhadap latensi dan throughput, atau target ketersediaan yang coba dipenuhi oleh Salesforce. Ini juga tidak memberikan pengujian kegagalan komparatif terhadap algoritma default. Oleh karena itu, tim perusahaan harus memperlakukan postingan tersebut sebagai pola implementasi dan hasil yang dilaporkan pelanggan, kemudian memvalidasi kapasitas, perilaku failover, pemantauan, dan total biaya di lingkungan mereka sendiri. Pemeriksaan tersebut diperlukan untuk menentukan apakah keseimbangan yang dilaporkan antara ketahanan dan pemanfaatan berlaku untuk beban kerja dan kondisi pengoperasian mereka sendiri.

Panduan & kuis terkait

Agen AIModel AI DijelaskanMasa Depan AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak pendanaan AI
Apakah ini berguna?