Kembali ke Berita
PerusahaanAI Understanding taklimat

Deepgram menambah pengebilan dan keterlihatan GPU pada penggunaan SageMaker AInya

Deepgram berkata metrik CloudWatch, Prometheus dan OpenTelemetry baharu memberikan pelanggan lebih keterlihatan kepada penggunaan AI pertuturan, pengebilan Pasaran AWS, kapasiti enjin dan penggunaan per-GPU apabila menjalankan modelnya pada Amazon SageMaker AI.

7 min readRead the primary source
Primary-source image accompanying Deepgram adds billing and GPU visibility to its SageMaker AI deployments
Dokumen sumber utamaSumber direkodkan
Penerbit
aws.amazon.com
Pautan sumber
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/deepgram-deepens-amazon-sagemaker-ai-observability-with-enhanced-metrics/
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Deepgram mengumumkan dua penambahan kebolehmerhatian untuk model pertuturan ke teks dan teks ke pertuturannya yang digunakan sebagai titik akhir masa nyata Amazon SageMaker AI. Metrik Dipertingkat menerbitkan data penggunaan dan pengebilan ke akaun CloudWatch pelanggan, manakala integrasi Prometheus dan OpenTelemetry mendedahkan ukuran enjin, hos dan per-GPU melalui pemerhatian terperinci SageMaker AI.

Pengumuman Deepgram melibatkan model pertuturan ke teks dan teks ke pertuturan yang dijalankan sebagai pakej model Pasaran AWS pada titik akhir masa nyata Amazon SageMaker AI dalam akaun AWS pelanggan. Syarikat itu berkata audio dan transkrip kekal di dalam akaun itu manakala SageMaker menyediakan kawalan penempatan, penskalaan dan pemantauan. Catatan itu membingkaikan keupayaan baharu sebagai menutup jurang keterlihatan: pemantauan titik akhir standard boleh menunjukkan ketersediaan dan pengendalian permintaan, tetapi mungkin tidak mendedahkan ciri pertuturan yang digunakan, unit yang mendorong caj pasaran atau cara inferens menggunakan setiap GPU.

Penambahan pertama, dipanggil Deepgram Enhanced Metrics, menghantar maklumat pengebilan dan penggunaan kepada Amazon CloudWatch melalui rekod Format Metrik Terbenam CloudWatch yang ditulis pada output standard bekas. SageMaker memajukan output itu ke kumpulan log CloudWatch titik akhir, di mana CloudWatch mengekstrak rekod ke dalam metrik biasa. Menurut sumber, proses itu tidak memerlukan ejen berasingan, kereta sampingan atau kebenaran IAM tambahan dan berfungsi dengan pengasingan rangkaian AWS Marketplace kerana ia menggunakan laluan pengelogan SageMaker-to-CloudWatch sedia ada. Ruang nama pengebilan ialah Deepgram/SageMakerInference. Metrik Consumed Units mewakili unit inferens yang boleh dibilkan untuk permintaan penstriman, prarakam dan teks ke pertuturan yang lengkap, manakala AudioDurationSeconds dan CharCount menerangkan audio yang diproses dan aksara yang disintesis. Deepgram mengatakan nilai ini adalah nilai yang sama yang digunakan untuk pengebilan bermeter Pasaran AWS.

Strim penggunaan kedua, Deepgram/SelfHosted, dipancarkan oleh pelayan API Deepgram dan menunjukkan cara trafik menggunakan perkhidmatan dan bukannya menyelaraskan bil secara langsung. Sumber itu menyenaraikan metrik untuk penstriman dan volum prarakam, peringkat model seperti nova-3 dan fluks, dan ciri termasuk diarisasi, pemformatan pintar, redaksi dan gesaan istilah kunci. Metrik ini diagregatkan merentas titik akhir Deepgram dalam akaun dan Wilayah AWS. Siaran itu mengatakan bahawa mereka menggunakan dimensi kardinaliti rendah tanpa transkrip, input teks ke pertuturan atau pengecam setiap permintaan, tetapi tidak menyertakan nama titik akhir atau ID tika. Strim penggunaan boleh dilumpuhkan dengan penggantian pembolehubah persekitaran, manakala strim pengebilan tidak boleh dilumpuhkan kerana Deepgram menerangkannya sebagai sebahagian daripada saluran paip pemeteran.

Untuk operasi peringkat rendah, Deepgram mengatakan bekasnya mendedahkan metrik Prometheus yang boleh dikumpul oleh pemerhatian terperinci SageMaker AI melalui Pemungut OpenTelemetry yang diuruskan oleh AWS yang dijalankan pada setiap contoh titik akhir. Data yang terhasil termasuk metrik pengeksport DCGM untuk GPU individu, metrik pengeksport nod untuk CPU dan memori hos, dan metrik enjin Deepgram seperti permintaan penstriman aktif dan anggaran kapasiti strim. Sumber mengatakan setiap siri membawa label sumber SageMaker, termasuk titik akhir, varian dan pengecam contoh. Pelanggan boleh menanyakan titik akhir, contoh atau GPU tertentu menggunakan PromQL melalui CloudWatch, Grafana atau alat lain yang serasi. Kebolehmerhatian terperinci didayakan secara lalai untuk titik akhir yang baru dibuat, dengan kekerapan penerbitan 60 saat, manakala titik akhir yang lebih lama memerlukan kemas kini konfigurasi titik akhir menggunakan penggunaan biru/hijau.

Butiran sumber: aws.amazon.com ↗

Mengapa ia penting

Perubahan menyasarkan masalah praktikal dalam AI yang dihoskan sendiri: pelanggan boleh memantau sama ada titik akhir beroperasi, tetapi mungkin kurang keterlihatan pada ciri model yang mendorong penggunaan, unit di sebalik pengebilan pasaran dan kapasiti pemecut individu. Sumber menerangkan cara untuk menyambungkan soalan operasi dan kewangan tersebut tanpa membuka akses rangkaian keluar daripada bekas model.

Kepentingan segera ialah keterlihatan operasi. Inferens pertuturan bukanlah beban kerja yang seragam: sesi penstriman, audio prarakam dan permintaan teks ke pertuturan boleh meletakkan permintaan yang berbeza pada penggunaan dan ciri pilihan boleh menukar volum pemprosesan atau penggunaan sumber. Metrik penggunaan peringkat akaun Deepgram bertujuan untuk menunjukkan perbezaan tersebut dalam istilah yang boleh digunakan oleh pengendali dan pasukan kewangan. Pelanggan boleh memeriksa jumlah trafik yang menggunakan diarisasi atau membandingkan penggunaan peringkat model dari semasa ke semasa. Itu boleh membantu organisasi mengenal pasti corak penggunaan yang tidak dijangka, mereka bentuk sistem caj balik dalaman atau memutuskan beban kerja yang harus dialihkan ke penempatan yang berbeza. Sumber membentangkan ini sebagai penggunaan metrik, bukan penjimatan yang ditunjukkan atau peningkatan prestasi.

Sambungan pengebilan boleh menjadikan perolehan AI berasaskan pasaran lebih mudah untuk diaudit. Deepgram mengatakan metrik ConsumedUnit membawa nilai unit boleh dibil yang sama yang digunakan untuk pemeteran Pasaran AWS, membolehkan pelanggan membandingkan jumlah CloudWatch dengan bil AWS mereka. Itu lebih khusus daripada kiraan permintaan, kerana permintaan mungkin mewakili sesi penstriman, kuantiti audio atau volum aksara yang disintesis. Sumber itu mengatakan ciri CloudWatch biasa—termasuk papan pemuka, penggera dan matematik metrik—boleh digunakan pada data. Ia tidak memberikan contoh hasil penyesuaian, kadar ralat, kawalan perakaunan atau pengesahan bebas bahawa metrik sentiasa sepadan dengan invois. Organisasi masih memerlukan pemeriksaan kewangan dan pematuhan mereka sendiri.

Metrik per-GPU dan peringkat enjin menangani masalah yang berbeza: perancangan kapasiti dalam penggunaan berskala. Purata seluruh armada boleh mengaburkan pemecut yang terlebih muatan, manakala kiraan permintaan sahaja mungkin tidak menunjukkan ruang kepala strim serentak. Deepgram mengatakan anggaran kapasiti strim enjinnya boleh dibandingkan dengan permintaan aktif untuk menyediakan isyarat yang dilaporkan enjin untuk keputusan penskalaan, dan metrik GPU boleh diperiksa secara berasingan pada kejadian berbilang GPU. Ini boleh membantu pengendali menyiasat penggunaan yang tidak sekata, menala ambang penskalaan auto atau menentukan apabila jenis contoh menjadi halangan. Kata-kata itu penting: angka kapasiti ialah anggaran enjin, bukan jaminan yang disahkan secara bebas tentang jumlah strim yang akan dikekalkan di bawah setiap format audio, model, gabungan ciri atau corak beban kerja.

Sudut keselamatan dan tadbir urus juga konkrit. Sumber itu mengatakan bekas Pasaran AWS beroperasi dengan pengasingan rangkaian dan tidak boleh membuat sambungan keluar, reka bentuk yang dipilih oleh sesetengah pelanggan atas sebab keselamatan dan pematuhan. Laluan telemetri yang dicadangkan Deepgram menyimpan ukuran dalam persekitaran CloudWatch pelanggan tanpa memerlukan bekas untuk membuka laluan rangkaian. Sumber itu juga mengatakan dimensi yang disenaraikan tidak mengandungi maklumat yang boleh dikenal pasti secara peribadi dan tidak termasuk transkrip atau pengecam permintaan. Kenyataan tersebut menggambarkan seni bina yang diumumkan, bukan penilaian privasi yang lengkap: pelanggan tetap bertanggungjawab ke atas konfigurasi AWS mereka, tetapan pengekalan, kawalan akses dan kewajipan kawal selia di bawah model tanggungjawab bersama.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Sumber tidak menyediakan ukuran bebas pemantauan overhed, penjimatan kos, ketepatan anggaran kapasiti atau penerimaan pelanggan. Pasukan yang mempertimbangkan penggunaan perlu menguji sama ada metrik pengebilan peringkat akaun cukup berbutir, sama ada anggaran enjin sepadan dengan trafik yang diperhatikan dan kos tambahan CloudWatch, pengelogan dan pengehosan GPU yang terhasil dalam persekitaran mereka sendiri.

Yang pertama tidak diketahui ialah prestasi dunia sebenar. Pengumuman itu tidak melaporkan CPU, memori, storan atau overhed kependaman untuk menulis metrik terbenam, mengikis titik akhir Prometheus atau menerbitkan data setiap 60 saat. Ia juga tidak mengira caj CloudWatch untuk log dan metrik, kos pengumpul atau sebarang kesan pada tingkah laku penskalaan automatik. AWS dan Deepgram ambil perhatian bahawa pengehosan titik akhir, contoh GPU, log dan metrik CloudWatch, rangkaian dan infrastruktur yang berkaitan boleh dikenakan caj, walaupun semasa percubaan Deepgram 14 hari yang dinyatakan oleh model. Bakal pengguna memerlukan pengukuran khusus beban kerja dan bukannya menganggap kebolehmerhatian yang dipertingkatkan adalah neutral kos.

Isu kedua ialah kebutiran metrik. Strim pengebilan dan penggunaan Deepgram mengagregat merentas titik akhir dalam akaun dan Wilayah dan tidak mengenal pasti titik akhir atau kejadian. Itu mungkin mencukupi untuk pelaporan kewangan yang luas, tetapi tidak dapat dengan sendirinya menjawab penggunaan mana yang menjana volum tertentu. Analisis per-titik dan per-GPU bergantung pada laluan Prometheus dan OpenTelemetry yang berasingan dan pada kebolehmerhatian terperinci yang didayakan. Sumber itu mengatakan bahawa titik akhir baharu mempunyai tetapan yang didayakan secara lalai dan titik akhir yang lebih lama boleh dikemas kini, tetapi tidak menerangkan kes kelebihan migrasi, tempoh pengekalan, templat papan pemuka atau cara pengendali harus mengendalikan siri yang hilang, tertangguh atau bercanggah.

Isyarat kapasiti juga patut disahkan. Deepgram menerangkan enjin_estimated_stream_capacity sebagai anggaran enjin sendiri bagi aliran serentak yang mampan. Sumber tidak menunjukkan cara anggaran itu dikira, cara ia berubah dengan peringkat model atau ciri yang didayakan, atau cara anggaran itu berprestasi semasa trafik meningkat dan keadaan yang merosot. Operator harus membandingkannya dengan kependaman yang diperhatikan, ralat, baris gilir dan sesi selesai sebelum menggunakannya sebagai pencetus penskalaan automatik. Metrik SageMaker standard seperti ConcurrentRequestsPerModel, FirstChunkLatency dan Invocation5XXErrors kekal relevan kerana strim baharu melengkapkan dan bukannya menggantikannya.

Akhir sekali, pengumuman itu menetapkan ketersediaan untuk penempatan AI Deepgram SageMaker, tetapi bukan kesan ekosistem yang lebih luas. Ia tidak menyatakan bilangan pelanggan yang telah menggunakan metrik, sama ada vendor AI pertuturan lain menawarkan keterlihatan yang setara, atau sama ada AWS akan melanjutkan penyepaduan yang sama kepada pakej model tambahan. Tindakan susulan praktikal ialah sama ada pengguna boleh menyelaraskan invois dengan pasti, mengasingkan tempat liputan sumber dan mengurus penggunaan peringkat ciri tanpa menambah infrastruktur baharu. Bukti daripada penggunaan bebas, gelagat metrik yang didokumenkan dalam tempoh yang lebih lama dan pengalaman pelanggan akan menjelaskan sama ada ciri tersebut secara material mengubah tadbir urus harian AI pertuturan yang dihoskan sendiri.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AIMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak pembiayaan AI
Adakah ini berguna?