Haberlere Geri Dön
kurumsalAI Understanding brifing

Deepgram, SageMaker AI dağıtımlarına faturalandırma ve GPU görünürlüğü ekliyor

Deepgram, yeni CloudWatch, Prometheus ve OpenTelemetry ölçümlerinin müşterilere, modellerini Amazon SageMaker AI üzerinde çalıştırırken konuşma yapay zekası kullanımı, AWS Marketplace faturalandırması, motor kapasitesi ve GPU başına kullanım konusunda daha fazla görünürlük sağladığını söylüyor.

7 min readRead the primary source
Primary-source image accompanying Deepgram adds billing and GPU visibility to its SageMaker AI deployments
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
aws.amazon.com
Kaynak bağlantısı
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/deepgram-deepens-amazon-sagemaker-ai-observability-with-enhanced-metrics/
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

API (Uygulama Programlama Arayüzü)
Bir yazılım sisteminin başka bir sisteme istek göndermesi ve bu sistemden yanıt alması için yapılandırılmış bir yol.
Bellek (Ajan Belleği)
Bir AI aracısının sürekliliği artırmak için adımlar veya oturumlar boyunca kullandığı kayıtlı bağlam.
Çıkarım
Eğitilmiş bir modelin tahminler veya çıktılar ürettiği çalışma zamanı aşaması.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Deepgram, Amazon SageMaker AI gerçek zamanlı uç noktaları olarak konuşlandırılan konuşmayı metne ve metinden konuşmaya modelleri için iki gözlemlenebilirlik eklemesi yaptığını duyurdu. Geliştirilmiş Metrikler, kullanım ve faturalandırma verilerini müşterinin CloudWatch hesabında yayınlarken Prometheus ve OpenTelemetry entegrasyonları, SageMaker AI ayrıntılı gözlemlenebilirliği aracılığıyla motor, ana bilgisayar ve GPU başına ölçümleri ortaya çıkarır.

Deepgram'ın duyurusu, bir müşterinin AWS hesabındaki Amazon SageMaker AI gerçek zamanlı uç noktalarında AWS Marketplace model paketleri olarak çalışan konuşmadan metne ve metinden konuşmaya modelleriyle ilgilidir. Şirket, ses ve transkriptlerin bu hesapta kaldığını, SageMaker'ın ise dağıtım, ölçeklendirme ve izleme kontrolleri sağladığını söylüyor. Gönderi, yeni yeteneklerin bir görünürlük açığını kapattığını çerçeveliyor: standart uç nokta izleme, kullanılabilirliği ve istek işlemeyi gösterebilir, ancak hangi konuşma özelliklerinin kullanıldığını, hangi birimlerin pazar ücretlerini yönlendirdiğini veya çıkarımın her bir GPU'yu nasıl kullandığını ortaya çıkarmayabilir.

Deepgram Geliştirilmiş Metrikler olarak adlandırılan ilk ekleme, konteynerin standart çıktısına yazılan CloudWatch Gömülü Metrik Format kayıtları aracılığıyla faturalama ve kullanım bilgilerini Amazon CloudWatch'a gönderir. SageMaker, bu çıktıyı uç noktanın CloudWatch günlük grubuna iletir; burada CloudWatch, kayıtları sıradan ölçümlere çıkarır. Kaynağa göre süreç, ayrı bir aracı, sepet veya ek IAM izni gerektirmiyor ve mevcut SageMaker'dan CloudWatch'a günlük kaydı yolunu kullandığı için AWS Marketplace ağ yalıtımıyla çalışıyor. Faturalandırma ad alanı Deepgram/SageMakerInference'tır. ConsumedUnits metriği, tamamlanmış akış, önceden kaydedilmiş ve metinden konuşmaya istekleri için faturalandırılabilir çıkarım birimlerini temsil ederken, AudioDurationSeconds ve CharCount işlenmiş ses ve sentezlenmiş karakterleri tanımlar. Deepgram, bu değerlerin AWS Marketplace ölçülü faturalandırma için kullanılanlarla aynı olduğunu söylüyor.

İkinci kullanım akışı olan Deepgram/SelfHosted, Deepgram API sunucusu tarafından yayınlanır ve doğrudan bir faturanın mutabakatını yapmak yerine trafiğin hizmeti nasıl kullandığını gösterir. Kaynak, akış ve önceden kaydedilmiş hacim için ölçümleri, nova-3 ve flux gibi model katmanlarını ve günlük tutma, akıllı biçimlendirme, redaksiyon ve anahtar terim istemi gibi özellikleri listeler. Bu ölçümler, bir AWS hesabı ve Bölgesindeki Deepgram uç noktaları genelinde toplanır. Gönderi, transkriptler, metin-konuşma girişi veya istek başına tanımlayıcılar olmadan düşük kardinaliteli boyutlar kullandıklarını ancak uç nokta adını veya örnek kimliğini içermediklerini söylüyor. Kullanım akışı, ortam değişkeni geçersiz kılma ile devre dışı bırakılabilirken faturalama akışı, Deepgram'ın ölçüm hattının bir parçası olarak tanımladığı için devre dışı bırakılamaz.

Deepgram, daha düşük seviyeli operasyonlar için konteynerlerinin, SageMaker AI ayrıntılı gözlemlenebilirliğinin, her uç nokta örneğinde çalışan AWS tarafından yönetilen bir OpenTelemetry Collector aracılığıyla toplayabildiği Prometheus ölçümlerini açığa çıkardığını söylüyor. Ortaya çıkan veriler, bireysel GPU'lar için DCGM dışa aktarıcı ölçümlerini, ana bilgisayar CPU'su ve belleği için düğüm dışa aktarıcı ölçümlerini ve aktif akış istekleri ve tahmini akış kapasitesi gibi Deepgram motor ölçümlerini içerir. Kaynak, her serinin uç nokta, değişken ve örnek tanımlayıcıları dahil olmak üzere SageMaker kaynak etiketlerini taşıdığını söylüyor. Müşteriler, CloudWatch, Grafana veya başka bir uyumlu araç aracılığıyla PromQL'i kullanarak belirli bir uç noktayı, örneği veya GPU'yu sorgulayabilir. Ayrıntılı gözlemlenebilirlik, yeni oluşturulan uç noktalar için varsayılan olarak 60 saniyelik yayınlama sıklığıyla etkindir; eski uç noktalar ise mavi/yeşil dağıtım kullanılarak uç nokta yapılandırma güncellemesi gerektirir.

Kaynak ayrıntıları: aws.amazon.com ↗

Neden önemli?

Değişiklikler, kendi kendine barındırılan yapay zekadaki pratik bir sorunu hedef alıyor: Müşteriler bir uç noktanın çalışıp çalışmadığını izleyebiliyor ancak kullanımı yönlendiren model özellikleri, pazar yeri faturalandırmasının arkasındaki birimler ve bireysel hızlandırıcıların kapasitesi hakkında görünürlükten yoksun olabiliyor. Kaynak, model kapsayıcıdan giden ağ erişimini açmadan bu operasyonel ve mali soruları birbirine bağlamanın bir yolunu açıklıyor.

Acil önem operasyonel görünürlüktür. Konuşma çıkarımı tek tip bir iş yükü değildir: akış oturumları, önceden kaydedilmiş ses ve metinden konuşmaya istekleri, dağıtımda farklı talepler doğurabilir ve isteğe bağlı özellikler, işlem hacmini veya kaynak kullanımını değiştirebilir. Deepgram'ın hesap düzeyindeki kullanım ölçümleri, operatörlerin ve finans ekiplerinin kullanabileceği terimlerdeki farklılıkları göstermeyi amaçlamaktadır. Müşteri, günlük tutmanın ne kadar trafikte kullanıldığını inceleyebilir veya zaman içindeki model katmanı tüketimini karşılaştırabilir. Bu, kuruluşların beklenmedik kullanım kalıplarını belirlemesine, dahili geri ödeme sistemleri tasarlamasına veya hangi iş yüklerinin farklı dağıtımlara yönlendirilmesi gerektiğine karar vermesine yardımcı olabilir. Kaynak bunları, kanıtlanmış tasarruflar veya performans iyileştirmeleri olarak değil, metriklerin kullanımları olarak sunuyor.

Faturalandırma bağlantısı, pazara dayalı yapay zeka tedarikinin denetlenmesini kolaylaştırabilir. Deepgram, ConsumedUnits metriğinin AWS Marketplace ölçümü için kullanılan faturalandırılabilir birim değerlerinin aynısını taşıdığını ve müşterilerin CloudWatch toplamlarını AWS faturalarıyla karşılaştırmasına olanak tanıdığını söylüyor. Bu, istek sayısından daha spesifiktir çünkü bir istek bir akış oturumunu, bir ses miktarını veya sentezlenmiş bir karakter hacmini temsil edebilir. Kaynak, kontrol panelleri, alarmlar ve metrik matematik dahil olmak üzere sıradan CloudWatch özelliklerinin verilere uygulanabileceğini söylüyor. Metriklerin her zaman bir faturayla eşleştiğine dair örnek bir mutabakat sonucu, hata oranı, muhasebe kontrolü veya bağımsız onay sağlamaz. Kuruluşların hâlâ kendi mali ve uyumluluk kontrollerine ihtiyacı olacak.

GPU başına ve motor düzeyindeki ölçümler farklı bir sorunu ele alıyor: ölçekli bir dağıtımda kapasite planlaması. Filo çapında bir ortalama, aşırı yüklenmiş bir hızlandırıcıyı gizleyebilir, ancak istek sayıları tek başına eşzamanlı akış boşluğunu göstermeyebilir. Deepgram, motorunun tahmini akış kapasitesinin, ölçeklendirme kararları için motor tarafından bildirilen bir sinyal sağlamak üzere aktif isteklerle karşılaştırılabileceğini ve GPU ölçümlerinin çoklu GPU örneklerinde ayrı olarak incelenebileceğini söylüyor. Bu, operatörlerin dengesiz kullanımı araştırmasına, otomatik ölçeklendirme eşiklerini ayarlamasına veya bir bulut sunucusu tipinin ne zaman darboğaz haline geldiğini belirlemesine yardımcı olabilir. İfade önemlidir: Kapasite rakamı motorun tahminidir; bir örneğin her ses formatı, model, özellik kombinasyonu veya iş yükü modeli altında kaç akışı sürdüreceğine dair bağımsız olarak doğrulanmış bir garanti değildir.

Güvenlik ve yönetişim açısı da somuttur. Kaynak, AWS Marketplace konteynerlerinin ağ yalıtımıyla çalıştığını ve bazı müşteriler tarafından güvenlik ve uyumluluk nedenleriyle seçilen bir tasarım olan giden bağlantılar kuramadığını söylüyor. Deepgram'ın önerdiği telemetri yolu, konteynerin bir ağ yolu açmasına gerek kalmadan ölçümleri müşterinin CloudWatch ortamında tutar. Kaynak ayrıca listelenen boyutların kişisel olarak tanımlanabilir hiçbir bilgi içermediğini ve transkriptleri veya talep tanımlayıcılarını içermediğini söylüyor. Bu beyanlar, tam bir gizlilik değerlendirmesini değil, duyurulan mimariyi açıklamaktadır: müşteriler, paylaşılan sorumluluk modeli kapsamında AWS yapılandırmasından, saklama ayarlarından, erişim kontrollerinden ve düzenleyici yükümlülüklerden sorumlu olmaya devam eder.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Kaynak, genel giderlerin izlenmesi, maliyet tasarrufları, kapasite tahminlerinin doğruluğu veya müşterinin benimsenmesine ilişkin bağımsız ölçümler sağlamaz. Dağıtımı düşünen ekiplerin, hesap düzeyindeki faturalandırma ölçümlerinin yeterince ayrıntılı olup olmadığını, motor tahminlerinin gözlemlenen trafikle eşleşip eşleşmediğini ve kendi ortamlarında hangi ek CloudWatch, günlük kaydı ve GPU barındırma maliyetlerinin ortaya çıktığını test etmesi gerekecektir.

İlk bilinmeyen gerçek dünya performansıdır. Duyuruda, gömülü metriklerin yazılması, Prometheus uç noktalarının kazınması veya her 60 saniyede bir veri yayınlanmasından kaynaklanan CPU, bellek, depolama veya gecikme yükü bildirilmiyor. Ayrıca günlükler ve ölçümler için CloudWatch ücretlerini, toplayıcı maliyetlerini veya otomatik ölçeklendirme davranışı üzerindeki herhangi bir etkiyi ölçmez. AWS ve Deepgram, uç nokta barındırma, GPU örnekleri, CloudWatch günlükleri ve ölçümleri, ağ iletişimi ve ilgili altyapının, modellerin belirtilen 14 günlük Deepgram denemesi sırasında bile ücrete tabi olabileceğini belirtiyor. Potansiyel kullanıcılar, gelişmiş gözlemlenebilirliğin maliyet açısından nötr olduğunu varsaymak yerine iş yüküne özgü ölçümlere ihtiyaç duyacaktır.

İkinci bir sorun metrik ayrıntı düzeyidir. Deepgram'ın faturalandırma ve kullanım akışları, bir hesaptaki ve Bölgedeki uç noktalar arasında toplanır ve bir uç noktayı veya örneği tanımlamaz. Bu, geniş kapsamlı finansal raporlama için yeterli olabilir ancak hangi dağıtımın belirli bir hacim oluşturduğunu tek başına yanıtlayamaz. Uç nokta başına ve GPU başına analiz, ayrı Prometheus ve OpenTelemetry yoluna ve etkinleştirilen ayrıntılı gözlemlenebilirliğe bağlıdır. Kaynak, yeni uç noktaların bu ayarın varsayılan olarak etkin olduğunu ve eski uç noktaların güncellenebileceğini söylüyor ancak geçiş uç durumlarını, saklama sürelerini, kontrol paneli şablonlarını veya operatörlerin eksik, gecikmiş veya çakışan serileri nasıl ele alması gerektiğini açıklamıyor.

Kapasite sinyali de doğrulamayı hak ediyor. Deepgram, motor_tahmini_akım_kapasitesini, motorun sürdürülebilir eşzamanlı akışlara ilişkin kendi tahmini olarak tanımlar. Kaynak, bu tahminin nasıl hesaplandığını, model katmanı veya etkinleştirilmiş özelliklerle nasıl değiştiğini veya trafik artışları ve kötü koşullar sırasında nasıl performans gösterdiğini göstermiyor. Operatörler bunu otomatik ölçeklendirme tetikleyicisi olarak kullanmadan önce gözlemlenen gecikme süresi, hatalar, sıraya alma ve tamamlanan oturumlarla karşılaştırmalıdır. ConcurrentRequestsPerModel, FirstChunkLatency ve Invation5XXErrors gibi standart SageMaker ölçümleri, yeni akışların bunların yerini almak yerine tamamlaması nedeniyle geçerliliğini koruyor.

Son olarak duyuru, Deepgram SageMaker AI dağıtımlarının kullanılabilirliğini belirliyor ancak daha geniş bir ekosistem etkisi sağlamıyor. Metrikleri kaç müşterinin benimsediği, diğer konuşma yapay zekası sağlayıcılarının eşdeğer görünürlük sağlayıp sağlamadığı ya da AWS'nin aynı entegrasyonu ek model paketlerine genişletip genişletmeyeceği belirtilmez. Pratik takip, kullanıcıların faturaları güvenilir bir şekilde mutabakata varıp varamayacağı, kaynak etkin noktalarını izole edip edemeyeceği ve yeni altyapı eklemeden özellik düzeyinde kullanımı yönetip yönetemeyeceğidir. Bağımsız dağıtımlardan, daha uzun süreler boyunca belgelenen metrik davranışından ve müşteri deneyiminden elde edilen kanıtlar, özelliğin, kendi kendine barındırılan konuşma yapay zekasının günlük yönetimini maddi olarak değiştirip değiştirmediğini açıklığa kavuşturacaktır.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka AracılarıYapay Zekanın GeleceğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınYapay zeka fon takibini takip edin
Bunu yararlı buldunuz mu?