Rudi kwa Habari
BiasharaAI Understanding muhtasari

Deepgram huongeza malipo na mwonekano wa GPU kwa matumizi yake ya SageMaker AI

Deepgram inasema vipimo vipya vya CloudWatch, Prometheus na OpenTelemetry huwapa wateja mwonekano zaidi katika matumizi ya hotuba-AI, malipo ya Soko la AWS, uwezo wa injini na matumizi ya per-GPU wakati wa kuendesha miundo yake kwenye Amazon SageMaker AI.

7 min readRead the primary source
Primary-source image accompanying Deepgram adds billing and GPU visibility to its SageMaker AI deployments
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
aws.amazon.com
Kiungo cha chanzo
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/deepgram-deepens-amazon-sagemaker-ai-observability-with-enhanced-metrics/
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

API (Kiolesura cha Kuandaa Programu)
Njia iliyoundwa kwa mfumo mmoja wa programu kutuma maombi na kupokea majibu kutoka kwa mfumo mwingine.
Kumbukumbu (Kumbukumbu ya Wakala)
Muktadha uliohifadhiwa wakala wa AI hutumia katika hatua au vipindi ili kuboresha mwendelezo.
Hitimisho
Awamu ya wakati wa utekelezaji ambapo muundo uliofunzwa hutoa ubashiri au matokeo.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Deepgram ilitangaza nyongeza mbili za uangalizi kwa miundo yake ya hotuba-kwa-maandishi na maandishi-kwa-hotuba iliyotumiwa kama Amazon SageMaker AI mwisho wa wakati halisi. Vipimo Vilivyoboreshwa huchapisha data ya matumizi na malipo kwa akaunti ya mteja ya CloudWatch, huku miunganisho ya Prometheus na OpenTelemetry hufichua vipimo vya injini, seva pangishi na per-GPU kupitia SageMaker AI ya uangalizi wa kina.

Tangazo la Deepgram linahusu vielelezo vya hotuba-kwa-maandishi na maandishi-kwa-hotuba vinavyoendeshwa kama vifurushi vya AWS vya Soko kwenye Amazon SageMaker AI za mwisho za wakati halisi katika akaunti ya mteja ya AWS. Kampuni hiyo inasema sauti na nakala husalia ndani ya akaunti hiyo huku SageMaker ikitoa vidhibiti vya kusambaza, kuongeza na ufuatiliaji. Chapisho linaweka uwezo mpya kama kuziba pengo la mwonekano: ufuatiliaji wa kiwango cha mwisho unaweza kuonyesha upatikanaji na ushughulikiaji wa ombi, lakini hauwezi kufichua vipengele vya hotuba vinavyotumika, vitengo gani hutoza ada za soko au jinsi makisio yanavyotumia kila GPU.

Nyongeza ya kwanza, inayoitwa Vipimo Vilivyoboreshwa vya Deepgram, hutuma maelezo ya bili na matumizi kwa Amazon CloudWatch kupitia CloudWatch Embedded Metric Format rekodi zilizoandikwa kwa towe la kawaida la kontena. SageMaker husambaza matokeo hayo kwenye kikundi cha kumbukumbu cha CloudWatch cha endpoint, ambapo CloudWatch huchota rekodi katika vipimo vya kawaida. Kulingana na chanzo, mchakato hauhitaji wakala tofauti, kando au ruhusa ya ziada ya IAM na hufanya kazi na mtandao wa AWS Marketplace kutengwa kwa sababu hutumia njia iliyopo ya ukataji miti ya SageMaker-to-CloudWatch. Nafasi ya majina ya bili ni Deepgram/SageMakerInference. Kipimo chake cha ConsumedUnits kinawakilisha vitengo vya maelekeo vinavyoweza kutozwa kwa utiririshaji uliokamilika, maombi yaliyorekodiwa awali na ya kutoka kwa maandishi hadi kwa hotuba, huku AudioDurationSeconds na CharCount hufafanua vibambo vya sauti vilivyochakatwa na kusanisi. Deepgram inasema thamani hizi ni zile zile zinazotumika kwa malipo ya mita za AWS Marketplace.

Mtiririko wa pili wa matumizi, Deepgram/SelfHosted, unatolewa na seva ya API ya Deepgram na unaonyesha jinsi trafiki hutumia huduma badala ya kupatanisha bili moja kwa moja. Chanzo huorodhesha vipimo vya utiririshaji na sauti iliyorekodiwa mapema, viwango vya muundo kama vile nova-3 na flux, na vipengele vinavyojumuisha uwekaji sauti, uumbizaji mahiri, uwekaji upya na uelekezaji wa neno muhimu. Vipimo hivi vinajumlisha sehemu zote za mwisho za Deepgram katika akaunti na Eneo la AWS. Chapisho linasema wanatumia vipimo vya chini kabisa bila manukuu, ingizo la maandishi hadi usemi au vitambulishi vya kila ombi, lakini halijumuishi jina la mwisho au kitambulisho cha mfano. Mtiririko wa matumizi unaweza kuzimwa kwa kubatilisha kigezo cha mazingira, ilhali mtiririko wa bili hauwezi kuzimwa kwa sababu Deepgram inaufafanua kama sehemu ya bomba la kupima.

Kwa shughuli za kiwango cha chini, Deepgram inasema kontena zake hufichua metriki za Prometheus ambazo uangalizi wa kina wa SageMaker AI unaweza kukusanya kupitia Kikusanyaji cha OpenTelemetry kinachodhibitiwa na AWS kinachoendesha kila tukio la mwisho. Data inayotokana ni pamoja na vipimo vya uagizaji bidhaa vya DCGM kwa GPU mahususi, vipimo vya kibadilishaji nodi za CPU na kumbukumbu ya seva pangishi, na vipimo vya injini ya Deepgram kama vile maombi yanayoendelea ya utiririshaji na makadirio ya uwezo wa kutiririsha. Chanzo kinasema kila mfululizo hubeba lebo za rasilimali za SageMaker, ikijumuisha sehemu ya mwisho, lahaja na vitambulishi vya mfano. Wateja wanaweza kuuliza sehemu fulani ya mwisho, mfano au GPU kwa kutumia PromQL kupitia CloudWatch, Grafana au zana nyingine inayooana. Uangalizi wa kina umewezeshwa kwa chaguo-msingi kwa ncha mpya zilizoundwa, kwa marudio ya uchapishaji ya sekunde 60, huku sehemu za mwisho zinahitaji sasisho la usanidi wa sehemu ya mwisho kwa kutumia matumizi ya samawati/kijani.

Maelezo ya chanzo: aws.amazon.com ↗

Kwa nini ni muhimu

Mabadiliko hayo yanalenga tatizo la kivitendo katika AI inayopangishwa kibinafsi: wateja wanaweza kufuatilia kama kituo kinafanya kazi, lakini wanaweza kukosa kuonekana katika vipengele vya muundo wa utumiaji, vitengo vya utozaji sokoni na uwezo wa vichapuzi binafsi. Chanzo kinaelezea njia ya kuunganisha maswali hayo ya uendeshaji na ya kifedha bila kufungua ufikiaji wa mtandao wa nje kutoka kwa kontena la mfano.

Umuhimu wa haraka ni mwonekano wa uendeshaji. Makisio ya usemi si mzigo wa kazi unaofanana: vipindi vya kutiririsha, sauti iliyorekodiwa awali na maombi ya maandishi-hadi-hotuba yanaweza kuweka mahitaji tofauti kwenye utumaji, na vipengele vya hiari vinaweza kubadilisha sauti ya uchakataji au matumizi ya rasilimali. Vipimo vya matumizi ya kiwango cha akaunti ya Deepgram vinakusudiwa kuonyesha tofauti hizo katika masharti ambayo waendeshaji na timu za fedha zinaweza kutumia. Mteja anaweza kuchunguza ni kiasi gani cha trafiki kilitumia uwekaji sauti au kulinganisha matumizi ya kiwango cha modeli kwa wakati. Hilo linaweza kusaidia mashirika kutambua mifumo ya utumiaji isiyotarajiwa, kubuni mifumo ya ndani ya urejeshaji malipo au kuamua ni mzigo gani wa kazi unafaa kuelekezwa kwenye matumizi tofauti. Chanzo kinawasilisha haya kama matumizi ya vipimo, sio uboreshaji wa uokoaji au utendakazi.

Muunganisho wa bili unaweza kufanya ununuzi wa AI unaotegemea soko kuwa rahisi kukaguliwa. Deepgram inasema kipimo cha ConsumedUnits kinabeba thamani zile zile za kitengo kinachoweza kutozwa kinachotumika kupima mita za soko la AWS, hivyo basi kuwaruhusu wateja kulinganisha jumla za CloudWatch na bili zao za AWS. Hiyo ni mahususi zaidi kuliko hesabu ya ombi, kwa sababu ombi linaweza kuwakilisha kipindi cha utiririshaji, idadi ya sauti au idadi ya herufi zilizosanisishwa. Chanzo kinasema vipengele vya kawaida vya CloudWatch—ikiwa ni pamoja na dashibodi, kengele na hesabu za metriki—vinaweza kutumika kwenye data. Haitoi mfano wa matokeo ya upatanisho, kiwango cha makosa, udhibiti wa uhasibu au uthibitisho huru kwamba vipimo vinalingana na ankara kila wakati. Mashirika bado yangehitaji ukaguzi wao wenyewe wa kifedha na kufuata.

Vipimo vya kila GPU na kiwango cha injini hushughulikia tatizo tofauti: kupanga uwezo katika uwekaji wa kiwango. Wastani wa kundi zima la ndege unaweza kuficha kiongeza kasi kilichojaa kupita kiasi, huku hesabu za ombi pekee zisionyeshe chumba cha habari cha mtiririko mmoja. Deepgram inasema makadirio ya uwezo wa mtiririko wa injini yake yanaweza kulinganishwa na maombi amilifu ya kutoa mawimbi yaliyoripotiwa na injini kwa maamuzi ya kuongeza kiwango, na kwamba vipimo vya GPU vinaweza kukaguliwa kando katika matukio ya GPU nyingi. Hii inaweza kusaidia waendeshaji kuchunguza utumiaji usio na usawa, kurekebisha vizingiti vya kuongeza kasi kiotomatiki au kubaini wakati aina ya mfano inakuwa kikwazo. Maneno ni muhimu: idadi ya uwezo ni makadirio ya injini, si hakikisho lililoidhinishwa kwa kujitegemea la jinsi mitiririko mingapi mfano utakavyodumishwa chini ya kila fomati ya sauti, modeli, mchanganyiko wa vipengele au muundo wa mzigo.

Pembe ya usalama na utawala pia ni thabiti. Chanzo kinasema kontena za Soko la AWS hufanya kazi kwa kutengwa kwa mtandao na haziwezi kufanya miunganisho ya nje, muundo uliochaguliwa na baadhi ya wateja kwa sababu za usalama na kufuata. Njia ya telemetry inayopendekezwa ya Deepgram huweka vipimo ndani ya mazingira ya mteja ya CloudWatch bila kuhitaji kontena kufungua njia ya mtandao. Chanzo pia kinasema kuwa vipimo vilivyoorodheshwa havina maelezo yanayoweza kumtambulisha mtu binafsi na havijumuishi manukuu au vitambulishi vya ombi. Taarifa hizo zinaelezea usanifu uliotangazwa, si tathmini kamili ya faragha: wateja wanasalia kuwajibika kwa usanidi wao wa AWS, mipangilio ya uhifadhi, vidhibiti vya ufikiaji na majukumu ya udhibiti chini ya muundo wa uwajibikaji wa pamoja.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Chanzo hakitoi vipimo huru vya ufuatiliaji wa juu, uokoaji wa gharama, usahihi wa makadirio ya uwezo au kupitishwa kwa wateja. Timu zinazozingatia utumaji zitahitaji kupima ikiwa vipimo vya bili vya kiwango cha akaunti ni punjepunje vya kutosha, kama makadirio ya injini yanalingana na trafiki iliyozingatiwa na matokeo ya gharama za ziada za CloudWatch, uwekaji kumbukumbu na upangishaji wa GPU katika mazingira yao wenyewe.

Ya kwanza haijulikani ni utendaji wa ulimwengu halisi. Tangazo haliripoti CPU, kumbukumbu, hifadhi au muda wa kusubiri wa maandishi ya vipimo vilivyopachikwa, kufuta sehemu za mwisho za Prometheus au kuchapisha data kila baada ya sekunde 60. Pia haihesabu ada za CloudWatch za kumbukumbu na vipimo, gharama za mkusanyaji au athari yoyote kwenye tabia ya kuongeza otomatiki. AWS na Deepgram kumbuka kuwa upangishaji wa mwisho, matukio ya GPU, kumbukumbu na vipimo vya CloudWatch, mtandao na miundombinu inayohusiana inaweza kutozwa, hata wakati wa majaribio ya siku 14 ya Deepgram yaliyotajwa. Watumiaji wanaotarajiwa watahitaji vipimo mahususi vya mzigo wa kazi badala ya kudhani kuwa uangalizi ulioboreshwa hauna gharama.

Suala la pili ni uzito wa metriki. Mitiririko ya bili na matumizi ya Deepgram inajumlisha sehemu zote za mwisho katika akaunti na Eneo na haitambui mwisho au tukio. Hiyo inaweza kuwa ya kutosha kwa ripoti pana ya kifedha, lakini haiwezi yenyewe kujibu ni usambazaji gani ulizalisha kiasi fulani. Uchambuzi wa kila mwisho na kwa kila GPU unategemea njia tofauti ya Prometheus na OpenTelemetry na uangalizi wa kina unaowezeshwa. Chanzo hicho kinasema kwamba miisho mipya ina kwamba mipangilio inayowashwa kwa chaguomsingi na miisho ya zamani inaweza kusasishwa, lakini haielezei visa vya ukingo wa uhamiaji, muda wa uhifadhi, violezo vya dashibodi au jinsi waendeshaji wanapaswa kushughulikia mfululizo unaokosekana, uliochelewa au unaokinzana.

Ishara ya uwezo pia inastahili uthibitisho. Deepgram inafafanua engine_estimated_stream_capacity kama makadirio ya injini yenyewe ya mitiririko endelevu kwa wakati mmoja. Chanzo hakionyeshi jinsi makadirio hayo yanavyokokotolewa, jinsi yanavyobadilika kulingana na kiwango cha muundo au vipengele vilivyowashwa, au jinsi inavyofanya kazi wakati wa ongezeko la trafiki na hali duni. Waendeshaji wanapaswa kuilinganisha na muda unaozingatiwa, makosa, kupanga foleni na vipindi vilivyokamilika kabla ya kuitumia kama kichochezi cha kuongeza kiotomatiki. Vipimo vya Kawaida vya SageMaker kama vile ConcurrentRequestsPerModel, FirstChunkLatency na Invocation5XXErrors vinasalia kuwa muhimu kwa sababu mitiririko mipya inakamilishana badala ya kuzibadilisha.

Hatimaye, tangazo linathibitisha upatikanaji wa uwekaji wa Deepgram SageMaker AI, lakini si athari pana zaidi ya mfumo ikolojia. Haisemi ni wateja wangapi wamepitisha vipimo, iwe wachuuzi wengine wa hotuba-AI wanatoa mwonekano sawa, au ikiwa AWS itapanua muunganisho sawa kwa vifurushi vya miundo ya ziada. Ufuatiliaji wa vitendo ni kama watumiaji wanaweza kusawazisha ankara kwa uhakika, kutenga maeneo pepe ya rasilimali na kudhibiti matumizi ya kiwango cha vipengele bila kuongeza miundombinu mipya. Ushahidi kutoka kwa matumizi huru, tabia ya kipimo iliyorekodiwa kwa muda mrefu na uzoefu wa wateja ungefafanua kama kipengele hiki kinabadilisha utawala wa kila siku wa hotuba inayojiendesha yenyewe AI.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaMawakala wa AIMustakabali wa AIJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatilia ufadhili cha AI
Je, umepata hii kuwa muhimu?