Co se stalo
AWS říká, že Jamf vytvořil a produkčně otestoval bezserverový systém pro monitorování a vynucování limitů výdajů na uživatele Amazon Bedrock. Systém používá protokoly vyvolání Bedrock, Amazon Athena, DynamoDB, AWS Lambda, plány EventBridge, zásady spravované zákazníkem IAM a upozornění Slack.
V příspěvku ze dne 1. září 2026 AWS popsal, jak Jamf řešil náklady na široký přístup k Amazon Bedrock pro svou inženýrskou organizaci. AWS říká, že společnost Jamf, kterou popisuje jako službu pro více než 76 000 organizací s produkty pro správu a zabezpečení zařízení Apple, rozšířila přístup k základně pro podporu vývoje s podporou umělé inteligence. Společnost pak potřebovala viditelnost a odpovědnost jednotlivých uživatelů, protože využití rostlo. Příspěvek představuje implementaci Jamfu jako produkčně testovaný vzor spíše než nový model Bedrock nebo změnu veřejných cen Bedrock.
Systém měří denní útratu každého inženýra z protokolů vyvolání zapsaných do bucketu Amazon S3. Tyto protokoly zahrnují identifikátor modelu, počet vstupních a výstupních ů a identitu uživatele. Zobrazení Amazon Athena vypočítává denní útratu použitím publikovaných sazeb Bedrock na tyto počty tokenů. AWS instruuje uživatele, aby aktualizovali pohled na sazby ve svém regionu a přidali explicitní cenovou větev, kdykoli je povolen nový model. Neznámým modelům je přiřazena nejvyšší úroveň jako zabezpečená proti selhání, dokud není přidána jejich skutečná rychlost.
Funkce AWS Lambda běží každých 15 minut prostřednictvím plánu Amazon EventBridge. Čte útratu aktuálního dne z Atheny, kontroluje tabulku DynamoDB na schválené výjimky a udržuje stav uživatele, takže každé upozornění na prahovou hodnotu je odesláno jednou. Když uživatel překročí prahovou hodnotu, funkce publikuje novou verzi zásad spravovaných zákazníkem IAM. Tato zásada používá hodnotu identity uživatele saml:sub k odepření přístupu k určeným rodinám modelů. AWS říká, že revidovaná politika je vyhodnocena při dalším volání inženýra Bedrock a nevyžaduje opětovné ověření.
Vzorový vzor prosazování udržuje dostupný model s nižšími náklady a zároveň omezuje dražší modely na postupně vyšší úrovně výdajů. AWS poskytuje ilustrativní konfiguraci, ve které je přístup Claude Opus odepřen na 80 % denního rozpočtu a Claude Sonnet na 100 %, zatímco Claude Haiku zůstává k dispozici. Příkaz Slack slash, /bedrock-limit, umožňuje autorizovaným správcům udělit časově ohraničený vyšší limit pro případy, jako je migrace, eskalace zákazníka nebo vyhodnocení modelu. Záznam o výjimce obsahuje dobu vypršení platnosti a informace o auditu a DynamoDB TTL se používá k automatickému odstranění položek, jejichž platnost vypršela.
Podrobnosti o zdroji: aws.amazon.com ↗
Proč na tom záleží
Tento přístup řeší praktickou překážku pro přijetí podnikové umělé inteligence: náklady na model se mohou lišit v závislosti na chování uživatelů a zátěži agentů, takže je obtížné předvídat výdaje. Design Jamf nabízí způsob, jak rozšířit přístup při zachování viditelnosti na uživatelské úrovni a odstupňovaných ovládacích prvků, ačkoli zdroj neposkytuje žádné nezávislé měření nárůstu produktivity nebo návratnosti investic.
Praktickým problémem je, že náklady na generativní AI jsou řízeny chováním. Vývojář provozující rozšířenou smyčku agentního kódování může generovat podstatně více využití ů, než by naznačovalo konvenční, zřízená výpočetní zátěž. Limity na uživatele poskytují organizaci způsob, jak propojit využití s identitou a časovým oknem, namísto čekání na souhrnný účet za cloud. To je zvláště důležité, když prémiové modely mají podstatně odlišné sazby nebo když autonomní pracovní postupy mohou opakovat hovory, aniž by člověk kontroloval každý krok.
Návrh také považuje řízení nákladů za problém nasazení a správy přístupu. Namísto zastavení veškerého přístupu k Bedrocku po dosažení rozpočtu použije omezení specifická pro model a zachová levnější záložní řešení. To může snížit provozní dopad stropu, ale nezaručuje to, že práce bude pokračovat ve stejné kvalitě nebo rychlosti. Zdroj neuvádí, kolik inženýrů Jamf používá systém, skutečné prahové hodnoty společnosti, částku utracenou před a po nasazení ani naměřenou produktivitu a výsledky návratnosti investic. Prohlášení AWS, že produktivita stoupla a že správa umožnila širší přístup, zůstává firemním účtem, nikoli nezávisle ověřeným výsledkem.
Architektura je pozoruhodná svou relativně malou sadou spravovaných služeb a svou idempotentní logikou prosazování. Každý běh Lambda přepočítá celý seznam omezených uživatelů z kumulativních denních výdajů, takže zmeškané nebo opakované spuštění nevyžaduje samostatnou cestu vrácení. Denní reset je také odvozen z časově ohraničeného pohledu Athena. AWS říká, že Lambda, DynamoDB a S3 stojí v případě použití Jamf výrazně pod 10 $ měsíčně pro stovky inženýrů, ale Athena označuje za hlavní variabilní náklady. Tento odhad je specifický pro nahlášené pracovní zatížení a konfiguraci, nejedná se o obecnou záruku nákladů.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Na co se dále dívat
Hlavními provozními riziky jsou změny cen, neúplné údaje o nákladech, limity verzí zásad, náklady na dotazy Athena a 15minutový cyklus vynucování. Organizace, které tento vzor převezmou, budou muset otestovat, jak rychle platí omezení, ověřit modelové oceňování, zachovat dostupný záložní model a řídit výjimky.
Největším technickým problémem jsou zdrojová data a cenová mapa. Protokoly základního kamene musí obsahovat dostatek informací o identitě a tokenech pro podporu vynucení a každý povolený model potřebuje aktuální regionální rychlost. AWS říká, že nezmapovaný model je oceněn na nejvyšší úrovni, aby se zabránilo novému modelu obcházet ovládací prvky, ale tato ochrana by mohla dočasně omezit uživatele, pokud nebude cenová větev aktualizována. Zdroj nepopisuje odsouhlasení s konečným účtem AWS, zacházení s refundacemi nebo kredity nebo jak je zpracováno použití z neúspěšných, opakovaných nebo uložených požadavků.
Návrh dotazu ovlivní náklady i včasnost. AWS hlásí, že čtyři různě filtrované dotazy ve stejném zobrazení JSON naskenovaly přibližně 11 GB, protože řádkově orientovaný JSON musí být před filtrováním deserializován. Doporučuje zkombinovat odvozené dotazy do jednoho seskupeného dotazu a oddělit výsledky v kódu aplikace nebo převést protokoly do sloupcového formátu, jako je například Parquet. Dotazy Athena jsou asynchronní, takže funkce Lambda je musí odeslat a vyzpovídat a mít dostatečně dlouhý časový limit na dokončení. Zdroj neposkytuje pozorovanou latenci end-to-end ani nezaručuje, že každé omezení se projeví během určitého počtu minut.
Správci budou muset prozkoumat řídicí rovinu stejně pečlivě jako výpočet nákladů. AWS říká, že spravované zásady si uchovávají maximálně pět verzí, což vyžaduje, aby funkce Lambda smazala nejstarší nevýchozí verzi před vytvořením nové. Výjimky také vytvářejí otázku řízení: návrh zaznamenává, kdo udělil zvýšený limit, a volitelně, který lístek jej povolil, ale zdroj neurčuje schvalovací role, maximální dobu trvání výjimky nebo kontrolní postupy. Budoucí hodnocení by se mělo zaměřit na zpoždění prosazování, selhání mapování identity, účinek substitucí modelu, přiměřenost záložního modelu a na to, zda kontroly vytvářejí slibovanou rovnováhu mezi předvídatelností nákladů a přístupem pro vývojáře.