กลับไปที่ข่าว
องค์กรAI Understanding บรรยายสรุป

AWS ให้รายละเอียดการควบคุมการใช้จ่ายแบบเรียลไทม์ของ Jamf สำหรับ Amazon Bedrock

Jamf ได้สร้างระบบที่ติดตามการใช้งาน Bedrock รายวันของวิศวกร และจำกัดการเข้าถึงโมเดลราคาแพงอย่างต่อเนื่องเมื่อผู้ใช้เข้าใกล้งบประมาณส่วนบุคคล

5 min readRead the primary source
Source-provided image accompanying AWS details Jamf’s near-real-time spending controls for Amazon Bedrock
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
aws.amazon.com
ลิงค์แหล่งที่มา
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/tokenomics-at-scale-how-jamf-built-real-time-spend-enforcement-for-amazon-bedrock/
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

เวลาแฝง
เวลาระหว่างการส่งคำขอและรับเอาต์พุตของโมเดล
โทเค็น
กลุ่มข้อความที่ประมวลผลโดยโมเดลภาษา เช่น ชิ้นส่วนคำหรือสัญลักษณ์
ทดสอบตัวเองแบบทดสอบตัวแทน AI

เกิดอะไรขึ้น

AWS กล่าวว่า Jamf ได้สร้างและทดสอบระบบไร้เซิร์ฟเวอร์สำหรับการตรวจสอบและบังคับใช้ขีดจำกัดการใช้จ่ายของ Amazon Bedrock ต่อผู้ใช้ ระบบใช้บันทึกการเรียกใช้ Bedrock, Amazon Athena, DynamoDB, AWS Lambda, กำหนดการ EventBridge, นโยบายที่จัดการโดยลูกค้า IAM และการแจ้งเตือน Slack

ในโพสต์ลงวันที่ 1 กันยายน 2026 AWS อธิบายว่า Jamf จัดการกับค่าใช้จ่ายในการเข้าถึง Amazon Bedrock สำหรับองค์กรด้านวิศวกรรมในวงกว้างได้อย่างไร AWS กล่าวว่า Jamf ซึ่งอธิบายว่าให้บริการองค์กรมากกว่า 76,000 แห่งด้วยผลิตภัณฑ์การจัดการอุปกรณ์และการรักษาความปลอดภัย Apple ได้ขยายการเข้าถึง Bedrock เพื่อรองรับการพัฒนาที่ได้รับความช่วยเหลือจาก AI บริษัทจึงจำเป็นต้องมีการมองเห็นและความรับผิดชอบต่อผู้ใช้เมื่อมีการใช้งานเพิ่มขึ้น โพสต์นี้นำเสนอการใช้งานของ Jamf เป็นรูปแบบที่ผ่านการทดสอบแล้วแทนที่จะเป็นโมเดล Bedrock ใหม่ หรือการเปลี่ยนแปลงราคาสาธารณะของ Bedrock

ระบบจะวัดการใช้จ่าย Bedrock รายวันของวิศวกรแต่ละคนจากบันทึกการเรียกใช้ที่เขียนลงในบัคเก็ต Amazon S3 บันทึกเหล่านั้นรวมถึงตัวระบุโมเดล จำนวนโทเค็นอินพุตและเอาต์พุต และข้อมูลประจำตัวผู้ใช้ มุมมอง Amazon Athena คำนวณการใช้จ่ายรายวันโดยใช้อัตรา Bedrock ที่เผยแพร่กับจำนวนโทเค็นเหล่านั้น AWS แนะนำให้ผู้ใช้อัปเดตมุมมองสำหรับอัตราในภูมิภาคของตน และเพิ่มสาขาการกำหนดราคาที่ชัดเจนทุกครั้งที่เปิดใช้งานโมเดลใหม่ รุ่นที่ไม่รู้จักจะถูกกำหนดระดับสูงสุดเป็นรุ่นที่ป้องกันข้อผิดพลาดจนกว่าจะมีการเพิ่มอัตราตามจริง

ฟังก์ชัน AWS Lambda จะทำงานทุกๆ 15 นาทีผ่านกำหนดการ Amazon EventBridge โดยจะอ่านการใช้จ่ายของวันปัจจุบันจาก Athena ตรวจสอบตาราง DynamoDB เพื่อดูข้อยกเว้นที่ได้รับอนุมัติ และรักษาสถานะผู้ใช้ ดังนั้นการแจ้งเตือนเกณฑ์แต่ละรายการจะถูกส่งเพียงครั้งเดียว เมื่อผู้ใช้เกินเกณฑ์ ฟังก์ชันจะเผยแพร่เวอร์ชันใหม่ของนโยบายที่จัดการโดยลูกค้า IAM นโยบายนี้ใช้ค่าประจำตัว saml:sub ของผู้ใช้เพื่อปฏิเสธการเข้าถึงตระกูลโมเดลที่ระบุ AWS กล่าวว่านโยบายที่แก้ไขได้รับการประเมินในการเรียก Bedrock ครั้งถัดไปของวิศวกร และไม่จำเป็นต้องมีการตรวจสอบสิทธิ์ซ้ำ

รูปแบบการบังคับใช้ตัวอย่างช่วยให้โมเดลที่มีราคาต่ำกว่าพร้อมใช้งานในขณะเดียวกันก็จำกัดโมเดลที่มีราคาแพงกว่าในระดับการใช้จ่ายที่สูงขึ้นเรื่อยๆ AWS ให้การกำหนดค่าที่แสดงให้เห็นโดยที่การเข้าถึง Claude Opus ถูกปฏิเสธที่ 80% ของงบประมาณรายวัน และ Claude Sonnet ที่ 100% ในขณะที่ Claude Haiku ยังคงใช้งานได้ คำสั่ง Slack slash /bedrock-limit ช่วยให้ผู้ดูแลระบบที่ได้รับอนุญาตมอบขีดจำกัดที่สูงกว่าแบบกล่องเวลาสำหรับกรณีต่างๆ เช่น การย้าย การยกระดับลูกค้า หรือการประเมินแบบจำลอง บันทึกข้อยกเว้นประกอบด้วยเวลาหมดอายุและข้อมูลการตรวจสอบ และ DynamoDB TTL จะใช้เพื่อลบรายการที่หมดอายุโดยอัตโนมัติ

รายละเอียดที่มา: aws.amazon.com ↗

ทำไมมันถึงสำคัญ

แนวทางดังกล่าวระบุถึงอุปสรรคในทางปฏิบัติต่อการนำ AI มาใช้ในระดับองค์กร โดยต้นทุนของโมเดลอาจแตกต่างกันไปตามพฤติกรรมของผู้ใช้และปริมาณงานเอเจนต์ ทำให้ยากต่อการคาดเดาการใช้จ่าย การออกแบบของ Jamf นำเสนอวิธีการขยายการเข้าถึงโดยยังคงรักษาการมองเห็นในระดับผู้ใช้และการควบคุมแบบไล่ระดับ แม้ว่าแหล่งที่มาจะไม่มีการวัดผลที่เพิ่มขึ้นหรือผลตอบแทนจากการลงทุนโดยอิสระก็ตาม

ประเด็นในทางปฏิบัติคือต้นทุน generative-AI นั้นขึ้นอยู่กับพฤติกรรม นักพัฒนาที่ใช้ลูปการเข้ารหัสแบบเอเจนต์แบบขยายสามารถสร้างการใช้งานโทเค็นได้มากกว่าปริมาณงานการประมวลผลแบบทั่วไปที่จัดเตรียมไว้ที่แนะนำ ขีดจำกัดต่อผู้ใช้ทำให้องค์กรมีวิธีในการเชื่อมต่อการใช้งานกับข้อมูลประจำตัวและกรอบเวลา แทนที่จะรอการเรียกเก็บเงินรวมจากระบบคลาวด์ สิ่งนี้มีความเกี่ยวข้องอย่างยิ่งเมื่อโมเดลพรีเมียมมีอัตราที่แตกต่างกันอย่างมาก หรือเมื่อเวิร์กโฟลว์อัตโนมัติสามารถโทรซ้ำโดยไม่ต้องมีเจ้าหน้าที่ตรวจสอบทุกขั้นตอน

การออกแบบยังถือว่าการควบคุมต้นทุนเป็นปัญหาในการใช้งานและการจัดการการเข้าถึง แทนที่จะหยุดการเข้าถึง Bedrock ทั้งหมดหลังจากถึงงบประมาณ ระบบจะใช้ข้อจำกัดเฉพาะรุ่นและคงทางเลือกสำรองที่ถูกกว่าไว้ ซึ่งสามารถลดผลกระทบในการปฏิบัติงานของฝาปิดได้ แต่ไม่รับประกันว่างานจะดำเนินต่อไปด้วยคุณภาพหรือความเร็วเท่าเดิม แหล่งที่มาไม่ได้รายงานว่าวิศวกร Jamf กี่คนใช้ระบบ เกณฑ์ตามจริงของบริษัท จำนวนที่ใช้ก่อนและหลังการปรับใช้งาน หรือประสิทธิภาพการผลิตที่วัดได้และผลลัพธ์ ROI คำแถลงของ AWS ที่ว่าประสิทธิภาพการทำงานเพิ่มขึ้นและการกำกับดูแลทำให้มีการเข้าถึงที่กว้างขึ้นยังคงเป็นบัญชีบริษัท ไม่ใช่ผลลัพธ์ที่ได้รับการตรวจสอบโดยอิสระ

สถาปัตยกรรมนี้มีความโดดเด่นในด้านบริการที่ได้รับการจัดการที่ค่อนข้างเล็กและตรรกะการบังคับใช้แบบเดิม การเรียกใช้ Lambda แต่ละครั้งจะคำนวณรายชื่อผู้ใช้ที่ถูกจำกัดทั้งหมดใหม่จากการใช้จ่ายรายวันสะสม ดังนั้นการเรียกใช้ที่พลาดหรือซ้ำไม่จำเป็นต้องมีเส้นทางย้อนกลับแยกต่างหาก การรีเซ็ตรายวันยังมาจากมุมมอง Athena แบบจำกัดเวลาอีกด้วย AWS กล่าวว่า Lambda, DynamoDB และ S3 มีราคาต่ำกว่า 10 ดอลลาร์ต่อเดือนสำหรับวิศวกรหลายร้อยคนในกรณีการใช้งานของ Jamf แต่ระบุว่า Athena เป็นต้นทุนผันแปรหลัก การประมาณการนั้นเฉพาะเจาะจงกับปริมาณงานและการกำหนดค่าที่รายงาน ไม่ใช่การรับประกันต้นทุนทั่วไป

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

จะดูอะไรต่อไป.

ความเสี่ยงในการดำเนินงานหลัก ได้แก่ การเปลี่ยนแปลงราคา ข้อมูลต้นทุนที่ไม่สมบูรณ์ ขีดจำกัดเวอร์ชันนโยบาย ค่าใช้จ่ายในการสืบค้น Athena และรอบการบังคับใช้ 15 นาที องค์กรที่ใช้รูปแบบนี้จะต้องทดสอบว่าข้อจำกัดต่างๆ มีผลเร็วเพียงใด ตรวจสอบการกำหนดราคาแบบจำลอง รักษาแบบจำลองสำรองที่เหมาะสม และควบคุมข้อยกเว้น

ข้อกังวลทางเทคนิคที่ใหญ่ที่สุดคือข้อมูลต้นฉบับและแผนที่ราคา บันทึก Bedrock จะต้องมีข้อมูลประจำตัวและโทเค็นเพียงพอที่จะสนับสนุนการบังคับใช้ และทุกรุ่นที่เปิดใช้งานจะต้องมีอัตราระดับภูมิภาคในปัจจุบัน AWS กล่าวว่าโมเดลที่ไม่ได้แมปมีราคาอยู่ที่ระดับสูงสุดเพื่อป้องกันไม่ให้โมเดลใหม่ผ่านการควบคุม แต่การป้องกันดังกล่าวอาจจำกัดผู้ใช้ชั่วคราว หากสาขาการกำหนดราคาไม่ได้รับการอัปเดต แหล่งที่มาไม่ได้อธิบายการกระทบยอดกับการเรียกเก็บเงิน AWS สุดท้าย การคืนเงินหรือเครดิต หรือวิธีจัดการการใช้งานจากคำขอที่ล้มเหลว ลองใหม่ หรือแคชไว้

การออกแบบแบบสอบถามจะส่งผลต่อทั้งต้นทุนและความทันเวลา AWS รายงานว่าเคียวรีสี่เคียวรีที่ถูกกรองต่างกันบนมุมมอง JSON เดียวกัน แต่ละเคียวรีสแกนประมาณ 11 GB เนื่องจาก JSON เชิงแถวจะต้องถูกดีซีเรียลไลซ์ก่อนที่จะกรอง ขอแนะนำให้รวมการสืบค้นที่ได้รับมาเป็นการสืบค้นแบบกลุ่มเดียว และแยกผลลัพธ์ออกเป็นโค้ดแอปพลิเคชัน หรือแปลงบันทึกเป็นรูปแบบคอลัมน์ เช่น Parquet การสืบค้น Athena เป็นแบบอะซิงโครนัส ดังนั้นฟังก์ชัน Lambda จึงต้องส่งและสำรวจแบบสอบถามและมีเวลานอกนานพอที่จะดำเนินการให้เสร็จสิ้น แหล่งที่มาไม่ได้ให้เวลาแฝงตั้งแต่ต้นทางถึงปลายทางที่สังเกตได้ หรือรับประกันว่าทุกข้อจำกัดจะมีผลภายในจำนวนนาทีที่กำหนด

ผู้ดูแลระบบจะต้องตรวจสอบระนาบควบคุมอย่างรอบคอบเช่นเดียวกับการคำนวณต้นทุน AWS กล่าวว่านโยบายที่ได้รับการจัดการจะรักษาเวอร์ชันได้สูงสุดห้าเวอร์ชัน โดยกำหนดให้ฟังก์ชัน Lambda ลบเวอร์ชันที่ไม่ใช่เวอร์ชันเริ่มต้นที่เก่าที่สุดก่อนที่จะสร้างเวอร์ชันใหม่ ข้อยกเว้นยังสร้างคำถามด้านการควบคุมดูแล: บันทึกการออกแบบที่ได้รับขีดจำกัดที่เพิ่มขึ้น และ (ทางเลือก) ตั๋วใดที่อนุญาต แต่แหล่งที่มาไม่ได้ระบุบทบาทการอนุมัติ ระยะเวลาข้อยกเว้นสูงสุด หรือขั้นตอนการตรวจสอบ การประเมินในอนาคตควรมุ่งเน้นไปที่ความล่าช้าในการบังคับใช้ ความล้มเหลวในการแมปข้อมูลระบุตัวตน ผลกระทบของการทดแทนโมเดล ความเพียงพอของโมเดลทางเลือก และการควบคุมจะสร้างความสมดุลตามที่สัญญาไว้ระหว่างความสามารถในการคาดการณ์ต้นทุนและการเข้าถึงของนักพัฒนาหรือไม่

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ตัวแทนเอไออธิบายโมเดล AIอนาคตของ AIPrompt Engineeringทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการระดมทุนของ AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?