คู่มือทางเทคนิค

การแคชพร้อมท์

การแคชทันทีช่วยให้โมเดล AI นำงานการคำนวณที่เคยทำกับข้อความซ้ำๆ มาใช้ซ้ำ แทนที่จะประมวลผลใหม่ทุกครั้ง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It dramatically cuts cost and latency when the same long instructions, documents, or examples appear in request after request.

เจาะลึก

เมื่อโมเดลภาษาอ่านข้อความแจ้งเตือน โมเดลภาษาจะแปลงทุกโทเค็นให้เป็นสถานะตัวเลขภายในที่เรียกว่าเวกเตอร์คีย์-ค่า (KV) ผ่านเลเยอร์ความสนใจ โดยปกติสิ่งนี้จะเกิดขึ้นใหม่ในแต่ละคำขอ แม้ว่า 90% ของข้อความแจ้งจะเหมือนกันก็ตาม การแคชพร้อมต์จะจัดเก็บสถานะ KV ที่คำนวณไว้ล่วงหน้าเหล่านั้นไว้สำหรับคำนำหน้าที่ทำเครื่องหมายไว้ ดังนั้นคำขอในภายหลังที่ขึ้นต้นด้วยข้อความเดียวกันจึงสามารถข้ามไปยังส่วนใหม่ได้โดยตรง ผู้ให้บริการเช่น Anthropic และ OpenAI เปิดเผยสิ่งนี้โดยให้คุณตั้งค่าสถานะคำนำหน้าที่มั่นคง การเข้าถึงแคชจะถูกเรียกเก็บเงินโดยมีส่วนลดสูง (มักจะหักต้นทุนอินพุต 90%) และตอบสนองเร็วขึ้น เหมาะอย่างยิ่งสำหรับแชทบอทที่มีการแจ้งของระบบแบบคงที่ ไปป์ไลน์ RAG การนำเอกสารเดิมมาใช้ซ้ำ หรือตัวแทนที่เล่นซ้ำประวัติอันยาวนาน

ข้อมูลเชิงลึกทางเทคนิค

การแคชทำงานเนื่องจากความสนใจของหม้อแปลงเป็นสาเหตุ: แต่ละโทเค็นจะสนใจโทเค็นที่อยู่ก่อนหน้าเท่านั้น ดังนั้นสถานะ KV สำหรับคำนำหน้าจะไม่เปลี่ยนแปลงเมื่อคุณเพิ่มโทเค็นใหม่ในภายหลัง แคชถูกคีย์ไว้ในการจับคู่โทเค็นต่อโทเค็นของคำนำหน้านั้นทุกประการ ซึ่งเป็นสาเหตุที่แม้แต่การแก้ไขด้วยอักขระตัวเดียวในช่วงต้นของพรอมต์ก็ทำให้ทุกอย่างดาวน์สตรีมเป็นโมฆะ แคชมีอายุสั้น (นาที) โดยจัดเก็บตามผู้ให้บริการ และโดยปกติบล็อกที่แคชได้จะต้องเกินจำนวนโทเค็นขั้นต่ำ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการแคชพร้อมท์

คาดหวังว่าแคชจะกลายเป็นอัตโนมัติและใช้งานได้ยาวนานขึ้น โดยผู้ให้บริการจะตรวจพบช่วงที่นำมาใช้ซ้ำได้ แทนที่จะต้องใช้เครื่องหมายด้วยตนเอง การแคชแบบลำดับชั้นและบางส่วนอาจทำให้การแก้ไขระหว่างพร้อมท์นำส่วนที่ไม่เปลี่ยนแปลงกลับมาใช้ใหม่ในด้านใดด้านหนึ่ง ในขณะที่เอเจนต์ต้องจัดการบริบทขนาดใหญ่และประวัติเครื่องมือ แคชที่แชร์ระหว่างเซสชันและผู้ใช้ข้ามรายสำหรับการแจ้งเตือนของระบบทั่วไปจะเป็นกุญแจสำคัญในการทำให้บริบทโทเค็นนับล้านมีความเป็นไปได้ในเชิงเศรษฐกิจ และโมเดลบนอุปกรณ์จะนำ KV ที่คล้ายกันมาใช้ซ้ำเพื่อการอนุมานภายในที่รวดเร็ว

การใช้งานจริงในโลกแห่งความเป็นจริง

แชทบอทฝ่ายสนับสนุนลูกค้าแคชนโยบาย 5,000 โทเค็นและระบบโทนเสียง ดังนั้นทุกข้อความของผู้ใช้จะจ่ายราคาเต็มสำหรับคำถามใหม่เท่านั้น

แอปดึงข้อมูลเสริม (RAG) แคชเอกสารอ้างอิงขนาดใหญ่เพียงครั้งเดียว จากนั้นตอบคำถามมากมายเกี่ยวกับเอกสารดังกล่าวโดยมีค่าใช้จ่ายเพียงเล็กน้อย

ผู้ช่วยเขียนโค้ดแคชเนื้อหาของฐานข้อมูลหรือไฟล์ขนาดใหญ่เป็นคำนำหน้าคงที่ ในขณะที่นักพัฒนาถามคำถามต่อเนื่องกัน

ตัวแทน AI แคชบันทึกการใช้เครื่องมือที่ยาวและเพิ่มขึ้น ดังนั้นแต่ละขั้นตอนใหม่จะไม่เรียกเก็บเงินซ้ำสำหรับการสนทนาก่อนหน้าทั้งหมด

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt Caching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

AI พร้อมท์การรักษาความปลอดภัย

คำถามที่พบบ่อย

What is Prompt Caching?

การแคชทันทีช่วยให้โมเดล AI นำงานการคำนวณที่เคยทำกับข้อความซ้ำๆ มาใช้ซ้ำ แทนที่จะประมวลผลใหม่ทุกครั้ง ช่วยลดต้นทุนและเวลาแฝงได้อย่างมากเมื่อมีคำสั่ง เอกสาร หรือตัวอย่างที่ยาวเหมือนกันปรากฏในคำขอครั้งแล้วครั้งเล่า

การแคชพร้อมท์จะจัดเก็บและนำมาใช้ซ้ำเป็นหลักอย่างไร

การแคชจะบันทึกสถานะความสนใจของ KV ที่คำนวณสำหรับคำนำหน้าที่เสถียร ดังนั้นจึงไม่จำเป็นต้องคำนวณใหม่ในแต่ละคำขอ

เหตุใดคำนำหน้าแคชจึงต้องตรงกันทุกประการ โทเค็นสำหรับโทเค็น

เนื่องจากแต่ละโทเค็นเข้าร่วมกับโทเค็นรุ่นก่อนหน้าเท่านั้น การเปลี่ยนโทเค็นในช่วงแรกจะทำให้ทุกสถานะที่ขึ้นอยู่กับโทเค็นนั้นใช้ไม่ได้ และทำให้แคชเสียหาย

สถานการณ์ใดที่ได้ประโยชน์มากที่สุดจากการแคชพร้อมท์

การแคชจะให้ผลตอบแทนที่ดีเมื่อมีการนำก้อนข้อมูลขนาดใหญ่และเหมือนกันมาใช้ซ้ำกับคำขอต่างๆ มากมาย เช่น พรอมต์ของระบบแบบตายตัวหรือเอกสารที่แชร์

การที่แคชเข้าถึงโทเค็นอินพุตกับผู้ให้บริการรายใหญ่จะมีราคาถูกกว่าประมาณเท่าใด

ผู้ให้บริการมักจะเรียกเก็บเงินอินพุตที่แคชไว้ประมาณ 90% จากอัตราการป้อนข้อมูลปกติ เหตุผลหลักที่แคชช่วยประหยัดเงิน

ควรวางเนื้อหาที่นำมาใช้ซ้ำได้ที่ไหนเพื่อเพิ่มการเข้าถึงแคชให้สูงสุด

การใส่เนื้อหาที่เสถียรไว้เป็นคำนำหน้าเป็นอันดับแรก และเนื้อหาที่เปลี่ยนแปลงหลังจากนั้นจะทำให้คำนำหน้าแคชสามารถนำมาใช้ซ้ำได้ในขณะที่ประมวลผลโทเค็นใหม่เท่านั้น