기술 가이드

프롬프트 캐싱

프롬프트 캐싱을 사용하면 AI 모델이 매번 다시 처리하는 대신 반복되는 텍스트 덩어리에 대해 수행한 계산 작업을 재사용할 수 있습니다.

2분 읽기마지막 업데이트

개요

It dramatically cuts cost and latency when the same long instructions, documents, or examples appear in request after request.

심층 분석

언어 모델이 프롬프트를 읽으면 Attention 레이어를 통해 모든 토큰을 키-값(KV) 벡터라고 하는 내부 숫자 상태로 변환합니다. 일반적으로 이는 프롬프트의 90%가 동일하더라도 각 요청마다 새로 발생합니다. 프롬프트 캐싱은 표시된 접두사에 대해 미리 계산된 KV 상태를 저장하므로 동일한 텍스트로 시작하는 이후 요청은 새 부분으로 바로 건너뛸 수 있습니다. Anthropic 및 OpenAI과 같은 공급자는 안정적인 접두사에 플래그를 지정하여 이를 노출합니다. 캐시 적중은 대폭 할인된 가격(종종 입력 비용의 90% 할인)으로 청구되며 더 빠르게 응답합니다. 고정된 시스템 프롬프트가 있는 챗봇, 동일한 문서를 재사용하는 RAG 파이프라인 또는 긴 기록을 재생하는 에이전트에 이상적입니다.

기술적 통찰력

변환기 주의가 인과적이기 때문에 캐싱이 작동합니다. 즉, 각 토큰은 이전 토큰에만 주의를 기울입니다. 따라서 나중에 새 토큰을 추가할 때 접두사의 KV 상태는 변경되지 않습니다. 캐시는 해당 접두어의 정확한 토큰 대 토큰 일치에 맞춰져 있으므로 프롬프트 초기에 한 문자만 편집해도 모든 다운스트림이 무효화됩니다. 캐시는 수명이 짧고(분) 공급자별로 저장되며 캐시 가능한 블록은 일반적으로 최소 토큰 수를 초과해야 합니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

프롬프트 캐싱의 미래

공급자가 수동 마커를 요구하는 대신 재사용 가능한 범위를 감지하므로 캐싱이 자동으로 오래 지속됩니다. 계층적 및 부분적 캐싱을 통해 프롬프트 중간에 편집하여 양쪽에서 변경되지 않은 세그먼트를 재사용할 수 있습니다. 에이전트가 거대한 컨텍스트와 도구 기록을 저글링함에 따라 공통 시스템 프롬프트에 대한 세션 간 및 사용자 간 공유 캐시는 백만 개의 토큰 컨텍스트를 경제적으로 실행 가능하게 만드는 핵심이 될 것이며 온디바이스 모델은 빠른 로컬 추론을 위해 유사한 KV 재사용을 채택할 것입니다.

실제 구현

고객 지원 챗봇은 5,000개 토큰 정책과 톤 시스템 프롬프트를 캐시하므로 모든 사용자 메시지는 새 질문에 대해서만 전액을 지불합니다.

RAG(검색 증강) 앱은 대규모 참조 문서를 한 번 캐시한 다음 적은 비용으로 이에 대한 많은 질문에 답변합니다.

코딩 도우미는 개발자가 연속적인 후속 질문을 하는 동안 대규모 코드베이스 또는 파일의 내용을 고정 접두사로 캐시합니다.

AI 에이전트는 길고 증가하는 도구 사용 기록을 캐시하므로 각각의 새로운 단계에서 전체 이전 대화에 대해 다시 요금이 청구되지 않습니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt Caching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

AI 프롬프트 보안

자주 묻는 질문

What is Prompt Caching?

프롬프트 캐싱을 사용하면 AI 모델이 매번 다시 처리하는 대신 반복되는 텍스트 덩어리에 대해 수행한 계산 작업을 재사용할 수 있습니다. 동일한 긴 지침, 문서 또는 예제가 요청마다 나타날 때 비용과 대기 시간이 크게 줄어듭니다.

프롬프트 캐싱은 주로 무엇을 저장하고 재사용합니까?

캐싱은 안정적인 접두사에 대해 계산된 KV 주의 상태를 저장하므로 각 요청에서 다시 계산할 필요가 없습니다.

캐시된 접두사가 토큰과 정확히 일치해야 하는 이유는 무엇입니까?

각 토큰은 이전 토큰에만 참여하므로 초기 토큰을 변경하면 이에 의존하는 모든 상태가 무효화되어 캐시가 손상됩니다.

프롬프트 캐싱으로 인해 가장 큰 이점을 얻는 시나리오는 무엇입니까?

캐싱은 고정 시스템 프롬프트 또는 공유 문서와 ​​같은 많은 요청에서 크고 동일한 청크가 재사용될 때 효과가 있습니다.

주요 공급자의 입력 토큰에 대한 캐시 적중이 대략 얼마나 저렴합니까?

공급자는 일반적으로 캐시된 입력에 대해 일반 입력 속도보다 약 90% 할인된 요금을 청구하는데, 이는 캐싱이 비용을 절약하는 주된 이유입니다.

캐시 적중률을 최대화하려면 재사용 가능한 콘텐츠를 어디에 배치해야 합니까?

안정적인 콘텐츠를 먼저 접두사로 배치하고 나중에 콘텐츠를 변경하면 새 토큰만 처리되는 동안 캐시된 접두사를 재사용할 수 있습니다.