개요
매번 문서를 다시 읽는 것보다 빠르게 응답하면서 검색 오류 및 색인 유지 관리를 제거하므로 작고 안정적인 말뭉치에 중요합니다.
심층 분석
캐시 확장 생성(CAG)은 검색 단계를 사전 로드로 대체합니다. 각 질문에 대해 지식 기반을 검색하는 대신 시스템은 전체 지식 기반을 모델에 한 번 제공하고 결과 키-값(KV) 캐시를 저장하며 모든 후속 쿼리에 해당 캐시를 재사용합니다. 이 접근 방식은 Don't Do RAG: When Cache-Augmented Generation is All You Need for Knowledge Tasks라는 제목의 2024년 12월 논문에 설명되어 있습니다. KV 캐시는 변환기가 읽은 모든 토큰에 대해 계산하는 중간 주의 키 및 값 세트입니다. 일반적으로 단일 요청 중에 빌드되고 삭제됩니다. CAG에서는 문서가 미리 처리되고 캐시가 저장되며 각 질문은 캐시된 접두사 뒤에 추가됩니다. 모델은 생성하기 전에 새 질문 토큰만 계산하므로 매번 문서를 다시 읽는 것보다 답변이 더 빨리 시작됩니다. 응답 후에는 추가된 토큰이 잘려서 캐시가 다음 쿼리에 대해 문서 전용 상태로 돌아갑니다. 이점은 모든 문서가 항상 존재하기 때문에 검색 오류가 없고, 유지 관리할 임베딩 인덱스나 벡터 데이터베이스가 없으며, 순진한 긴 컨텍스트보다 쿼리당 대기 시간이 짧다는 것입니다. 제한은 직접적으로 따릅니다. 전체 코퍼스는 모델의 컨텍스트 창에 맞아야 하고, 모델은 여전히 많은 텍스트에 대해 잘 추론해야 하며, 문서에 대한 변경 사항은 캐시를 다시 작성하는 것을 의미합니다. 따라서 CAG는 제품 매뉴얼, 정책 세트, 강의 계획서 또는 고정 규제 텍스트와 같은 작고 안정적인 지식 기반에 적합합니다. 규모가 크고 빠르게 변경되거나 권한이 필터링된 컬렉션에는 적합하지 않습니다. 일반적인 오해는 CAG가 모델을 학습시킨다는 것입니다. 미세 조정된 것은 없습니다. 가중치는 변경되지 않습니다. API 제공업체의 상업용 프롬프트 캐싱은 동일한 아이디어의 호스팅 친척입니다.
전략적 영향
비용 및 예산
아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.
더 명확한 결정들
기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.
품질 관리
더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.
캐시 증강 세대(CAG)의 미래
CAG의 실제 범위는 컨텍스트 창이 길어지고 KV 캐시 압축이 향상됨에 따라 증가하지만 메모리와 매우 긴 입력에 대한 모델 추론의 정도에 따라 제한됩니다. 하이브리드 디자인은 자연스러운 다음 단계입니다. 자주 필요한 문서의 안정적인 코어를 캐시하고 필요에 따라 롱테일을 검색하는 것입니다. 캐시 압축에 대한 연구, 저렴한 스토리지로 캐시 오프로드, 보관할 토큰 선택을 통해 미리 로드된 더 큰 말뭉치를 실행할 수 있게 만들 수 있습니다. 현재 합리적인 테스트는 경험적입니다. CAG, RAG 및 일반 긴 컨텍스트를 자신의 질문, 비용 및 업데이트 빈도와 비교하십시오.
실제 구현
60페이지 분량의 직원 핸드북을 보유한 회사는 이를 개방형 모델의 KV 캐시에 미리 로드하므로 모든 HR 질문에 전체 핸드북이 제공되고 유지 관리할 벡터 데이터베이스가 없어 답변됩니다.
소프트웨어 공급업체는 지원 보조자를 위해 제품 매뉴얼을 캐시하고 새 매뉴얼 버전이 출시될 때만 캐시를 재구축합니다.
강사는 강의 계획서와 강의 노트를 미리 로드하므로 학습 조교가 학기 내내 학생의 질문에 신속하게 답변할 수 있습니다.
규정 준수 팀은 호스팅된 API의 프롬프트 캐싱을 사용하여 고정된 규정 텍스트를 캐시된 접두사로 유지하고 여러 질문에 대한 반복 읽기에 대해 할인된 요금을 지불합니다.
위험 및 가드레일
하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.
인프라 및 유지 관리 비용은 종종 과소평가됩니다.
시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.
구현 로드맵
구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.
현실적인 로드 및 데이터 조건에서 벤치마킹합니다.
오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.
확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Cache-Augmented Generation (CAG) quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
자주 묻는 질문
CAG(캐시 증강 세대)란 무엇입니까?
CAG(캐시 증대 생성)는 전체 고정 지식 기반을 언어 모델의 키-값(KV) 캐시에 한 번 미리 로드하고 RAG처럼 쿼리별로 문서를 검색하는 대신 모든 질문에 대해 해당 캐시를 재사용합니다. 매번 문서를 다시 읽는 것보다 빠르게 응답하면서 검색 오류 및 색인 유지 관리를 제거하므로 작고 안정적인 말뭉치에 중요합니다.
CAG는 쿼리별 검색 대신 무엇을 사용합니까?
CAG는 코퍼스에 대한 KV 캐시를 미리 계산하여 모든 쿼리에 재사용합니다.
변압기의 KV 캐시는 무엇입니까?
Attention 레이어의 키와 값은 캐시되므로 이전 토큰을 다시 계산할 필요가 없습니다.
CAG 시스템이 각 답변 후에 캐시를 자르는 이유는 무엇입니까?
추가된 토큰을 제거하면 캐시가 다음 질문에 대해 미리 로드된 깨끗한 상태로 재설정됩니다.
CAG의 주요 한계는 무엇입니까?
모든 문서가 미리 로드되어 있기 때문에 코퍼스는 컨텍스트 창과 사용 가능한 메모리로 제한됩니다.
CAG가 모든 요청에 문서를 붙여넣는 것보다 더 빨리 응답하는 이유는 무엇입니까?
문서의 계산은 이미 완료되어 저장되어 있으므로 쿼리별로 질문만 처리됩니다.
계속 학습하세요
관련 가이드
이 주제에 대해 선택된 추가 가이드