투기적 스트리밍 및 다중 토큰 예측
추측 스트리밍 및 다중 토큰 예측은 한 번에 하나의 토큰을 생성하는 대신 여러 미래 토큰을 한 번에 추측하고 단일 패스로 확인함으로써 언어 모델 생성 속도를 높입니다.
개요
They cut latency without changing the text the model would have written.
심층 분석
일반적인 자동회귀 디코딩은 각 토큰이 전체 순방향 패스를 필요로 하고 토큰이 순차적으로 엄격하게 생성되어 GPU가 충분히 사용되지 않기 때문에 느립니다. 추측적 디코딩은 후보 토큰 덩어리를 제안하는 저렴한 초안 작성자를 통해 이 문제를 해결합니다. 그러면 대규모 대상 모델이 병렬로 이를 확인합니다. 대상이 생성한 것과 일치하는 접두사는 무료로 허용되며 첫 번째 불일치가 수정됩니다. 추측 스트리밍 및 메두사 스타일 멀티 토큰 예측은 드래프터를 모델 자체로 접습니다. 초경량 예측 헤드(또는 추측 토큰 스트림)를 사용하면 별도의 초안 모델을 피하면서 하나의 모델 초안 및 검증을 모두 수행할 수 있습니다. 검증이 정확하고 출력 분포가 표준 디코딩과 동일하므로 순차 단계가 2~3배 더 적습니다.
기술적 통찰력
핵심은 변환기가 디코딩 중에 컴퓨팅 경계가 아닌 메모리 대역폭 경계이기 때문에 하나의 순방향 패스에서 많은 위치를 하나만큼 저렴하게 채점할 수 있다는 것입니다. 여러 예측 헤드는 다음 여러 위치에 대한 후보 토큰을 방출합니다. 후보의 트리 또는 시퀀스가 함께 검증되고 승인은 거부 샘플링(또는 탐욕스러운 일치)을 사용하므로 승인된 토큰은 정확한 목표 분포를 따릅니다. 단계당 허용되는 길이에 따라 속도 향상이 결정됩니다.
전략적 영향
비용 및 예산
아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.
더 명확한 결정들
기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.
품질 관리
더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.
투기적 스트리밍과 멀티 토큰 예측의 미래
별도의 초안 모델이 필요하지 않은 자체 추측 방법이 추론 엔진의 기본값이 되고 있으며, 연구에서는 더 나은 초안 헤드, 트리 구조의 후보, 멀티 토큰 예측을 위한 기본 모델 공동 교육(품질도 향상시킬 수 있음)을 통해 수용률을 더 높이고 있습니다. 이러한 기술이 양자화 및 일괄 처리와 결합되어 모델이 성장하는 동안에도 대화형 보조자가 즉각적인 느낌을 받을 수 있습니다.
실제 구현
Medusa 스타일의 추가 예측 헤드를 사용하여 채팅 도우미의 응답 대기 시간을 2~3배 단축
별도의 초안 모델을 호스팅할 필요가 없도록 추론 서버에 자체 추측 디코딩을 추가합니다.
길고 예측 가능한 토큰 실행이 큰 덩어리로 허용되는 코드 완성 속도 향상
각 메모리 바인딩 정방향 패스에서 더 많은 토큰을 추출하여 요청당 GPU 비용을 줄입니다.
위험 및 가드레일
하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.
인프라 및 유지 관리 비용은 종종 과소평가됩니다.
시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.
구현 로드맵
구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.
현실적인 로드 및 데이터 조건에서 벤치마킹합니다.
오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.
확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Streaming and Multi-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
멀티 토큰 예측 훈련
자주 묻는 질문
What is Speculative Streaming and Multi-Token Prediction?
추측 스트리밍 및 다중 토큰 예측은 한 번에 하나의 토큰을 생성하는 대신 여러 미래 토큰을 한 번에 추측하고 단일 패스로 확인함으로써 언어 모델 생성 속도를 높입니다. 모델이 작성한 텍스트를 변경하지 않고 대기 시간을 줄였습니다.
GPU에서 표준 자동 회귀 디코딩이 종종 느린 이유는 무엇입니까?
각 토큰에는 자체 순방향 패스가 필요하며 엄격하게 순차적이므로 GPU는 메모리 대역폭에 제한이 있고 디코딩 중에 활용도가 낮습니다.
추측적 디코딩에서 '작성자'는 무엇을 합니까?
값싼 초안 작성자는 대규모 대상 모델이 병렬로 확인할 후보 토큰 덩어리를 제안합니다.
추측적 디코딩에서 출력 품질은 어떻게 유지됩니까?
검증(탐욕스러운 일치 또는 거부 샘플링)은 허용된 토큰이 대상 모델이 생성한 정확한 분포를 따르도록 보장하므로 출력은 변경되지 않습니다.
메두사 스타일의 다중 토큰 예측과 고전적인 추측 디코딩의 차이점은 무엇입니까?
Medusa 스타일 방법은 별도의 초안 모델을 호스팅할 필요가 없도록 추가 예측 헤드가 있는 모델에 제도를 접습니다.
변환기가 디코딩 중에 하나만큼 저렴하게 많은 후보 위치를 확인할 수 있는 이유는 무엇입니까?
디코딩하는 동안 병목 현상은 메모리에서 가중치를 이동하므로 동일한 패스에서 추가 위치를 획득하면 컴퓨팅 비용이 거의 추가되지 않습니다.