뉴스로 돌아가기
혁신AI Understanding 브리핑

90% 적은 시각적 토큰으로 비디오 AI 정확도를 보존하는 종이 보고서

새로운 arXiv 사전 인쇄에서는 공격적인 시각적 토큰 압축 후 비디오 비전 언어 모델의 의미적 동작을 유지하기 위한 미세 조정 방법인 토큰 예산 증류를 제안합니다.

6 min readRead the primary source
Source-provided image accompanying Paper reports preserving video AI accuracy with 90% fewer visual tokens
기본 소스 문서녹음된 소스
출판사
arxiv.org
소스 링크
arxiv.orghttps://arxiv.org/abs/2608.28138
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

비전-언어 모델(VLM)
시각적 정보와 텍스트 정보를 공동으로 처리하는 다중 모드 모델입니다.
LoRA(낮은 순위 적응)
낮은 순위의 어댑터 행렬을 추가하는 매개변수 효율적인 미세 조정 방법입니다.
지식 증류
더 큰 모델의 출력을 모방하기 위해 더 작은 모델을 훈련합니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

연구원들은 고정된 토큰 예산 하에서 비디오 비전 언어 모델을 적용하기 위한 매개변수 효율적인 방법인 토큰 예산 증류(TBD)를 제안합니다. 이 접근 방식은 전체 토큰 교사 모델을 사용하여 LoRA 어댑터만 업데이트하면서 압축된 학생 모델을 감독합니다.

2026년 8월 28일에 제출된 arXiv 논문에서는 비디오 비전 언어 모델을 위한 토큰 예산 증류를 소개합니다. 저자는 핵심 문제를 계산 효율성과 의미 충실도 간의 균형으로 설명합니다. 비디오 입력은 많은 시각적 토큰을 생성하는 반면 이러한 토큰을 압축하면 적응된 모델이 원래 전체 토큰 시스템의 동작에서 벗어날 수 있습니다. 제안된 방법은 단순히 압축된 입력에 대해 직접 미세 조정하는 것이 아니라 고정된 토큰 예산 하에서 작동하도록 설계되었습니다. 이러한 프레이밍은 해당 방법이 기존 모델에 대한 적응 절차로 제시되고 토큰 예산이 훈련을 형성하는 제약 조건으로 처리됨을 의미합니다. 따라서 제공된 설명은 새로운 비디오 인코더나 새로운 작업별 애플리케이션을 설명하기보다는 교사와 학생이 서로 관련하여 훈련받는 방법을 강조합니다.

TBD는 사전 훈련된 모델 백본을 동결하고 LoRA 어댑터만 업데이트합니다. 이 논문에서는 이를 매개변수 효율적인 적응 전략으로 제시합니다. 또한 FlashVID 기반 시각적 토큰 압축을 비디오 경로에 통합합니다. 훈련 설계는 두 가지 경로를 사용합니다. 즉, 전체 토큰 교사가 감독을 제공하는 반면, 압축된 학생은 작업 목표와 여러 증류 신호로부터 학습합니다. 여기에는 답변 영역 KL 증류, 실측 기반 마진 증류, 지식 증류의 신뢰성 인식 제어가 포함됩니다. 이러한 구성 요소는 교육 설계의 일부로 설명되므로 보고된 기여는 고정 예산 설정, 압축된 시각적 경로 및 교사에서 학생에게 전달된 감독의 조합입니다. 백본은 설명된 적응을 위한 기준점으로 남아 있습니다.

저자는 세 가지 비디오 VLM 백본인 LLaVA-Video, LLaVA-OneVision 및 Qwen3-VL-8B-Instruct에 대한 평가를 보고합니다. 그들은 이 방법이 보통 압축과 공격적 압축 모두에서 4개의 비디오 이해 벤치마크에서 지속적으로 압축 전용 기준보다 뛰어난 성능을 발휘했다고 말합니다. 10%의 토큰 보유 비율에서 TBD는 LLaVA-Video에서 바닐라 모델의 평균 정확도의 97.0%를 보존했다고 보고서에 나와 있습니다. LLaVA-OneVision에서는 동일한 유지율에서 평균 점수 58.4와 상대 정확도 100.0%를 보고합니다. 이러한 결과는 논문 요약에 평균 또는 상대적 결과로 명시되어 있으며 거기에서 식별된 보존 설정과 연결되어 있습니다. 제공된 계정은 벤치마크별 분석이나 보고된 비교 이상의 추가 실험 결과를 추가하지 않습니다.

소스 세부정보: arxiv.org ↗

왜 중요한가요?

비디오 모델은 많은 수의 시각적 토큰을 처리하므로 미세 조정 및 추론 비용이 많이 들 수 있습니다. 보고된 결과가 더 광범위한 테스트에 적용된다면 이 방법은 모델의 비디오 이해 기능을 대부분 유지하면서 시각적 처리 오버헤드를 줄일 수 있습니다.

비디오 입력은 단일 이미지보다 훨씬 더 많은 시각적 토큰을 생성할 수 있기 때문에 이 논문에서 다루는 실제 문제는 비디오 AI 시스템에 중요합니다. 토큰이 많을수록 일반적으로 추론과 적응 모두의 계산 부담이 늘어납니다. 원래 시각적 표현의 일부만 처리하면서 유용한 비디오 의미를 보존하는 기술을 사용하면 일부 비디오 언어 응용 프로그램의 실행이나 미세 조정이 덜 까다로워질 수 있습니다. 따라서 가능한 이점은 더 낮은 시각적 토큰 예산으로 의미론적 유용성을 보존하는 것과 관련이 있습니다. 제공된 자료만으로는 전체 교육 및 추론 파이프라인에 필요한 리소스를 완벽하게 설명할 수 없습니다.

이 논문의 교사-학생 디자인은 단순 압축의 특정 약점을 겨냥합니다. 압축 전용 적응은 계산을 절약할 수 있지만 비디오에 대한 질문에 답하는 데 중요한 정보를 삭제할 수 있습니다. 훈련 중에 전체 토큰 교사를 유지하고 여러 형태의 감독을 압축된 학생에게 전달함으로써 TBD는 덜 압축된 모델의 의미론적 동작을 모방하기 위해 더 작은 표현을 가르치려고 시도합니다. 이는 압축을 전처리 단계로만 처리하는 것보다 품질 손실에 대한 보다 구체적인 대응입니다. 제안을 해석할 때 이러한 구별이 중요합니다. 압축 설정은 더 광범위한 적응 방법의 일부이고 교사의 역할은 교육에 속합니다. 요약에서는 적응된 학생을 나중에 사용할 때마다 교사가 필요하다고 말하지 않습니다.

보고된 결과는 단일 아키텍처가 아닌 여러 모델 백본을 다루기 때문에 잠재적으로 유용합니다. 그러나 출처는 이러한 결과를 사전 인쇄에서 이루어진 주장으로만 확립합니다. 제공된 요약에서 네 가지 벤치마크를 식별하거나, 훈련 또는 추론 속도 향상을 정량화하거나, 메모리 사용 또는 재정적 비용을 보고하거나, 사용된 하드웨어를 설명하거나, 작업 전반에 걸쳐 절대 정확도가 어떻게 변하는지 보여주지 않습니다. 또한 해당 방법이 프로덕션 배포 준비가 되었는지 또는 보고된 유지율이 다른 비디오 모델로 이전되는지 여부도 입증되지 않습니다. 이러한 이유로 결과는 명시된 실험 설정에 대해 저자가 제시한 증거로 가장 잘 읽혀집니다. 사용 가능한 설명은 방법에 대한 관심을 뒷받침하는 동시에 실질적인 이점의 크기와 일관성을 유지합니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

이 문서는 arXiv 사전 인쇄본이며 소스는 독립적인 복제, 자세한 대기 시간 또는 메모리 측정, 벤치마크 이름, 코드 가용성 또는 배포 증거를 제공하지 않습니다. 후속 작업에서는 보고된 이득이 비디오 길이, 작업, 압축 수준 및 모델 계열 전반에 걸쳐 지속되는지 테스트해야 합니다.

후속 연구의 첫 번째 질문은 보고된 정확도 유지를 독립적으로 재현할 수 있는지 여부입니다. 소스는 3개의 명명된 백본과 4개의 벤치마크에 대한 결과를 설명하지만 초록에는 벤치마크 이름이나 데이터 세트 구성, 작업 난이도, 평가 프로토콜 또는 통계적 변화를 평가할 수 있는 충분한 실험 세부 정보가 제공되지 않습니다. 동료 검토 또는 전체 기술 검사는 비교가 얼마나 견고한지 명확히 하는 데 도움이 됩니다. 이러한 격차는 재현성과 해석에 영향을 미칩니다. 생략된 맥락이 없으면 독자는 초록만으로는 선택한 평가 설정이 얼마나 대표적인지 또는 보고된 비교를 둘러싼 불확실성이 얼마나 되는지 알 수 없습니다.

효율성 주장은 직접적으로 측정되어야 합니다. 10% 보존율은 남아 있는 시각적 토큰 수를 나타내지만 그 자체만으로는 벽시계 추론 시간, 메모리 사용, 에너지 소비 또는 비용이 90% 감소하지는 않습니다. 압축 오버헤드, 교사 모델 훈련 비용, 시퀀스 길이, 하드웨어, 배치 크기 및 구현 세부 사항은 실질적인 이점에 실질적인 영향을 미칠 수 있습니다. 해당 측정값은 원본 텍스트에 제공되지 않습니다. 따라서 보유 수치는 보다 광범위한 효율성 결론과 별도로 유지되어야 합니다. 이러한 결론을 내리려면 지정된 구현 및 워크로드 하에서 토큰 수를 엔드투엔드 리소스 사용과 연결하는 측정이 필요합니다.

보고된 설정 이상으로 방법을 테스트하는 것도 중요합니다. 향후 평가에서는 더 길고 더 다양한 비디오, 세밀한 시간적 추론, 드문 이벤트, 다중 언어, 다양한 압축 비율 및 나열된 세 가지 백본 외부의 모델 계열을 검사할 수 있습니다. 출처는 ACM MM 2026의 작업에 라벨을 붙이지만 논문이 승인되었다고 말하지 않으며 출시된 코드, 모델 어댑터 또는 TBD를 사용하는 공개 제품을 식별하지도 않습니다. 이러한 테스트는 또한 특정 백본 또는 압축 설정과 관련된 효과로부터 증류 절차에서 발생하는 이득을 분리하는 데 도움이 됩니다. 그때까지 제공된 증거는 사전 인쇄에 설명된 범위와 상태로 제한됩니다.

관련 가이드 및 퀴즈

AI 모델 설명트랜스포머AI 트레이닝AI의 미래알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?