뉴스로 돌아가기
제품AI Understanding 브리핑

DeepSeek, 비전 기능을 갖춘 실험적인 V4 플래시 모델 출시

DeepSeek는 V4-Flash 아키텍처에 시각적 모듈을 추가하고 여러 시각적 에이전트 벤치마크에서 향상된 성능을 보고하는 실험적인 다중 모드 모델인 DeepSeek-V4-Flash-Vision-Exp를 발표했습니다.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
기본 소스 문서녹음된 소스
출판사
huggingface.co
소스 링크
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

메모리(에이전트 메모리)
AI 에이전트는 연속성을 향상하기 위해 여러 단계 또는 세션에서 사용하는 저장된 컨텍스트입니다.
추측적 디코딩
작은 초안 모델이 더 큰 모델이 병렬로 검증하는 토큰을 제안하는 추론 가속화 방법입니다.
다중 모드 모델
텍스트, 이미지, 오디오 등 다양한 데이터 유형을 처리하거나 생성할 수 있는 모델입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

DeepSeek는 DeepSeek-V4 제품군의 첫 번째 실험적 다중 모드 모델로 Hugging Face에 DeepSeek-V4-Flash-Vision-Exp를 게시했습니다. 모델 카드에는 DeepSeek-V4-Flash 아키텍처에 시각적 모듈과 지속적인 교육이 추가되었으며, 텍스트 전용 에이전트 작업에서 비슷한 성능을 유지하면서 다중 모달 에이전트 작업에 대한 이득이 보고되었다고 나와 있습니다.

Hugging Face 레코드는 Transformers를 사용하여 DeepSeek-V4-Flash-Vision-Exp를 이미지-텍스트-텍스트 모델로 식별합니다. 모델 카드에는 V4 제품군 중 DeepSeek의 첫 번째 실험적 다중 모드 모델이라고 설명되어 있습니다. 명시된 설계는 DeepSeek-V4-Flash 아키텍처를 시각적 모듈과 시각적 이해 기능을 잠금 해제하기 위한 지속적인 교육과 결합합니다. 저장소는 2026년 8월 31일에 생성되었으며, 기록에는 9월 1일에 후속 업데이트가 표시됩니다.

모델 카드는 여러 다중 모달 에이전트 평가에서 DeepSeek-V4-Flash-0731에 대한 개선 사항을 보고합니다. 이전 모델의 ApexBench Pass@1 점수는 36.5 대 26.2, 에이전트의 마지막 시험 점수는 27.3 대 25.2, Chartography 점수는 64.3, ZeroBench Pass@5 점수는 35.0입니다. 이 카드는 또한 ApexBench에서 39.4, Agents' Last Exam에서 25.7, Chartography에서 65.0, ZeroBench에서 34.0으로 나열된 Opus-4.8과 새 모델을 비교합니다.

텍스트 에이전트 작업의 경우 모델 카드는 Terminal Bench 2.1에서 83.9, NL2Repo에서 57.7, Cybergym에서 75.3, DeepSWE에서 59.3, Toolathlon-Verified에서 75.9, DSBench-Hard에서 63.6, AutomationBench Public에서 25.7을 보고합니다. 카드에는 새 모델이 DeepSeek-V4-Flash-0731에 필적하는 텍스트 전용 에이전트 성능을 유지한다고 나와 있으며, 이전 모델은 ApexBench 및 에이전트의 마지막 시험 입력에서 다중 모달 요소를 무시했다는 점을 지적하고 있습니다.

저장소에는 토크나이저 파일, 프롬프트 인코딩 참조, 비전 인코더 및 정렬 장치, DFlash 주의, 전문가 혼합 구성 요소, Hyper-Connections 및 DSpark 전달 경로를 포괄하는 최소 PyTorch 추론 구현이 포함되어 있습니다. 모델 카드는 Transformers, vLLM, Docker, SGLang 및 Docker Model Runner에 대한 지침을 제공합니다. SGLang 예제는 4개의 텐서 병렬성과 DSpark 추측 디코딩을 지정합니다. 표시되는 메타데이터에는 3,050억 개의 매개변수가 나열되어 있으며 저장소는 MIT에 따라 라이선스가 부여됩니다.

소스 세부정보: huggingface.co ↗

왜 중요한가요?

이 릴리스를 통해 연구원과 개발자는 이미지와 텍스트 상호 작용 및 에이전트 워크플로를 위해 설계된 대규모 MIT 라이선스 모델에 액세스할 수 있습니다. 보고된 평가는 검증되지 않은 것으로 표시된 모델 카드에서 나온 것이며 추론 제공자가 모델을 배포하지 않았기 때문에 실제 유용성은 여전히 ​​불확실합니다.

이 릴리스는 비전이 부수적인 기능이 아니라 모델의 직접적인 목적이기 때문에 중요합니다. 모델 카드는 다중 모달 에이전트 기능을 위한 DeepSeek-V4-Flash-Vision-Exp를 포지셔닝합니다. 이는 AI 시스템이 언어와 함께 시각적 입력을 해석하고 평가 프레임워크 내에서 작동해야 하는 작업을 의미합니다. 이는 V4-Flash 제품군이 처리하려는 입력 유형을 확장하지만 소스는 모델이 일반 제품이나 위험이 높은 설정에서 얼마나 잘 수행되는지 설정하지 않습니다.

저장소는 실험적인 다중 모드 시스템을 검사, 조정 또는 실행하려는 개발자에게 잠재적으로 유용한 모델을 만듭니다. MIT 라이센스, 프롬프트 인코딩 참조, 토크나이저 파일, 추론 코드 및 예제는 제품 발표보다 더 많은 구현 자료를 제공합니다. 동시에 소스에서는 대규모 모델 샤드가 인덱스로 설명되며 저장소를 구성하는 데 사용되는 소스 체크아웃 내에서 복제되지 않는다고 밝혔습니다. 모델의 크기와 나열된 다중 GPU SGLang 구성은 배포가 까다로울 수 있음을 나타내지만 소스는 실제 하드웨어 비용, 대기 시간 또는 메모리 요구 사항을 제공하지 않습니다.

보고된 결과는 특별한 절충안을 제시합니다. DeepSeek는 유사한 텍스트 에이전트 성능을 포기하지 않고도 다중 모달 에이전트 벤치마크에서 상당한 이득을 얻을 수 있다고 주장합니다. 이러한 주장은 독립적으로 확립된 사실이 아니라 모델 카드 결과로 처리되어야 합니다. 평가 기록은 모델 카드를 출처로 식별하고 결과를 검증되지 않음으로 표시합니다. 비교도 부분적으로 불완전합니다. 일부 이전 모델 다중 모드 점수에는 모델이 시각적 요소를 무시했음을 설명하는 메모가 표시되어 있고 일부 벤치마크 셀에는 이전 모델 결과가 포함되어 있지 않습니다.

따라서 대중에게 미치는 영향은 검증과 유용성에 달려 있습니다. 독립적인 테스트를 통해 보고된 시각적 에이전트의 이점이 확인되고 더 많은 연구자가 구현을 실행할 수 있다면 이 릴리스에서는 이미지 및 텍스트 실험을 위한 개방형 모델에 대한 액세스가 확대될 수 있습니다. 소스는 훈련 데이터 출처, 안전성 평가, 거부 행동, 개인 정보 보호, 상업적 지원 또는 결과적 결정에 대한 적합성을 설정하지 않습니다. 이러한 누락은 릴리스만으로 책임감 있게 결론을 내릴 수 있는 내용을 제한합니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

주요 질문은 독립적인 평가가 DeepSeek의 결과를 재현하는지 여부, 모델에 실제로 필요한 하드웨어 및 엔지니어링의 양, 저장소의 실험적 구현이 배포하기 더 쉬워지는지 여부입니다. 또한 사용자는 나열된 벤치마크 이외의 데이터, 안전 테스트 및 성능에 대한 더 자세한 정보를 찾아야 합니다.

가용성은 즉각적이고 실용적인 질문입니다. Hugging Face 페이지에는 모델이 추론 공급자에 의해 배포되지 않았으며 소스 스냅샷에는 다운로드가 0으로 표시됩니다. 대신 사용자는 Transformers, vLLM, SGLang, Docker 및 Docker Model Runner와 같은 로컬 또는 자체 관리형 경로로 이동됩니다. 향후 업데이트에서는 호스팅된 액세스가 가능한지, 최소 추론 경로가 완전한지, 텐서-병렬-4 예시를 넘어 현실적인 하드웨어 구성이 무엇인지 명확히 할 수 있습니다.

독립적 복제는 다중 모드 주장과 이전 모델과의 공정한 비교에 초점을 맞춰야 합니다. 평가자는 DeepSeek-V4-Flash-0731이 나열된 두 가지 테스트에서 시각적 요소를 무시했다는 소스의 메모를 고려해야 합니다. 또한 모델 카드 결과의 확인되지 않은 상태를 검사하고, 정확한 프롬프트 및 하네스 설정을 보고하고, 게시된 표에 표시되지 않은 이미지, 언어, 작업 및 실패 사례 전반에 걸쳐 성능이 유지되는지 테스트해야 합니다.

릴리스의 실험적 상태로 인해 엔지니어링 변경 사항에 주의를 기울여야 합니다. 리포지토리는 PyTorch 추론에서 프롬프트 형식을 분리하고 OpenAI 스타일 JSON 콘텐츠 블록과 압축 텍스트 표기법을 모두 지원하며 체크포인트 변환을 문서화합니다. 해당 구성 요소에 대한 업데이트는 재현성과 배포에 영향을 미칠 수 있습니다. 소스는 인터페이스가 얼마나 안정적인지, 가중치나 코드가 얼마나 자주 변경되는지, 문서화된 모든 제공 경로가 비전 기능을 동일하게 지원하는지 여부를 밝히지 않습니다.

안전 및 거버넌스 정보는 알려지지 않은 또 다른 주요 사항입니다. 소스는 아키텍처, 사용법, 벤치마크 및 라이선스를 설명하지만 이미지 이해를 위한 안전 테스트나 제한 사항은 제공하지 않습니다. 민감한 이미지 또는 결과적인 워크플로가 포함된 모델을 사용하기 전에 조직에서는 데이터 처리, 시각적 오류, 보안, 오용 방지 및 인간 감독에 대한 증거가 필요합니다. 벤치마크 점수나 MIT 라이센스에서는 이러한 속성을 추론할 수 없습니다.

관련 가이드 및 퀴즈

AI 모델 설명AI 에이전트ChatGPT와 LLMAI 트레이닝알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?