무슨 일이 일어났나요?
KuCoin은 GeekPark를 인용하여 DeepSeek가 8월 21일에 실험적인 V4-Flash-Vision-Exp API를 출시했다고 보고했습니다. 보고된 서비스는 인라인 base64 데이터, 외부 URL 및 파일 API를 통해 이미지를 허용합니다. GeekPark의 테스트에서는 이미지-코드 작업을 설명했지만 소스는 DeepSeek의 명시된 벤치마크, 가격 또는 일반 가용성에 대한 독립적인 검증을 제공하지 않습니다.
KuCoin의 8월 24일 페이지에서는 기술 간행물 GeekPark와 DeepSeek의 공식 WeChat 계정에 따른 발표를 인용하여 DeepSeek가 8월 21일 API를 통해 V4-Flash-Vision-Exp를 제공했다고 보고했습니다. 모델 이름에는 명확하게 문서화된 일반 출시 출시가 아닌 실험적 출시를 나타내는 "Exp"가 포함되어 있습니다. 보고서에 따르면 개발자는 모델 식별자 "deepseek-v4-flash-vision-exp"를 사용하여 이를 호출할 수 있습니다. 소스는 공개 DeepSeek API 사양에 독립적으로 연결되지 않으며 게시 당시 서비스가 얼마나 광범위하게 제공되었는지 설정하지 않습니다.
보고된 인터페이스는 인라인 base64 데이터, 외부 URL 및 DeepSeek의 파일 API라는 세 가지 형태의 이미지 입력을 허용합니다. KuCoin은 이 모델의 가격이 V4-Flash와 동일한 기준으로 책정되었으며 별도의 시각적 처리 추가 비용 없이 이미지당 384개의 토큰을 사용한다고 말합니다. GeekPark는 이 수치를 GPT 및 Claude 시스템에서 유사한 해상도의 이미지에 대해 보고된 800~1,100개의 토큰 소비와 비교하고 DeepSeek의 이미지 비용이 절반 미만이라고 말합니다. 이러한 비교는 출처에서 재현한 주장이며, 이 리뷰에서 독립적으로 측정된 결과는 아닙니다. 보고서는 또한 파일 API를 사용하면 개발자가 이미지를 한 번 업로드하고 파일 식별자를 받아 이후 요청에서 재사용할 수 있다고 밝혔습니다.
GeekPark가 보고한 시연은 이미지를 실행 가능한 코드로 변환하는 데 중점을 두었습니다. 한 테스트에서 모델은 애니메이션 영화 "Niu Lai"의 스크린샷을 분석하고 그림에 있는 황소를 재현하기 위한 SVG 및 CSS를 생성했습니다. 보고서에 따르면 이 과정은 35초가 걸렸습니다. 두 번째 시연에서는 소 두 마리의 스크린샷을 사용하여 HTML과 CSS로 간단한 무한 달리기 게임을 만들었으며 보고서에는 완료 시간이 36초로 표시되었습니다. 세 번째 테스트에서는 어두운 그라데이션, 탐색, 헤드라인, 코드 블록, 버튼 및 기능 카드가 포함된 결제 제품 방문 페이지 스크린샷을 사용했습니다. GeekPark는 이 모델이 26초 만에 반응형 HTML을 생성하고 여러 시각적 요소를 재현했다고 말합니다. 이는 통제된 벤치마크가 아닌 GeekPark의 시연이며 소스는 하드웨어, 네트워크 조건, 평가 기준 또는 반복성을 설정하지 않습니다.
보고서는 상당한 운영상의 한계를 식별합니다. GeekPark에 따르면 기본 사고 모드를 활성화하면 한 테스트에서 2,001개의 완료 토큰이 모두 추론에 의해 소비되어 눈에 띄는 답변이 남지 않습니다. 출판물에 따르면 "reasoning_effort: none"으로 추론을 비활성화하면 한 테스트가 23초에서 7.9초로 줄어들고 완전한 응답이 생성되었다고 합니다. KuCoin은 또한 모델의 다중 모드 에이전트 성능이 Opus-4.8 수준에서 "거의"였으며 텍스트 전용 성능이 V4-Flash와 유사하다는 GeekPark의 주장을 반복합니다. 두 주장 모두 소스에서 독립적으로 확인되지 않았습니다.
왜 중요한가요?
보고된 토큰 효율성과 시각적 성능이 유지된다면 이 서비스는 특히 브라우저, 인터페이스 이해 및 코드 생성 작업의 경우 이미지 인식 AI 에이전트의 운영 비용을 더 저렴하게 만들 수 있습니다. 보고서는 단일 출판물의 테스트를 기반으로 하고 더 광범위한 작업에 대한 신뢰성을 확립하지 않기 때문에 실제 가치는 여전히 불확실합니다.
핵심적인 의미는 기술적일 뿐만 아니라 경제적입니다. 이미지 인식 에이전트는 작동하기 전에 스크린샷, 문서 또는 시각적 인터페이스를 반복적으로 해석해야 합니다. 각 이미지가 상당히 적은 양의 입력 토큰을 사용한다면 브라우저 탐색, 인터페이스 테스트, 스크린샷에서 코드로의 변환과 같은 작업 비용이 줄어들 수 있습니다. 이는 특히 에이전트가 많은 이미지를 검사하거나 파일 참조를 통해 동일한 시각적 컨텍스트를 다시 방문하는 경우 더 많은 에이전트 워크플로에서 시각적 기능을 실용적으로 만들 수 있습니다.
보고된 Files API는 불필요한 재전송도 줄일 수 있습니다. 파일 식별자를 통해 업로드된 이미지를 재사용하면 반복 분석이 필요한 워크플로가 단순화될 수 있습니다. 단, 소스는 보존 기간, 액세스 제어, 삭제 절차, 파일 크기 제한 또는 업로드된 이미지가 학습에 사용되는지 여부를 문서화하지 않습니다. 이러한 누락은 개인 디자인, 고객 정보 또는 기타 민감한 시각적 데이터를 처리하는 조직에 중요합니다. 이 보고서는 독립적인 개인 정보 보호 또는 보안 평가를 제공하지 않습니다.
이번 출시는 저가형 복합 모델 간의 경쟁과도 관련이 있습니다. DeepSeek는 더 큰 Pro 모델이 아닌 Flash 모델에 비전 기능을 배치한 것으로 보고되었으며, 추론 비용을 관리하기 위한 방법으로 기사 프레임을 선택했습니다. 그러나 GPT, Claude 및 Opus-4.8과의 비교는 제공된 자료에서 유사한 평가가 아닙니다. 토큰 계산은 이미지 크기, 세부 수준, 인코딩 및 공급자에 따라 달라질 수 있으며 시각적 품질은 작업에 따라 다릅니다. 따라서 이 보고서는 해당 제품이 이미 일반 용도로 사용하기에 더 저렴하거나 더 좋다는 결론이 아니라 제품 방향에 대한 관심을 뒷받침합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Which component of an AI application is the machine-learning model itself?
다음에 무엇을 볼 것인가
개발자와 사용자는 액세스, 지역별 가용성, 가격, 제한, 지원되는 이미지 형식 및 Files API 동작을 확인하는 기본 문서를 찾아야 합니다. 독립적인 평가에서는 추론 모드를 활성화 및 비활성화한 상태에서 시각적 추론, 생성된 코드, 대기 시간, 실패율 및 성능을 테스트해야 합니다. 해결되지 않은 주요 질문은 보고된 비용 및 성능 주장이 GeekPark에서 설명한 시연을 넘어 일반화되는지 여부입니다.
첫 번째 검증 우선순위는 주요 제품 문서입니다. 사용자는 API의 공개 상태, 지원되는 지역, 가격 공식, 이미지 해상도 제한, 속도 제한, 최대 출력 길이, Files API 보존 및 삭제 동작, 실험 서비스를 프로덕션에 사용할 수 있는지 여부를 확인해야 합니다. 소스는 서비스가 라이브라고 설명하지만 안정적인 서비스 수준 약속이나 일반 출시 날짜를 설정하지 않습니다.
독립적인 테스트는 모델의 시각적 이해와 코드 생성 능력을 분리해야 합니다. 유용한 평가는 다양한 레이아웃, 이미지 품질 및 인터페이스 전반에 걸쳐 보고된 스크린샷-HTML 작업을 반복한 다음 시각적 유사성만 측정하기보다는 기능적 정확성을 측정하는 것입니다. 또한 테스트에서는 사고 모드 유무에 관계없이 대기 시간, 토큰 사용 및 오류율을 비교해야 합니다. 보고서의 빈 출력 예는 구성을 즉각적이고 실용적인 문제로 만들지만 요청 전반에 걸쳐 실패가 얼마나 자주 발생하는지 보여주지는 않습니다.
신뢰성과 안전성은 여전히 미해결 문제로 남아 있습니다. 스크린샷을 읽고 실행 가능한 코드를 생성할 수 있는 모델은 접근성, 인터페이스 마이그레이션 및 신속한 프로토타이핑에 도움이 될 수 있지만 생성된 코드에는 기능, 보안 또는 접근성 결함이 포함될 수 있습니다. 제공된 보고서는 이러한 위험에 대한 증거를 제공하지 않으며 체계적인 레드팀 결과도 없으며 개인 또는 기밀 데이터가 포함된 이미지 처리에 대한 정보도 제공하지 않습니다. 이러한 질문에 답할 때까지 가장 방어 가능한 견해는 DeepSeek가 기존 비전 시스템에 대한 검증된 대체가 아니라 유망한 데모와 중요한 한계가 있는 실험적인 다중 모드 API를 보고했다는 것입니다.