Tilbake til Nyheter
ProduktAI Understanding orientering

DeepSeeks eksperimentelle V4-Flash Vision API legger til bildeinndata for multimodale agenter

KuCoin, som publiserer GeekPark på nytt, rapporterer at DeepSeek åpnet en eksperimentell visjon API 21. august med bildeinndata, en rapportert 384-token bildekostnad og visuell-til-kode-tester. Påstandene om tilgjengelighet, priser og ytelse er ikke uavhengig bekreftet.

5 min readRead the linked source
Source-page capture accompanying DeepSeek’s experimental V4-Flash Vision API adds image input for multimodal agents
KildereferanseKilde registrert
Utgiver
kucoin.com
Kilde lenke
kucoin.comhttps://www.kucoin.com/news/flash/deepseek-launches-multimodal-vision-model-v4-flash-vision-exp
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
Også sitert

Historien sist revidert

KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Inferens
Kjøretidsfasen der en trent modell genererer spådommer eller utdata.
Gradient
En vektor som viser hvor mye hver parameter skal endres for å redusere tap.
Test deg selvQuiz for forklaring av AI-modeller

Hva har endret seg siden publisering

  1. Først publisert
  2. KuCoins rapport, som publiserer GeekPark på nytt, fortsetter vesentlig den samme DeepSeek V4-Flash multimodal-modelllanseringen som allerede er dekket av TahawulTech. Den legger til rapporterte API-inndatametoder, 384-tokens bildekostnadskrav, Files API-detaljer, visuelle-til-kode-demonstrasjoner og en advarsel om at resonneringsmodusen kan konsumere hele produksjonsbudsjettet; disse detaljene forblir uavhengig bekreftet.

Hva skjedde

KuCoin rapporterer, med henvisning til GeekPark, at DeepSeek lanserte den eksperimentelle V4-Flash-Vision-Exp API 21. august. Den rapporterte tjenesten aksepterer bilder gjennom inline base64-data, eksterne URL-er og en Files API. GeekParks tester beskrev bilde-til-kode-oppgaver, men kilden gir ikke uavhengig verifisering av DeepSeeks uttalte referanser, priser eller generell tilgjengelighet.

KuCoins 24. august-side rapporterer at DeepSeek gjorde V4-Flash-Vision-Exp tilgjengelig gjennom en API 21. august, med henvisning til teknologipublikasjonen GeekPark og en kunngjøring tilskrevet DeepSeeks offisielle WeChat-konto. Modellnavnet inkluderer "Exp", som indikerer en eksperimentell utgivelse i stedet for en tydelig dokumentert lansering med generell tilgjengelighet. Rapporten sier at utviklere kan påkalle den med modellidentifikatoren "deepseek-v4-flash-vision-exp." Kilden kobler ikke uavhengig til en offentlig DeepSeek API-spesifikasjon eller fastslår hvor bredt tjenesten var tilgjengelig på publiseringstidspunktet.

Det rapporterte grensesnittet godtar tre former for bildeinndata: inline base64-data, eksterne URL-er og DeepSeeks Files API. KuCoin sier at modellen er priset på samme grunnlag som V4-Flash og bruker 384 tokens per bilde, uten en separat visuell behandlingstillegg. GeekPark sammenligner dette tallet med rapportert forbruk på 800 til 1100 tokens for bilder med lignende oppløsning i GPT- og Claude-systemer, og sier at DeepSeeks bildekostnad er mindre enn halvparten. Disse sammenligningene er påstander gjengitt av kilden, ikke resultater uavhengig målt i denne anmeldelsen. Rapporten sier også at Files API lar utviklere laste opp et bilde én gang, motta en filidentifikator og gjenbruke den i senere forespørsler.

GeekParks rapporterte demonstrasjoner fokuserte på å konvertere bilder til kjørbar kode. I en test analyserte modellen et skjermbilde fra animasjonsfilmen «Niu Lai» og genererte SVG og CSS ment å reprodusere den avbildede oksen; rapporten sier at prosessen tok 35 sekunder. I en andre demonstrasjon brukte den et skjermbilde av to kyr for å lage et enkelt endeløs-løper-spill i HTML og CSS, med rapporten som ga en fullføringstid på 36 sekunder. En tredje test brukte et skjermbilde for landingsside for betalingsprodukter som inneholdt en mørk , navigasjon, en overskrift, en kodeblokk, knapper og funksjonskort. GeekPark sier at modellen genererte responsiv HTML på 26 sekunder og reproduserte flere visuelle elementer. Dette er demonstrasjoner av GeekPark, ikke kontrollerte benchmarks, og kilden fastslår ikke maskinvare, nettverksforhold, evalueringskriterier eller repeterbarhet.

Rapporten identifiserer en betydelig operasjonell begrensning. I følge GeekPark førte aktivering av standardtenkemodus til at alle 2001 fullføringssymboler i en test ble konsumert av resonnement, og etterlot ikke noe synlig svar. Publikasjonen sier at deaktivering av resonnement med "reasoning_effort: none" reduserte en test fra 23 sekunder til 7,9 sekunder og ga et fullstendig svar. KuCoin gjentar også GeekParks påstand om at modellens multimodale agentytelse var "nesten" på nivået til Opus-4.8 og at ytelsen kun for tekst forble sammenlignbar med V4-Flash. Ingen av påstandene er uavhengig bekreftet i kilden.

Kildedetaljer: kucoin.com ↗

Hvorfor det betyr noe

Hvis den rapporterte tokeneffektiviteten og visuelle ytelsen holder stand, kan tjenesten gjøre bildebevisste AI-agenter rimeligere å betjene, spesielt for nettleser-, grensesnittforståelse og kodegenereringsoppgaver. Den praktiske verdien er fortsatt usikker fordi rapporten er basert på en enkelt publikasjons tester og ikke etablerer pålitelighet på tvers av bredere arbeidsbelastninger.

Den sentrale betydningen er økonomisk så vel som teknisk. Bildebevisste agenter må gjentatte ganger tolke skjermbilder, dokumenter eller visuelle grensesnitt før de kan handle. Hvis hvert bilde bruker vesentlig færre input-tokens, kan kostnadene for oppgaver som nettlesernavigasjon, grensesnitttesting og skjermbilde-til-kode-konvertering falle. Det kan gjøre visuelle evner praktiske i flere agentarbeidsflyter, spesielt der en agent undersøker mange bilder eller besøker den samme visuelle konteksten på nytt gjennom en filreferanse.

Den rapporterte Files API kan også redusere unødvendig reoverføring. Gjenbruk av et opplastet bilde gjennom en filidentifikator kan forenkle arbeidsflyter som krever gjentatt analyse, selv om kilden ikke dokumenterer oppbevaringsperioder, tilgangskontroller, slettingsprosedyrer, filstørrelsesgrenser eller om opplastede bilder brukes til opplæring. Disse utelatelsene har betydning for organisasjoner som håndterer privat design, kundeinformasjon eller andre sensitive visuelle data. Rapporten gir ingen uavhengig personvern- eller sikkerhetsvurdering.

Lanseringen er også relevant for konkurranse blant billigere multimodale modeller. DeepSeek er rapportert å ha plassert synsevnen på Flash-modellen i stedet for den større Pro-modellen, et valg artikkelen rammer som en måte å holde slutningskostnadene håndterbare. Men sammenligningen med GPT, Claude og Opus-4.8 er ikke en like-for-like-evaluering i det medfølgende materialet. Tokenregnskap kan variere etter bildestørrelse, detaljnivå, koding og leverandør, mens visuell kvalitet avhenger av oppgaven. Rapporten støtter derfor interesse for produktets retning, ikke en konklusjon om at det allerede er billigere eller bedre for generell bruk.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Utviklere og brukere bør se etter primær dokumentasjon som bekrefter tilgang, regional tilgjengelighet, priser, grenser, støttede bildeformater og Files API-atferd. Uavhengige evalueringer bør teste visuell resonnement, generert kode, ventetid, feilfrekvenser og ytelse med resonneringsmodus aktivert og deaktivert. Det viktigste uløste spørsmålet er om de rapporterte kostnads- og kapasitetskravene generaliserer utover demonstrasjonene beskrevet av GeekPark.

Den første verifiseringsprioriteten er primær produktdokumentasjon. Brukere trenger bekreftelse på APIens offentlige status, støttede regioner, prisformel, bildeoppløsningsgrenser, hastighetsgrenser, maksimal utdatalengde, Files API-oppbevaring og slettingsadferd, og om den eksperimentelle tjenesten kan brukes i produksjon. Kilden beskriver tjenesten som live, men etablerer ikke en stabil forpliktelse på servicenivå eller en generell tilgjengelighetsdato.

Uavhengig testing bør skille modellens visuelle forståelse fra dens evne til å generere kode. Nyttige evalueringer vil gjenta de rapporterte skjermdump-til-HTML-oppgavene på tvers av forskjellige oppsett, bildekvaliteter og grensesnitt, og deretter måle funksjonell korrekthet i stedet for visuell likhet alene. Tester bør også sammenligne ventetid, tokenbruk og feilrater med og uten tenkemodus. Rapportens eksempel med tomme utdata gjør konfigurasjon til en umiddelbar praktisk bekymring, men den viser ikke hvor ofte feilen oppstår på tvers av forespørsler.

Pålitelighet og sikkerhet forblir åpne spørsmål. En modell som kan lese et skjermbilde og generere kjørbar kode kan hjelpe med tilgjengelighet, grensesnittmigrering og rask prototyping, men generert kode kan inneholde funksjons-, sikkerhets- eller tilgjengelighetsdefekter. Den vedlagte rapporten gir ingen bevis om disse risikoene, ingen systematiske resultater fra det røde teamet og ingen informasjon om håndtering av bilder som inneholder personlige eller konfidensielle data. Inntil disse spørsmålene er besvart, er det mest forsvarlige synet at DeepSeek har rapportert en eksperimentell multimodal API med lovende demonstrasjoner og viktige grenser, snarere enn en bekreftet erstatning for etablerte synssystemer.

Relaterte guider og quizer

AI-modeller forklartAI-agenterChatGPT og LLM-erTransformatorerTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren

Oppdateringer og rettelser

Denne kanoniske historien oppdateres på plass når utviklingshendelsen endres vesentlig. Nettadressen og den opprinnelige publiseringsdatoen endres aldri.

  • KuCoins rapport, som publiserer GeekPark på nytt, fortsetter vesentlig den samme DeepSeek V4-Flash multimodal-modelllanseringen som allerede er dekket av TahawulTech. Den legger til rapporterte API-inndatametoder, 384-tokens bildekostnadskrav, Files API-detaljer, visuelle-til-kode-demonstrasjoner og en advarsel om at resonneringsmodusen kan konsumere hele produksjonsbudsjettet; disse detaljene forblir uavhengig bekreftet.
Se den offentlige korreksjonsloggen
Fant du dette nyttig?