Terug naar Nieuws
ProductAI Understanding-briefing

De experimentele V4-Flash Vision API van DeepSeek voegt beeldinvoer toe voor multimodale agenten

KuCoin, die GeekPark opnieuw publiceert, meldt dat DeepSeek op 21 augustus een experimentele vision-API heeft geopend met beeldinvoer, gerapporteerde beeldkosten van 384 token en visueel-naar-code-tests. De beschikbaarheids-, prijs- en prestatieclaims zijn niet onafhankelijk bevestigd.

5 min readRead the linked source
Source-page capture accompanying DeepSeek’s experimental V4-Flash Vision API adds image input for multimodal agents
BronreferentieBron opgenomen
Uitgever
kucoin.com
Bronlink
kucoin.comhttps://www.kucoin.com/news/flash/deepseek-launches-multimodal-vision-model-v4-flash-vision-exp
Brontype
Gekoppelde bron: de status van de primaire bron is niet vastgesteld.
Ook aangehaald

Verhaal laatst herzien

ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Gevolgtrekking
De runtimefase waarin een getraind model voorspellingen of uitvoer genereert.
Verloop
Een vector die aangeeft hoeveel elke parameter moet veranderen om het verlies te verminderen.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er veranderd sinds de publicatie

  1. Voor het eerst gepubliceerd
  2. Het rapport van KuCoin, waarin GeekPark opnieuw wordt gepubliceerd, zet feitelijk dezelfde DeepSeek V4-Flash multimodale modellancering voort die al door TahawulTech wordt gedekt. Het voegt gerapporteerde API-invoermethoden toe, de 384-token beeldkostenclaim, Files API-details, visueel-naar-code-demonstraties en een waarschuwing dat de redeneermodus het volledige uitvoerbudget kan verbruiken; deze details blijven onafhankelijk bevestigd.

Wat is er gebeurd

KuCoin meldt, onder verwijzing naar GeekPark, dat DeepSeek op 21 augustus de experimentele V4-Flash-Vision-Exp API heeft gelanceerd. De gerapporteerde service accepteert afbeeldingen via inline base64-gegevens, externe URL's en een Files API. De tests van GeekPark beschrijven beeld-naar-code-taken, maar de bron biedt geen onafhankelijke verificatie van de door DeepSeek aangegeven benchmarks, prijzen of algemene beschikbaarheid.

De pagina van KuCoin van 24 augustus meldt dat DeepSeek V4-Flash-Vision-Exp op 21 augustus beschikbaar heeft gesteld via een API, daarbij verwijzend naar de technologiepublicatie GeekPark en een aankondiging toegeschreven aan het officiële WeChat-account van DeepSeek. De modelnaam bevat ‘Exp’, wat duidt op een experimentele release in plaats van een duidelijk gedocumenteerde lancering voor algemene beschikbaarheid. Het rapport zegt dat ontwikkelaars het kunnen aanroepen met de model-ID “deepseek-v4-flash-vision-exp.” De bron linkt niet onafhankelijk naar een openbare DeepSeek API-specificatie en stelt niet vast hoe breed de dienst beschikbaar was op het moment van publicatie.

De gerapporteerde interface accepteert drie vormen van beeldinvoer: inline base64-gegevens, externe URL's en de Files API van DeepSeek. KuCoin zegt dat het model op dezelfde basis geprijsd is als V4-Flash en 384 tokens per afbeelding gebruikt, zonder aparte toeslag voor visuele verwerking. GeekPark vergelijkt dat cijfer met het gerapporteerde verbruik van 800 tot 1.100 tokens voor afbeeldingen met een vergelijkbare resolutie in GPT- en Claude-systemen, en zegt dat de beeldkosten van DeepSeek minder dan de helft bedragen. Deze vergelijkingen zijn beweringen die door de bron zijn overgenomen, en niet de resultaten die onafhankelijk zijn gemeten in deze review. Het rapport zegt ook dat ontwikkelaars met de Files API een afbeelding één keer kunnen uploaden, een bestandsidentificatie kunnen ontvangen en deze bij latere verzoeken kunnen hergebruiken.

De gerapporteerde demonstraties van GeekPark waren gericht op het converteren van afbeeldingen naar uitvoerbare code. In één test analyseerde het model een screenshot uit de animatiefilm “Niu Lai” en genereerde SVG en CSS bedoeld om de afgebeelde stier te reproduceren; Volgens het rapport duurde het proces 35 seconden. In een tweede demonstratie werd een screenshot van twee koeien gebruikt om een ​​eenvoudig spel met eindeloze runners in HTML en CSS te maken, waarbij het rapport een voltooiingstijd van 36 seconden gaf. Bij een derde test werd gebruik gemaakt van een screenshot van de landingspagina van een betaalproduct met een donker kleurverloop, navigatie, een kop, een codeblok, knoppen en functiekaarten. GeekPark zegt dat het model in 26 seconden responsieve HTML genereerde en verschillende visuele elementen reproduceerde. Dit zijn demonstraties van GeekPark, geen gecontroleerde benchmarks, en de bron stelt de hardware, netwerkomstandigheden, evaluatiecriteria of herhaalbaarheid niet vast.

Het rapport signaleert een aanzienlijke operationele beperking. Volgens GeekPark zorgde het inschakelen van de standaard denkmodus ervoor dat alle 2.001 voltooiingstokens in één test werden verbruikt door redenering, waardoor er geen zichtbaar antwoord overblijft. De publicatie zegt dat het uitschakelen van het redeneren met “reasoning_effort: none” één test van 23 seconden naar 7,9 seconden reduceerde en een volledige respons opleverde. KuCoin herhaalt ook de bewering van GeekPark dat de prestaties van de multimodale agent van het model “bijna” op het niveau van Opus-4.8 lagen en dat de prestaties van alleen tekst vergelijkbaar bleven met V4-Flash. Geen van beide beweringen wordt onafhankelijk bevestigd in de bron.

Brongegevens: kucoin.com ↗

Waarom het ertoe doet

Als de gerapporteerde tokenefficiëntie en visuele prestaties standhouden, zou de dienst beeldbewuste AI-agents goedkoper kunnen maken in het gebruik, met name voor browser-, interface-begrip- en codegeneratietaken. De praktische waarde blijft onzeker omdat het rapport gebaseerd is op de tests van één enkele publicatie en geen betrouwbaarheid over bredere werklasten vaststelt.

De centrale betekenis is zowel economisch als technisch. Beeldbewuste agenten moeten herhaaldelijk screenshots, documenten of visuele interfaces interpreteren voordat ze kunnen handelen. Als elke afbeelding aanzienlijk minder invoertokens verbruikt, zouden de kosten van taken zoals browsernavigatie, interfacetests en conversie van screenshot naar code kunnen dalen. Dat zou visuele mogelijkheden praktisch kunnen maken in meer agentworkflows, vooral wanneer een agent veel afbeeldingen onderzoekt of dezelfde visuele context opnieuw bezoekt via een bestandsverwijzing.

De gerapporteerde Files API zou ook onnodige hertransmissie kunnen verminderen. Het hergebruiken van een geüploade afbeelding via een bestandsidentificatie kan workflows vereenvoudigen die herhaalde analyse vereisen, hoewel de bron niet documenteert bewaartermijnen, toegangscontroles, verwijderingsprocedures, bestandsgroottelimieten en of geüploade afbeeldingen worden gebruikt voor training. Deze weglatingen zijn van belang voor organisaties die omgaan met privéontwerpen, klantinformatie of andere gevoelige visuele gegevens. Het rapport biedt geen onafhankelijke privacy- of beveiligingsbeoordeling.

De lancering is ook relevant voor de concurrentie tussen goedkopere multimodale modellen. DeepSeek zou de visiemogelijkheden op zijn Flash-model hebben geplaatst in plaats van op zijn grotere Pro-model, een keuze uit de artikelframes als een manier om de gevolgtrekkingskosten beheersbaar te houden. Maar de vergelijking met GPT, Claude en Opus-4.8 is in het aangeleverde materiaal geen like-for-like evaluatie. Token-accounting kan variëren per afbeeldingsgrootte, detailniveau, codering en provider, terwijl de visuele kwaliteit afhankelijk is van de taak. Het rapport ondersteunt daarom de interesse in de richting van het product, en niet de conclusie dat het al goedkoper of beter is voor algemeen gebruik.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Ontwikkelaars en gebruikers moeten zoeken naar primaire documentatie die toegang, regionale beschikbaarheid, prijzen, limieten, ondersteunde afbeeldingsformaten en Files API-gedrag bevestigt. Onafhankelijke evaluaties moeten het visuele redeneren, de gegenereerde code, de latentie, het aantal fouten en de prestaties testen met de redeneermodus in- en uitgeschakeld. De belangrijkste onopgeloste vraag is of de gerapporteerde claims over kosten en mogelijkheden generaliseren buiten de door GeekPark beschreven demonstraties.

De eerste verificatieprioriteit is de primaire productdocumentatie. Gebruikers hebben bevestiging nodig van de openbare status van de API, de ondersteunde regio's, de prijsformule, de limieten voor de afbeeldingsresolutie, de snelheidslimieten, de maximale uitvoerlengte, het bewaar- en verwijderingsgedrag van de Files API en of de experimentele service in productie kan worden gebruikt. De bron beschrijft de service als live, maar stelt geen stabiele serviceniveauverplichting of een datum voor algemene beschikbaarheid vast.

Onafhankelijke tests moeten het visuele begrip van het model scheiden van het vermogen om code te genereren. Nuttige evaluaties zouden de gerapporteerde screenshot-naar-HTML-taken herhalen over verschillende lay-outs, beeldkwaliteiten en interfaces, en vervolgens de functionele correctheid meten in plaats van alleen de visuele gelijkenis. Tests moeten ook latentie, tokengebruik en foutpercentages vergelijken met en zonder denkmodus. Het voorbeeld met lege uitvoer in het rapport maakt configuratie tot een onmiddellijk praktisch probleem, maar het laat niet zien hoe vaak deze fout optreedt bij verzoeken.

Betrouwbaarheid en veiligheid blijven open vragen. Een model dat een screenshot kan lezen en uitvoerbare code kan genereren, kan helpen bij de toegankelijkheid, interfacemigratie en rapid prototyping, maar de gegenereerde code kan functionele, beveiligings- of toegankelijkheidsgebreken bevatten. Het aangeleverde rapport geeft geen bewijs over deze risico’s, geen systematische red-team resultaten en geen informatie over de omgang met beelden die persoonlijke of vertrouwelijke gegevens bevatten. Totdat deze vragen zijn beantwoord, is de meest verdedigbare opvatting dat DeepSeek een experimentele multimodale API heeft gerapporteerd met veelbelovende demonstraties en belangrijke beperkingen, in plaats van een geverifieerde vervanging voor gevestigde vision-systemen.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-agentenChatGPT & LLM'sTransformatorenTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker

Updates en correcties

Dit canonieke verhaal wordt op zijn plaats bijgewerkt wanneer de zich ontwikkelende gebeurtenis wezenlijk verandert. De URL en de oorspronkelijke publicatiedatum veranderen nooit.

  • Het rapport van KuCoin, waarin GeekPark opnieuw wordt gepubliceerd, zet feitelijk dezelfde DeepSeek V4-Flash multimodale modellancering voort die al door TahawulTech wordt gedekt. Het voegt gerapporteerde API-invoermethoden toe, de 384-token beeldkostenclaim, Files API-details, visueel-naar-code-demonstraties en een waarschuwing dat de redeneermodus het volledige uitvoerbudget kan verbruiken; deze details blijven onafhankelijk bevestigd.
Zie het openbare correctielogboek
Vond je dit nuttig?