Wat is er gebeurd
KuCoin meldt, onder verwijzing naar GeekPark, dat DeepSeek op 21 augustus de experimentele V4-Flash-Vision-Exp API heeft gelanceerd. De gerapporteerde service accepteert afbeeldingen via inline base64-gegevens, externe URL's en een Files API. De tests van GeekPark beschrijven beeld-naar-code-taken, maar de bron biedt geen onafhankelijke verificatie van de door DeepSeek aangegeven benchmarks, prijzen of algemene beschikbaarheid.
De pagina van KuCoin van 24 augustus meldt dat DeepSeek V4-Flash-Vision-Exp op 21 augustus beschikbaar heeft gesteld via een API, daarbij verwijzend naar de technologiepublicatie GeekPark en een aankondiging toegeschreven aan het officiële WeChat-account van DeepSeek. De modelnaam bevat ‘Exp’, wat duidt op een experimentele release in plaats van een duidelijk gedocumenteerde lancering voor algemene beschikbaarheid. Het rapport zegt dat ontwikkelaars het kunnen aanroepen met de model-ID “deepseek-v4-flash-vision-exp.” De bron linkt niet onafhankelijk naar een openbare DeepSeek API-specificatie en stelt niet vast hoe breed de dienst beschikbaar was op het moment van publicatie.
De gerapporteerde interface accepteert drie vormen van beeldinvoer: inline base64-gegevens, externe URL's en de Files API van DeepSeek. KuCoin zegt dat het model op dezelfde basis geprijsd is als V4-Flash en 384 tokens per afbeelding gebruikt, zonder aparte toeslag voor visuele verwerking. GeekPark vergelijkt dat cijfer met het gerapporteerde verbruik van 800 tot 1.100 tokens voor afbeeldingen met een vergelijkbare resolutie in GPT- en Claude-systemen, en zegt dat de beeldkosten van DeepSeek minder dan de helft bedragen. Deze vergelijkingen zijn beweringen die door de bron zijn overgenomen, en niet de resultaten die onafhankelijk zijn gemeten in deze review. Het rapport zegt ook dat ontwikkelaars met de Files API een afbeelding één keer kunnen uploaden, een bestandsidentificatie kunnen ontvangen en deze bij latere verzoeken kunnen hergebruiken.
De gerapporteerde demonstraties van GeekPark waren gericht op het converteren van afbeeldingen naar uitvoerbare code. In één test analyseerde het model een screenshot uit de animatiefilm “Niu Lai” en genereerde SVG en CSS bedoeld om de afgebeelde stier te reproduceren; Volgens het rapport duurde het proces 35 seconden. In een tweede demonstratie werd een screenshot van twee koeien gebruikt om een eenvoudig spel met eindeloze runners in HTML en CSS te maken, waarbij het rapport een voltooiingstijd van 36 seconden gaf. Bij een derde test werd gebruik gemaakt van een screenshot van de landingspagina van een betaalproduct met een donker kleurverloop, navigatie, een kop, een codeblok, knoppen en functiekaarten. GeekPark zegt dat het model in 26 seconden responsieve HTML genereerde en verschillende visuele elementen reproduceerde. Dit zijn demonstraties van GeekPark, geen gecontroleerde benchmarks, en de bron stelt de hardware, netwerkomstandigheden, evaluatiecriteria of herhaalbaarheid niet vast.
Het rapport signaleert een aanzienlijke operationele beperking. Volgens GeekPark zorgde het inschakelen van de standaard denkmodus ervoor dat alle 2.001 voltooiingstokens in één test werden verbruikt door redenering, waardoor er geen zichtbaar antwoord overblijft. De publicatie zegt dat het uitschakelen van het redeneren met “reasoning_effort: none” één test van 23 seconden naar 7,9 seconden reduceerde en een volledige respons opleverde. KuCoin herhaalt ook de bewering van GeekPark dat de prestaties van de multimodale agent van het model “bijna” op het niveau van Opus-4.8 lagen en dat de prestaties van alleen tekst vergelijkbaar bleven met V4-Flash. Geen van beide beweringen wordt onafhankelijk bevestigd in de bron.
Waarom het ertoe doet
Als de gerapporteerde tokenefficiëntie en visuele prestaties standhouden, zou de dienst beeldbewuste AI-agents goedkoper kunnen maken in het gebruik, met name voor browser-, interface-begrip- en codegeneratietaken. De praktische waarde blijft onzeker omdat het rapport gebaseerd is op de tests van één enkele publicatie en geen betrouwbaarheid over bredere werklasten vaststelt.
De centrale betekenis is zowel economisch als technisch. Beeldbewuste agenten moeten herhaaldelijk screenshots, documenten of visuele interfaces interpreteren voordat ze kunnen handelen. Als elke afbeelding aanzienlijk minder invoertokens verbruikt, zouden de kosten van taken zoals browsernavigatie, interfacetests en conversie van screenshot naar code kunnen dalen. Dat zou visuele mogelijkheden praktisch kunnen maken in meer agentworkflows, vooral wanneer een agent veel afbeeldingen onderzoekt of dezelfde visuele context opnieuw bezoekt via een bestandsverwijzing.
De gerapporteerde Files API zou ook onnodige hertransmissie kunnen verminderen. Het hergebruiken van een geüploade afbeelding via een bestandsidentificatie kan workflows vereenvoudigen die herhaalde analyse vereisen, hoewel de bron niet documenteert bewaartermijnen, toegangscontroles, verwijderingsprocedures, bestandsgroottelimieten en of geüploade afbeeldingen worden gebruikt voor training. Deze weglatingen zijn van belang voor organisaties die omgaan met privéontwerpen, klantinformatie of andere gevoelige visuele gegevens. Het rapport biedt geen onafhankelijke privacy- of beveiligingsbeoordeling.
De lancering is ook relevant voor de concurrentie tussen goedkopere multimodale modellen. DeepSeek zou de visiemogelijkheden op zijn Flash-model hebben geplaatst in plaats van op zijn grotere Pro-model, een keuze uit de artikelframes als een manier om de gevolgtrekkingskosten beheersbaar te houden. Maar de vergelijking met GPT, Claude en Opus-4.8 is in het aangeleverde materiaal geen like-for-like evaluatie. Token-accounting kan variëren per afbeeldingsgrootte, detailniveau, codering en provider, terwijl de visuele kwaliteit afhankelijk is van de taak. Het rapport ondersteunt daarom de interesse in de richting van het product, en niet de conclusie dat het al goedkoper of beter is voor algemeen gebruik.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Ontwikkelaars en gebruikers moeten zoeken naar primaire documentatie die toegang, regionale beschikbaarheid, prijzen, limieten, ondersteunde afbeeldingsformaten en Files API-gedrag bevestigt. Onafhankelijke evaluaties moeten het visuele redeneren, de gegenereerde code, de latentie, het aantal fouten en de prestaties testen met de redeneermodus in- en uitgeschakeld. De belangrijkste onopgeloste vraag is of de gerapporteerde claims over kosten en mogelijkheden generaliseren buiten de door GeekPark beschreven demonstraties.
De eerste verificatieprioriteit is de primaire productdocumentatie. Gebruikers hebben bevestiging nodig van de openbare status van de API, de ondersteunde regio's, de prijsformule, de limieten voor de afbeeldingsresolutie, de snelheidslimieten, de maximale uitvoerlengte, het bewaar- en verwijderingsgedrag van de Files API en of de experimentele service in productie kan worden gebruikt. De bron beschrijft de service als live, maar stelt geen stabiele serviceniveauverplichting of een datum voor algemene beschikbaarheid vast.
Onafhankelijke tests moeten het visuele begrip van het model scheiden van het vermogen om code te genereren. Nuttige evaluaties zouden de gerapporteerde screenshot-naar-HTML-taken herhalen over verschillende lay-outs, beeldkwaliteiten en interfaces, en vervolgens de functionele correctheid meten in plaats van alleen de visuele gelijkenis. Tests moeten ook latentie, tokengebruik en foutpercentages vergelijken met en zonder denkmodus. Het voorbeeld met lege uitvoer in het rapport maakt configuratie tot een onmiddellijk praktisch probleem, maar het laat niet zien hoe vaak deze fout optreedt bij verzoeken.
Betrouwbaarheid en veiligheid blijven open vragen. Een model dat een screenshot kan lezen en uitvoerbare code kan genereren, kan helpen bij de toegankelijkheid, interfacemigratie en rapid prototyping, maar de gegenereerde code kan functionele, beveiligings- of toegankelijkheidsgebreken bevatten. Het aangeleverde rapport geeft geen bewijs over deze risico’s, geen systematische red-team resultaten en geen informatie over de omgang met beelden die persoonlijke of vertrouwelijke gegevens bevatten. Totdat deze vragen zijn beantwoord, is de meest verdedigbare opvatting dat DeepSeek een experimentele multimodale API heeft gerapporteerd met veelbelovende demonstraties en belangrijke beperkingen, in plaats van een geverifieerde vervanging voor gevestigde vision-systemen.