Zpět na Novinky
ProduktInstruktáž AI Understanding

Experimentální API V4-Flash Vision API DeepSeek přidává obrazový vstup pro multimodální agenty

KuCoin, znovu publikující GeekPark, uvádí, že DeepSeek otevřelo 21. srpna experimentální rozhraní API pro vidění s obrazovými vstupy, hlášenou cenou obrazu 384 tokenů a testy vizuálního kódu. Požadavky na dostupnost, cenu a výkon nebyly nezávisle potvrzeny.

5 min readRead the linked source
Source-page capture accompanying DeepSeek’s experimental V4-Flash Vision API adds image input for multimodal agents
Odkaz na zdrojZdroj zaznamenán
Vydavatel
kucoin.com
Odkaz na zdroj
kucoin.comhttps://www.kucoin.com/news/flash/deepseek-launches-multimodal-vision-model-v4-flash-vision-exp
Typ zdroje
Propojený zdroj — stav primárního zdroje nebyl stanoven.
Také citováno

Příběh naposledy revidován

KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

API (Application Programming Interface)
Strukturovaný způsob, jak jeden softwarový systém posílat požadavky a přijímat odpovědi z jiného systému.
Vyvození
Fáze běhu, kdy trénovaný model generuje předpovědi nebo výstupy.
Gradient
Vektor ukazující, jak moc by se měl každý parametr změnit, aby se snížila ztráta.
Otestujte seKvíz s vysvětlením modelů umělé inteligence

Co se změnilo od vydání

  1. Poprvé zveřejněno
  2. Zpráva společnosti KuCoin, která znovu publikuje GeekPark, v podstatě pokračuje ve stejném spuštění multimodálního modelu DeepSeek V4-Flash, který je již pokryt TahawulTech. Přidává hlášené vstupní metody API, 384-tokenovou deklaraci nákladů na obrázek, podrobnosti o Files API, ukázky vizuálně-kódu a varování, že režim uvažování může spotřebovat celý výstupní rozpočet; tyto podrobnosti zůstávají nezávisle potvrzeny.

Co se stalo

KuCoin hlásí s odkazem na GeekPark, že DeepSeek spustilo experimentální V4-Flash-Vision-Exp API 21. srpna. Hlášená služba přijímá obrázky prostřednictvím inline dat base64, externích URL a Files API. Testy GeekPark popisovaly úlohy z obrázku do kódu, ale zdroj neposkytuje nezávislé ověření uvedených benchmarků, cen nebo obecné dostupnosti DeepSeek.

Stránka KuCoin z 24. srpna uvádí, že DeepSeek zpřístupnil V4-Flash-Vision-Exp prostřednictvím API 21. srpna, s odkazem na technologickou publikaci GeekPark a oznámení připisované oficiálnímu účtu WeChat DeepSeek. Název modelu zahrnuje „Exp“, což znamená spíše experimentální vydání než jasně zdokumentované spuštění obecné dostupnosti. Zpráva říká, že vývojáři jej mohou vyvolat s identifikátorem modelu „deepseek-v4-flash-vision-exp“. Zdroj nezávisle neodkazuje na veřejnou specifikaci API DeepSeek ani neurčuje, jak široce byla služba dostupná v době zveřejnění.

Nahlášené rozhraní přijímá tři formy vstupu obrázků: inline data base64, externí adresy URL a DeepSeek Files API. KuCoin říká, že model má stejnou cenu jako V4-Flash a používá 384 tokenů na obrázek, bez zvláštního příplatku za vizuální zpracování. GeekPark porovnává toto číslo s hlášenou spotřebou 800 až 1 100 tokenů pro obrázky podobného rozlišení v systémech GPT a Claude a říká, že náklady na obrázky DeepSeek jsou méně než poloviční. Tato srovnání jsou tvrzeními reprodukovanými zdrojem, nikoli výsledky nezávisle měřenými v tomto přehledu. Zpráva také říká, že Files API umožňuje vývojářům nahrát obrázek jednou, získat identifikátor souboru a znovu jej použít v pozdějších požadavcích.

Uváděné demonstrace GeekParku se zaměřily na převod obrázků na spustitelný kód. V jednom testu model analyzoval snímek obrazovky z animovaného filmu „Niu Lai“ a vygeneroval SVG a CSS určené k reprodukci zobrazeného býka; zpráva říká, že proces trval 35 sekund. Ve druhé ukázce použil snímek obrazovky dvou krav k vytvoření jednoduché hry s nekonečným běhounem v HTML a CSS, přičemž sestava udávala čas dokončení 36 sekund. Třetí test použil snímek vstupní stránky platebního produktu obsahující tmavý přechod, navigaci, nadpis, blok kódu, tlačítka a karty funkcí. GeekPark říká, že model vygeneroval responzivní HTML za 26 sekund a reprodukoval několik vizuálních prvků. Jedná se o ukázky GeekPark, ne řízené benchmarky a zdroj nestanovuje jejich hardware, síťové podmínky, hodnotící kritéria ani opakovatelnost.

Zpráva uvádí významné provozní omezení. Podle GeekPark povolení výchozího režimu myšlení způsobilo, že všech 2 001 žetonů dokončení v jednom testu bylo spotřebováno uvažováním, takže nezůstala žádná viditelná odpověď. Publikace říká, že deaktivace uvažování pomocí „reasoning_effort: none“ zkrátila jeden test z 23 sekund na 7,9 sekundy a přinesla kompletní odpověď. KuCoin také opakuje tvrzení GeekParku, že výkon multimodálního agenta modelu byl „téměř“ na úrovni Opus-4.8 a že výkon pouze pro text zůstal srovnatelný s V4-Flash. Žádné tvrzení není nezávisle potvrzeno ve zdroji.

Podrobnosti o zdroji: kucoin.com ↗

Proč na tom záleží

Pokud vykázaná efektivita tokenu a vizuální výkon vydrží, služba by mohla snížit náklady na provoz agentů AI s ohledem na obrázky, zejména pro úlohy týkající se prohlížeče, porozumění rozhraní a generování kódu. Praktická hodnota zůstává nejistá, protože zpráva je založena na testech jedné publikace a nestanoví spolehlivost napříč širšími pracovními zátěžemi.

Ústřední význam je ekonomický i technický. Agenti, kteří si uvědomují obraz, musí opakovaně interpretovat snímky obrazovky, dokumenty nebo vizuální rozhraní, než budou moci jednat. Pokud každý obrázek spotřebuje podstatně méně vstupních tokenů, mohou se snížit náklady na úkoly, jako je navigace v prohlížeči, testování rozhraní a převod screenshotů na kód. To by mohlo učinit vizuální funkce praktickými ve více pracovních postupech agentů, zejména tam, kde agent zkoumá mnoho obrázků nebo znovu navštěvuje stejný vizuální kontext prostřednictvím odkazu na soubor.

Hlášené Files API by také mohlo snížit zbytečné opakované vysílání. Opětovné použití nahraného obrázku prostřednictvím identifikátoru souboru může zjednodušit pracovní postupy, které vyžadují opakovanou analýzu, ačkoli zdroj neuvádí doby uchovávání, řízení přístupu, postupy mazání, omezení velikosti souborů ani to, zda se nahrané obrázky používají pro školení. Tato opomenutí jsou důležitá pro organizace zpracovávající soukromé návrhy, informace o zákaznících nebo jiná citlivá vizuální data. Zpráva neposkytuje žádné nezávislé posouzení soukromí nebo bezpečnosti.

Uvedení na trh je také relevantní pro konkurenci mezi levnějšími multimodálními modely. Uvádí se, že DeepSeek umístil schopnost vidění do svého modelu Flash spíše než do svého většího modelu Pro, což je volba rámů článku jako způsob, jak udržet náklady na odvození zvládnutelné. Ale srovnání s GPT, Claude a Opus-4.8 není v dodaném materiálu stejné hodnocení. Účtování tokenů se může lišit podle velikosti obrázku, úrovně podrobností, kódování a poskytovatele, zatímco vizuální kvalita závisí na úkolu. Zpráva proto podporuje zájem o směřování produktu, nikoli závěr, že je již levnější nebo lepší pro obecné použití.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Na co se dále dívat

Vývojáři a uživatelé by měli hledat primární dokumentaci potvrzující přístup, regionální dostupnost, ceny, limity, podporované formáty obrázků a chování Files API. Nezávislá hodnocení by měla testovat vizuální uvažování, generovaný kód, latenci, poruchovost a výkon s povoleným a zakázaným režimem uvažování. Hlavní nevyřešenou otázkou je, zda hlášené nároky na náklady a schopnosti zobecňují nad rámec demonstrací popsaných GeekParkem.

První prioritou ověřování je primární dokumentace produktu. Uživatelé potřebují potvrzení o veřejném stavu API, podporovaných oblastech, cenovém vzorci, limitech rozlišení obrázků, limitech rychlosti, maximální délce výstupu, chování Files API uchovávání a mazání a zda lze experimentální službu použít v produkci. Zdroj popisuje službu jako aktivní, ale nestanovuje stabilní závazek úrovně služby ani datum obecné dostupnosti.

Nezávislé testování by mělo oddělit vizuální porozumění modelu od jeho schopnosti generovat kód. Užitečná hodnocení by opakovala nahlášené úlohy ze snímků obrazovky do HTML napříč různými rozvrženími, kvalitami obrázků a rozhraními a pak by měřila funkční správnost spíše než samotnou vizuální podobnost. Testy by také měly porovnávat latenci, použití tokenů a chybovost s režimem myšlení a bez něj. Příklad prázdného výstupu sestavy činí z konfigurace bezprostřední praktický problém, ale neukazuje, jak často k tomuto selhání u požadavků dochází.

Spolehlivost a bezpečnost zůstávají otevřenými otázkami. Model, který dokáže přečíst snímek obrazovky a vygenerovat spustitelný kód, může pomoci s přístupností, migrací rozhraní a rychlým prototypováním, ale vygenerovaný kód může obsahovat funkční, bezpečnostní nebo přístupové vady. Dodaná zpráva neposkytuje žádné důkazy o těchto rizicích, žádné systematické výsledky červeného týmu a žádné informace o manipulaci se snímky obsahujícími osobní nebo důvěrná data. Dokud nebudou tyto otázky zodpovězeny, nejobhajitelnější názor je, že DeepSeek ohlásil experimentální multimodální API se slibnými demonstracemi a důležitými limity, spíše než ověřenou náhradu za zavedené systémy vidění.

Související průvodci a kvízy

Vysvětlení modelů AIAgenti AIChatGPT a LLMTransformátoryOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníkuPostupujte podle sledování vydání modelu AI

Aktualizace a opravy

Tento kanonický příběh je aktualizován na místě, když se rozvíjející se událost podstatně změní. Jeho URL a původní datum vydání se nikdy nemění.

  • Zpráva společnosti KuCoin, která znovu publikuje GeekPark, v podstatě pokračuje ve stejném spuštění multimodálního modelu DeepSeek V4-Flash, který je již pokryt TahawulTech. Přidává hlášené vstupní metody API, 384-tokenovou deklaraci nákladů na obrázek, podrobnosti o Files API, ukázky vizuálně-kódu a varování, že režim uvažování může spotřebovat celý výstupní rozpočet; tyto podrobnosti zůstávají nezávisle potvrzeny.
Viz veřejný protokol oprav
Považujete to za užitečné?