সংবাদে ফিরে যান
পণ্যAI Understanding ব্রিফিং

DeepSeek এর পরীক্ষামূলক V4-ফ্ল্যাশ ভিশন API মাল্টিমডাল এজেন্টদের জন্য ইমেজ ইনপুট যোগ করে

KuCoin, GeekPark পুনঃপ্রকাশ করে, রিপোর্ট করে যে DeepSeek ইমেজ ইনপুট সহ 21 আগস্ট একটি পরীক্ষামূলক দৃষ্টি API খুলেছে, একটি রিপোর্ট করা 384-টোকেন ইমেজ খরচ এবং ভিজ্যুয়াল-টু-কোড পরীক্ষা। প্রাপ্যতা, মূল্য এবং কর্মক্ষমতা দাবি স্বাধীনভাবে নিশ্চিত করা হয়নি.

5 min readRead the linked source
Source-page capture accompanying DeepSeek’s experimental V4-Flash Vision API adds image input for multimodal agents
উৎস রেফারেন্সউৎস রেকর্ড করা হয়েছে
প্রকাশক
kucoin.com
উৎস লিঙ্ক
kucoin.comhttps://www.kucoin.com/news/flash/deepseek-launches-multimodal-vision-model-v4-flash-vision-exp
উত্স প্রকার
লিঙ্কযুক্ত উৎস — প্রাথমিক-উৎস স্থিতি প্রতিষ্ঠিত হয়নি।
এছাড়াও উদ্ধৃত

গল্প শেষ সংশোধিত

প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস)
একটি সফ্টওয়্যার সিস্টেমের জন্য একটি কাঠামোগত উপায় অন্য সিস্টেমে অনুরোধ পাঠাতে এবং প্রতিক্রিয়াগুলি গ্রহণ করার জন্য।
অনুমান
রানটাইম ফেজ যেখানে একটি প্রশিক্ষিত মডেল ভবিষ্যদ্বাণী বা আউটপুট তৈরি করে।
গ্রেডিয়েন্ট
ক্ষতি কমাতে প্রতিটি পরামিতি কতটা পরিবর্তন করা উচিত তা দেখানো একটি ভেক্টর।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

প্রকাশনার পর থেকে কি পরিবর্তন হয়েছে

  1. প্রথম প্রকাশিত
  2. KuCoin-এর রিপোর্ট, GeekPark পুনঃপ্রকাশ, বস্তুগতভাবে একই DeepSeek V4-ফ্ল্যাশ মাল্টিমোডাল-মডেল লঞ্চটি ইতিমধ্যে TahawulTech দ্বারা কভার করা অব্যাহত রয়েছে। এটি রিপোর্ট করা API ইনপুট পদ্ধতি, 384-টোকেন ইমেজ-কস্ট দাবি, ফাইল API বিশদ, ভিজ্যুয়াল-টু-কোড প্রদর্শন এবং একটি সতর্কতা যোগ করে যে যুক্তি মোড সম্পূর্ণ আউটপুট বাজেট গ্রাস করতে পারে; এই বিবরণগুলি স্বাধীনভাবে নিশ্চিত করা হয়েছে।

কি হয়েছে

GeekPark উদ্ধৃত করে KuCoin রিপোর্ট করে যে, DeepSeek 21 আগস্ট পরীক্ষামূলক V4-Flash-Vision-Exp API চালু করেছে। রিপোর্ট করা পরিষেবাটি ইনলাইন বেস64 ডেটা, বাহ্যিক URL এবং একটি ফাইল API এর মাধ্যমে ছবি গ্রহণ করে। GeekPark-এর পরীক্ষাগুলি ইমেজ-টু-কোড কাজগুলিকে বর্ণনা করেছে, কিন্তু উত্সটি DeepSeek-এর বিবৃত বেঞ্চমার্ক, মূল্য বা সাধারণ উপলব্ধতার স্বাধীন যাচাইকরণ প্রদান করে না।

KuCoin-এর 24 আগস্ট পৃষ্ঠা রিপোর্ট করে যে DeepSeek প্রযুক্তি প্রকাশনা GeekPark এবং DeepSeek-এর অফিসিয়াল WeChat অ্যাকাউন্টের জন্য দায়ী একটি ঘোষণার উদ্ধৃতি দিয়ে 21 আগস্ট একটি API-এর মাধ্যমে V4-Flash-Vision-Exp উপলব্ধ করেছে। মডেলের নামটিতে "Exp" অন্তর্ভুক্ত রয়েছে, যা স্পষ্টভাবে নথিভুক্ত সাধারণ-উপলভ্যতা লঞ্চের পরিবর্তে একটি পরীক্ষামূলক রিলিজ নির্দেশ করে৷ প্রতিবেদনে বলা হয়েছে যে ডেভেলপাররা এটিকে "ডিপসিক-ভি4-ফ্ল্যাশ-ভিশন-এক্সপ" মডেল শনাক্তকারীর সাথে ব্যবহার করতে পারেন। উত্সটি স্বাধীনভাবে একটি সর্বজনীন DeepSeek API স্পেসিফিকেশনের সাথে লিঙ্ক করে না বা প্রকাশের সময় পরিষেবাটি কতটা বিস্তৃতভাবে উপলব্ধ ছিল তা প্রতিষ্ঠিত করে না।

রিপোর্ট করা ইন্টারফেস তিনটি ধরনের ইমেজ ইনপুট গ্রহণ করে: ইনলাইন বেস64 ডেটা, এক্সটার্নাল ইউআরএল এবং DeepSeek এর ফাইল এপিআই। KuCoin বলেছে যে মডেলটির দাম V4-ফ্ল্যাশের মতো একই ভিত্তিতে করা হয়েছে এবং আলাদা ভিজ্যুয়াল-প্রসেসিং সারচার্জ ছাড়াই প্রতি ছবিতে 384টি টোকেন ব্যবহার করা হয়েছে। GeekPark GPT এবং Claude সিস্টেমে অনুরূপ রেজোলিউশনের চিত্রগুলির জন্য 800 থেকে 1,100 টোকেনের রিপোর্ট করা খরচের সাথে সেই চিত্রটির তুলনা করে এবং বলে যে DeepSeek এর ছবির খরচ অর্ধেকেরও কম। এই তুলনাগুলি উৎস দ্বারা পুনরুত্পাদিত দাবি, এই পর্যালোচনাতে স্বাধীনভাবে পরিমাপ করা ফলাফল নয়। প্রতিবেদনে আরও বলা হয়েছে যে ফাইল এপিআই ডেভেলপারদের একবার একটি ছবি আপলোড করতে দেয়, একটি ফাইল শনাক্তকারী গ্রহণ করে এবং পরবর্তী অনুরোধে এটি পুনরায় ব্যবহার করতে দেয়।

GeekPark-এর রিপোর্ট করা প্রদর্শনগুলি চিত্রগুলিকে এক্সিকিউটেবল কোডে রূপান্তর করার উপর দৃষ্টি নিবদ্ধ করে। একটি পরীক্ষায়, মডেলটি অ্যানিমেটেড ফিল্ম "নিউ লাই" থেকে একটি স্ক্রিনশট বিশ্লেষণ করেছে এবং চিত্রিত ষাঁড়টিকে পুনরুত্পাদন করার উদ্দেশ্যে SVG এবং CSS তৈরি করেছে; প্রতিবেদনে বলা হয়েছে যে প্রক্রিয়াটি 35 সেকেন্ড সময় নিয়েছে। একটি দ্বিতীয় প্রদর্শনীতে, এটি এইচটিএমএল এবং সিএসএস-এ একটি সাধারণ অন্তহীন-রানার গেম তৈরি করতে দুটি গরুর একটি স্ক্রিনশট ব্যবহার করেছে, রিপোর্টটি 36-সেকেন্ডের সমাপ্তির সময় দিয়েছে। একটি তৃতীয় পরীক্ষায় একটি পেমেন্ট-প্রোডাক্ট ল্যান্ডিং-পৃষ্ঠার স্ক্রিনশট ব্যবহার করা হয়েছে যাতে একটি অন্ধকার গ্রেডিয়েন্ট, নেভিগেশন, একটি শিরোনাম, একটি কোড ব্লক, বোতাম এবং বৈশিষ্ট্য কার্ড রয়েছে। GeekPark বলে যে মডেলটি 26 সেকেন্ডের মধ্যে প্রতিক্রিয়াশীল HTML তৈরি করেছে এবং বেশ কয়েকটি ভিজ্যুয়াল উপাদান পুনরুত্পাদন করেছে। এগুলি GeekPark দ্বারা প্রদর্শন, নিয়ন্ত্রিত বেঞ্চমার্ক নয়, এবং উত্স তাদের হার্ডওয়্যার, নেটওয়ার্ক অবস্থা, মূল্যায়নের মানদণ্ড বা পুনরাবৃত্তিযোগ্যতা স্থাপন করে না।

প্রতিবেদনটি একটি উল্লেখযোগ্য অপারেশনাল সীমাবদ্ধতা চিহ্নিত করে। GeekPark-এর মতে, ডিফল্ট চিন্তা মোড সক্ষম করার ফলে একটি পরীক্ষায় সমস্ত 2,001 সমাপ্তি টোকেন যুক্তি দ্বারা ব্যবহার করা হয়, কোন দৃশ্যমান উত্তর অবশিষ্ট থাকে না। প্রকাশনাটি বলে যে "যুক্তি_প্রচেষ্টা: কোনটিই নয়" দিয়ে যুক্তি নিষ্ক্রিয় করা একটি পরীক্ষা 23 সেকেন্ড থেকে 7.9 সেকেন্ডে কমিয়ে একটি সম্পূর্ণ প্রতিক্রিয়া তৈরি করেছে। KuCoin GeekPark-এর দাবির পুনরাবৃত্তি করে যে মডেলের মাল্টিমডাল এজেন্ট কর্মক্ষমতা Opus-4.8-এর স্তরে "প্রায়" ছিল এবং শুধুমাত্র পাঠ্য-কার্যক্ষমতা V4-ফ্ল্যাশের সাথে তুলনীয় ছিল। কোনো দাবিই স্বাধীনভাবে উৎসে নিশ্চিত করা হয়নি।

উত্স বিবরণ: kucoin.com ↗

কেন এটা গুরুত্বপূর্ণ

রিপোর্ট করা টোকেন দক্ষতা এবং ভিজ্যুয়াল পারফরম্যান্স ধরে রাখলে, পরিষেবাটি ইমেজ-সচেতন AI এজেন্টদের পরিচালনার জন্য কম ব্যয়বহুল করে তুলতে পারে, বিশেষ করে ব্রাউজার, ইন্টারফেস-বোঝা এবং কোড-জেনারেশন কাজগুলির জন্য। ব্যবহারিক মান অনিশ্চিত রয়ে গেছে কারণ প্রতিবেদনটি একটি একক প্রকাশনার পরীক্ষার উপর ভিত্তি করে এবং বৃহত্তর কাজের চাপে নির্ভরযোগ্যতা স্থাপন করে না।

কেন্দ্রীয় গুরুত্ব অর্থনৈতিক পাশাপাশি প্রযুক্তিগত। চিত্র-সচেতন এজেন্টদের অবশ্যই বারবার স্ক্রিনশট, নথি বা ভিজ্যুয়াল ইন্টারফেস ব্যাখ্যা করতে হবে তারা কাজ করার আগে। যদি প্রতিটি ছবি বস্তুগতভাবে কম ইনপুট টোকেন ব্যবহার করে, তাহলে ব্রাউজার নেভিগেশন, ইন্টারফেস পরীক্ষা এবং স্ক্রিনশট-টু-কোড রূপান্তরের মতো কাজের খরচ কমে যেতে পারে। এটি আরও এজেন্ট ওয়ার্কফ্লোতে ভিজ্যুয়াল ক্ষমতাগুলিকে ব্যবহারিক করে তুলতে পারে, বিশেষত যেখানে একটি এজেন্ট অনেকগুলি চিত্র পরীক্ষা করে বা ফাইলের রেফারেন্সের মাধ্যমে একই ভিজ্যুয়াল প্রেক্ষাপটটি পুনরায় দেখে।

রিপোর্ট করা ফাইল এপিআই অপ্রয়োজনীয় রিট্রান্সমিশন কমাতে পারে। একটি ফাইল শনাক্তকারীর মাধ্যমে একটি আপলোড করা ছবি পুনঃব্যবহার করা কার্যপ্রবাহকে সহজ করতে পারে যার জন্য বারবার বিশ্লেষণের প্রয়োজন হয়, যদিও উৎসটি ধরে রাখার সময়কাল, অ্যাক্সেস নিয়ন্ত্রণ, মুছে ফেলার পদ্ধতি, ফাইল-আকারের সীমা বা প্রশিক্ষণের জন্য আপলোড করা ছবিগুলি ব্যবহার করা হয় কিনা তা নথিভুক্ত করে না। ব্যক্তিগত ডিজাইন, গ্রাহকের তথ্য বা অন্যান্য সংবেদনশীল ভিজ্যুয়াল ডেটা পরিচালনাকারী সংস্থাগুলির জন্য এই বাদ দেওয়া গুরুত্বপূর্ণ। প্রতিবেদনে কোন স্বাধীন গোপনীয়তা বা নিরাপত্তা মূল্যায়ন প্রদান করা হয় না।

লঞ্চটি কম খরচের মাল্টিমোডাল মডেলগুলির মধ্যে প্রতিযোগিতার জন্যও প্রাসঙ্গিক। DeepSeek তার বৃহত্তর প্রো মডেলের পরিবর্তে তার ফ্ল্যাশ মডেলে দৃষ্টি ক্ষমতা রেখেছে বলে জানা গেছে, অনুমান খরচ পরিচালনাযোগ্য রাখার উপায় হিসাবে নিবন্ধ ফ্রেমগুলির একটি পছন্দ৷ কিন্তু GPT, Claude এবং Opus-4.8-এর সাথে তুলনা সরবরাহকৃত উপাদানে মূল্যায়নের মতো নয়। টোকেন অ্যাকাউন্টিং চিত্রের আকার, বিশদ স্তর, এনকোডিং এবং প্রদানকারী দ্বারা পরিবর্তিত হতে পারে, যখন চাক্ষুষ গুণমান টাস্কের উপর নির্ভর করে। প্রতিবেদনটি তাই পণ্যের দিকনির্দেশে আগ্রহকে সমর্থন করে, এটি এমন একটি উপসংহার নয় যে এটি ইতিমধ্যেই সাধারণ ব্যবহারের জন্য সস্তা বা ভাল।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

বিকাশকারী এবং ব্যবহারকারীদের অ্যাক্সেস, আঞ্চলিক প্রাপ্যতা, মূল্য, সীমা, সমর্থিত চিত্র ফর্ম্যাট এবং ফাইল API আচরণ নিশ্চিত করে প্রাথমিক ডকুমেন্টেশন সন্ধান করা উচিত। স্বাধীন মূল্যায়নের চাক্ষুষ যুক্তি, জেনারেটেড কোড, লেটেন্সি, ব্যর্থতার হার এবং কর্মক্ষমতা পরীক্ষা করা উচিত যুক্তি মোড সক্ষম এবং অক্ষম করে। প্রধান অমীমাংসিত প্রশ্ন হল রিপোর্ট করা খরচ এবং সক্ষমতা দাবিগুলি GeekPark দ্বারা বর্ণিত বিক্ষোভের বাইরে সাধারণীকরণ করে কিনা।

প্রথম যাচাইকরণের অগ্রাধিকার হল প্রাথমিক পণ্য ডকুমেন্টেশন। ব্যবহারকারীদের API এর সর্বজনীন স্থিতি, সমর্থিত অঞ্চল, মূল্যের সূত্র, চিত্র-রেজোলিউশন সীমা, হারের সীমা, সর্বোচ্চ আউটপুট দৈর্ঘ্য, ফাইল API ধারণ এবং মুছে ফেলার আচরণ এবং পরীক্ষামূলক পরিষেবাটি উত্পাদনে ব্যবহার করা যেতে পারে কিনা তা নিশ্চিত করতে হবে। উত্সটি পরিষেবাটিকে লাইভ হিসাবে বর্ণনা করে তবে একটি স্থিতিশীল পরিষেবা-স্তরের প্রতিশ্রুতি বা সাধারণ-উপলব্ধতার তারিখ স্থাপন করে না।

স্বাধীন পরীক্ষার মডেলের চাক্ষুষ বোঝাপড়াকে এর কোড-জেনারেশন ক্ষমতা থেকে আলাদা করা উচিত। দরকারী মূল্যায়ন বিভিন্ন লেআউট, চিত্রের গুণাবলী এবং ইন্টারফেস জুড়ে রিপোর্ট করা স্ক্রিনশট-টু-এইচটিএমএল কার্যগুলিকে পুনরাবৃত্তি করবে, তারপর শুধুমাত্র চাক্ষুষ সাদৃশ্যের পরিবর্তে কার্যকরী সঠিকতা পরিমাপ করবে। পরীক্ষার লেটেন্সি, টোকেন ব্যবহার এবং ত্রুটির হারের সাথে এবং চিন্তাভাবনা ছাড়াই তুলনা করা উচিত। প্রতিবেদনের খালি-আউটপুট উদাহরণটি কনফিগারেশনকে একটি তাত্ক্ষণিক ব্যবহারিক উদ্বেগের কারণ করে তোলে, তবে এটি দেখায় না যে অনুরোধগুলি জুড়ে কতবার ব্যর্থতা ঘটে।

নির্ভরযোগ্যতা এবং নিরাপত্তা উন্মুক্ত প্রশ্ন থেকে যায়। একটি মডেল যা একটি স্ক্রিনশট পড়তে পারে এবং এক্সিকিউটেবল কোড জেনারেট করতে পারে তা অ্যাক্সেসিবিলিটি, ইন্টারফেস মাইগ্রেশন এবং দ্রুত প্রোটোটাইপিংয়ের ক্ষেত্রে সাহায্য করতে পারে, তবে জেনারেট করা কোডে কার্যকরী, নিরাপত্তা বা অ্যাক্সেসযোগ্যতার ত্রুটি থাকতে পারে। সরবরাহ করা প্রতিবেদনে এই ঝুঁকিগুলি সম্পর্কে কোনও প্রমাণ নেই, কোনও নিয়মতান্ত্রিক রেড-টিম ফলাফল এবং ব্যক্তিগত বা গোপনীয় ডেটা ধারণকারী ছবিগুলি পরিচালনার বিষয়ে কোনও তথ্য নেই। যতক্ষণ না এই প্রশ্নগুলির উত্তর দেওয়া হয়, ততক্ষণ পর্যন্ত সবচেয়ে সংরক্ষিত দৃষ্টিভঙ্গি হল যে DeepSeek একটি পরীক্ষামূলক মাল্টিমোডাল এপিআই রিপোর্ট করেছে যার প্রতিশ্রুতিবদ্ধ প্রদর্শন এবং গুরুত্বপূর্ণ সীমা রয়েছে, প্রতিষ্ঠিত দৃষ্টি সিস্টেমের জন্য একটি যাচাইকৃত প্রতিস্থাপনের পরিবর্তে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই এজেন্টChatGPT ও এলএলএমট্রান্সফরমারআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন

আপডেট এবং সংশোধন

যখন বিকাশমান ঘটনা বস্তুগতভাবে পরিবর্তিত হয় তখন এই ক্যানোনিকাল গল্পটি আপডেট করা হয়। এর URL এবং মূল প্রকাশনার তারিখ কখনই পরিবর্তন হয় না।

  • KuCoin-এর রিপোর্ট, GeekPark পুনঃপ্রকাশ, বস্তুগতভাবে একই DeepSeek V4-ফ্ল্যাশ মাল্টিমোডাল-মডেল লঞ্চটি ইতিমধ্যে TahawulTech দ্বারা কভার করা অব্যাহত রয়েছে। এটি রিপোর্ট করা API ইনপুট পদ্ধতি, 384-টোকেন ইমেজ-কস্ট দাবি, ফাইল API বিশদ, ভিজ্যুয়াল-টু-কোড প্রদর্শন এবং একটি সতর্কতা যোগ করে যে যুক্তি মোড সম্পূর্ণ আউটপুট বাজেট গ্রাস করতে পারে; এই বিবরণগুলি স্বাধীনভাবে নিশ্চিত করা হয়েছে।
পাবলিক সংশোধন লগ দেখুন
এই দরকারী পাওয়া গেছে?