কি হয়েছে
GeekPark উদ্ধৃত করে KuCoin রিপোর্ট করে যে, DeepSeek 21 আগস্ট পরীক্ষামূলক V4-Flash-Vision-Exp API চালু করেছে। রিপোর্ট করা পরিষেবাটি ইনলাইন বেস64 ডেটা, বাহ্যিক URL এবং একটি ফাইল API এর মাধ্যমে ছবি গ্রহণ করে। GeekPark-এর পরীক্ষাগুলি ইমেজ-টু-কোড কাজগুলিকে বর্ণনা করেছে, কিন্তু উত্সটি DeepSeek-এর বিবৃত বেঞ্চমার্ক, মূল্য বা সাধারণ উপলব্ধতার স্বাধীন যাচাইকরণ প্রদান করে না।
KuCoin-এর 24 আগস্ট পৃষ্ঠা রিপোর্ট করে যে DeepSeek প্রযুক্তি প্রকাশনা GeekPark এবং DeepSeek-এর অফিসিয়াল WeChat অ্যাকাউন্টের জন্য দায়ী একটি ঘোষণার উদ্ধৃতি দিয়ে 21 আগস্ট একটি API-এর মাধ্যমে V4-Flash-Vision-Exp উপলব্ধ করেছে। মডেলের নামটিতে "Exp" অন্তর্ভুক্ত রয়েছে, যা স্পষ্টভাবে নথিভুক্ত সাধারণ-উপলভ্যতা লঞ্চের পরিবর্তে একটি পরীক্ষামূলক রিলিজ নির্দেশ করে৷ প্রতিবেদনে বলা হয়েছে যে ডেভেলপাররা এটিকে "ডিপসিক-ভি4-ফ্ল্যাশ-ভিশন-এক্সপ" মডেল শনাক্তকারীর সাথে ব্যবহার করতে পারেন। উত্সটি স্বাধীনভাবে একটি সর্বজনীন DeepSeek API স্পেসিফিকেশনের সাথে লিঙ্ক করে না বা প্রকাশের সময় পরিষেবাটি কতটা বিস্তৃতভাবে উপলব্ধ ছিল তা প্রতিষ্ঠিত করে না।
রিপোর্ট করা ইন্টারফেস তিনটি ধরনের ইমেজ ইনপুট গ্রহণ করে: ইনলাইন বেস64 ডেটা, এক্সটার্নাল ইউআরএল এবং DeepSeek এর ফাইল এপিআই। KuCoin বলেছে যে মডেলটির দাম V4-ফ্ল্যাশের মতো একই ভিত্তিতে করা হয়েছে এবং আলাদা ভিজ্যুয়াল-প্রসেসিং সারচার্জ ছাড়াই প্রতি ছবিতে 384টি টোকেন ব্যবহার করা হয়েছে। GeekPark GPT এবং Claude সিস্টেমে অনুরূপ রেজোলিউশনের চিত্রগুলির জন্য 800 থেকে 1,100 টোকেনের রিপোর্ট করা খরচের সাথে সেই চিত্রটির তুলনা করে এবং বলে যে DeepSeek এর ছবির খরচ অর্ধেকেরও কম। এই তুলনাগুলি উৎস দ্বারা পুনরুত্পাদিত দাবি, এই পর্যালোচনাতে স্বাধীনভাবে পরিমাপ করা ফলাফল নয়। প্রতিবেদনে আরও বলা হয়েছে যে ফাইল এপিআই ডেভেলপারদের একবার একটি ছবি আপলোড করতে দেয়, একটি ফাইল শনাক্তকারী গ্রহণ করে এবং পরবর্তী অনুরোধে এটি পুনরায় ব্যবহার করতে দেয়।
GeekPark-এর রিপোর্ট করা প্রদর্শনগুলি চিত্রগুলিকে এক্সিকিউটেবল কোডে রূপান্তর করার উপর দৃষ্টি নিবদ্ধ করে। একটি পরীক্ষায়, মডেলটি অ্যানিমেটেড ফিল্ম "নিউ লাই" থেকে একটি স্ক্রিনশট বিশ্লেষণ করেছে এবং চিত্রিত ষাঁড়টিকে পুনরুত্পাদন করার উদ্দেশ্যে SVG এবং CSS তৈরি করেছে; প্রতিবেদনে বলা হয়েছে যে প্রক্রিয়াটি 35 সেকেন্ড সময় নিয়েছে। একটি দ্বিতীয় প্রদর্শনীতে, এটি এইচটিএমএল এবং সিএসএস-এ একটি সাধারণ অন্তহীন-রানার গেম তৈরি করতে দুটি গরুর একটি স্ক্রিনশট ব্যবহার করেছে, রিপোর্টটি 36-সেকেন্ডের সমাপ্তির সময় দিয়েছে। একটি তৃতীয় পরীক্ষায় একটি পেমেন্ট-প্রোডাক্ট ল্যান্ডিং-পৃষ্ঠার স্ক্রিনশট ব্যবহার করা হয়েছে যাতে একটি অন্ধকার গ্রেডিয়েন্ট, নেভিগেশন, একটি শিরোনাম, একটি কোড ব্লক, বোতাম এবং বৈশিষ্ট্য কার্ড রয়েছে। GeekPark বলে যে মডেলটি 26 সেকেন্ডের মধ্যে প্রতিক্রিয়াশীল HTML তৈরি করেছে এবং বেশ কয়েকটি ভিজ্যুয়াল উপাদান পুনরুত্পাদন করেছে। এগুলি GeekPark দ্বারা প্রদর্শন, নিয়ন্ত্রিত বেঞ্চমার্ক নয়, এবং উত্স তাদের হার্ডওয়্যার, নেটওয়ার্ক অবস্থা, মূল্যায়নের মানদণ্ড বা পুনরাবৃত্তিযোগ্যতা স্থাপন করে না।
প্রতিবেদনটি একটি উল্লেখযোগ্য অপারেশনাল সীমাবদ্ধতা চিহ্নিত করে। GeekPark-এর মতে, ডিফল্ট চিন্তা মোড সক্ষম করার ফলে একটি পরীক্ষায় সমস্ত 2,001 সমাপ্তি টোকেন যুক্তি দ্বারা ব্যবহার করা হয়, কোন দৃশ্যমান উত্তর অবশিষ্ট থাকে না। প্রকাশনাটি বলে যে "যুক্তি_প্রচেষ্টা: কোনটিই নয়" দিয়ে যুক্তি নিষ্ক্রিয় করা একটি পরীক্ষা 23 সেকেন্ড থেকে 7.9 সেকেন্ডে কমিয়ে একটি সম্পূর্ণ প্রতিক্রিয়া তৈরি করেছে। KuCoin GeekPark-এর দাবির পুনরাবৃত্তি করে যে মডেলের মাল্টিমডাল এজেন্ট কর্মক্ষমতা Opus-4.8-এর স্তরে "প্রায়" ছিল এবং শুধুমাত্র পাঠ্য-কার্যক্ষমতা V4-ফ্ল্যাশের সাথে তুলনীয় ছিল। কোনো দাবিই স্বাধীনভাবে উৎসে নিশ্চিত করা হয়নি।
কেন এটা গুরুত্বপূর্ণ
রিপোর্ট করা টোকেন দক্ষতা এবং ভিজ্যুয়াল পারফরম্যান্স ধরে রাখলে, পরিষেবাটি ইমেজ-সচেতন AI এজেন্টদের পরিচালনার জন্য কম ব্যয়বহুল করে তুলতে পারে, বিশেষ করে ব্রাউজার, ইন্টারফেস-বোঝা এবং কোড-জেনারেশন কাজগুলির জন্য। ব্যবহারিক মান অনিশ্চিত রয়ে গেছে কারণ প্রতিবেদনটি একটি একক প্রকাশনার পরীক্ষার উপর ভিত্তি করে এবং বৃহত্তর কাজের চাপে নির্ভরযোগ্যতা স্থাপন করে না।
কেন্দ্রীয় গুরুত্ব অর্থনৈতিক পাশাপাশি প্রযুক্তিগত। চিত্র-সচেতন এজেন্টদের অবশ্যই বারবার স্ক্রিনশট, নথি বা ভিজ্যুয়াল ইন্টারফেস ব্যাখ্যা করতে হবে তারা কাজ করার আগে। যদি প্রতিটি ছবি বস্তুগতভাবে কম ইনপুট টোকেন ব্যবহার করে, তাহলে ব্রাউজার নেভিগেশন, ইন্টারফেস পরীক্ষা এবং স্ক্রিনশট-টু-কোড রূপান্তরের মতো কাজের খরচ কমে যেতে পারে। এটি আরও এজেন্ট ওয়ার্কফ্লোতে ভিজ্যুয়াল ক্ষমতাগুলিকে ব্যবহারিক করে তুলতে পারে, বিশেষত যেখানে একটি এজেন্ট অনেকগুলি চিত্র পরীক্ষা করে বা ফাইলের রেফারেন্সের মাধ্যমে একই ভিজ্যুয়াল প্রেক্ষাপটটি পুনরায় দেখে।
রিপোর্ট করা ফাইল এপিআই অপ্রয়োজনীয় রিট্রান্সমিশন কমাতে পারে। একটি ফাইল শনাক্তকারীর মাধ্যমে একটি আপলোড করা ছবি পুনঃব্যবহার করা কার্যপ্রবাহকে সহজ করতে পারে যার জন্য বারবার বিশ্লেষণের প্রয়োজন হয়, যদিও উৎসটি ধরে রাখার সময়কাল, অ্যাক্সেস নিয়ন্ত্রণ, মুছে ফেলার পদ্ধতি, ফাইল-আকারের সীমা বা প্রশিক্ষণের জন্য আপলোড করা ছবিগুলি ব্যবহার করা হয় কিনা তা নথিভুক্ত করে না। ব্যক্তিগত ডিজাইন, গ্রাহকের তথ্য বা অন্যান্য সংবেদনশীল ভিজ্যুয়াল ডেটা পরিচালনাকারী সংস্থাগুলির জন্য এই বাদ দেওয়া গুরুত্বপূর্ণ। প্রতিবেদনে কোন স্বাধীন গোপনীয়তা বা নিরাপত্তা মূল্যায়ন প্রদান করা হয় না।
লঞ্চটি কম খরচের মাল্টিমোডাল মডেলগুলির মধ্যে প্রতিযোগিতার জন্যও প্রাসঙ্গিক। DeepSeek তার বৃহত্তর প্রো মডেলের পরিবর্তে তার ফ্ল্যাশ মডেলে দৃষ্টি ক্ষমতা রেখেছে বলে জানা গেছে, অনুমান খরচ পরিচালনাযোগ্য রাখার উপায় হিসাবে নিবন্ধ ফ্রেমগুলির একটি পছন্দ৷ কিন্তু GPT, Claude এবং Opus-4.8-এর সাথে তুলনা সরবরাহকৃত উপাদানে মূল্যায়নের মতো নয়। টোকেন অ্যাকাউন্টিং চিত্রের আকার, বিশদ স্তর, এনকোডিং এবং প্রদানকারী দ্বারা পরিবর্তিত হতে পারে, যখন চাক্ষুষ গুণমান টাস্কের উপর নির্ভর করে। প্রতিবেদনটি তাই পণ্যের দিকনির্দেশে আগ্রহকে সমর্থন করে, এটি এমন একটি উপসংহার নয় যে এটি ইতিমধ্যেই সাধারণ ব্যবহারের জন্য সস্তা বা ভাল।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
বিকাশকারী এবং ব্যবহারকারীদের অ্যাক্সেস, আঞ্চলিক প্রাপ্যতা, মূল্য, সীমা, সমর্থিত চিত্র ফর্ম্যাট এবং ফাইল API আচরণ নিশ্চিত করে প্রাথমিক ডকুমেন্টেশন সন্ধান করা উচিত। স্বাধীন মূল্যায়নের চাক্ষুষ যুক্তি, জেনারেটেড কোড, লেটেন্সি, ব্যর্থতার হার এবং কর্মক্ষমতা পরীক্ষা করা উচিত যুক্তি মোড সক্ষম এবং অক্ষম করে। প্রধান অমীমাংসিত প্রশ্ন হল রিপোর্ট করা খরচ এবং সক্ষমতা দাবিগুলি GeekPark দ্বারা বর্ণিত বিক্ষোভের বাইরে সাধারণীকরণ করে কিনা।
প্রথম যাচাইকরণের অগ্রাধিকার হল প্রাথমিক পণ্য ডকুমেন্টেশন। ব্যবহারকারীদের API এর সর্বজনীন স্থিতি, সমর্থিত অঞ্চল, মূল্যের সূত্র, চিত্র-রেজোলিউশন সীমা, হারের সীমা, সর্বোচ্চ আউটপুট দৈর্ঘ্য, ফাইল API ধারণ এবং মুছে ফেলার আচরণ এবং পরীক্ষামূলক পরিষেবাটি উত্পাদনে ব্যবহার করা যেতে পারে কিনা তা নিশ্চিত করতে হবে। উত্সটি পরিষেবাটিকে লাইভ হিসাবে বর্ণনা করে তবে একটি স্থিতিশীল পরিষেবা-স্তরের প্রতিশ্রুতি বা সাধারণ-উপলব্ধতার তারিখ স্থাপন করে না।
স্বাধীন পরীক্ষার মডেলের চাক্ষুষ বোঝাপড়াকে এর কোড-জেনারেশন ক্ষমতা থেকে আলাদা করা উচিত। দরকারী মূল্যায়ন বিভিন্ন লেআউট, চিত্রের গুণাবলী এবং ইন্টারফেস জুড়ে রিপোর্ট করা স্ক্রিনশট-টু-এইচটিএমএল কার্যগুলিকে পুনরাবৃত্তি করবে, তারপর শুধুমাত্র চাক্ষুষ সাদৃশ্যের পরিবর্তে কার্যকরী সঠিকতা পরিমাপ করবে। পরীক্ষার লেটেন্সি, টোকেন ব্যবহার এবং ত্রুটির হারের সাথে এবং চিন্তাভাবনা ছাড়াই তুলনা করা উচিত। প্রতিবেদনের খালি-আউটপুট উদাহরণটি কনফিগারেশনকে একটি তাত্ক্ষণিক ব্যবহারিক উদ্বেগের কারণ করে তোলে, তবে এটি দেখায় না যে অনুরোধগুলি জুড়ে কতবার ব্যর্থতা ঘটে।
নির্ভরযোগ্যতা এবং নিরাপত্তা উন্মুক্ত প্রশ্ন থেকে যায়। একটি মডেল যা একটি স্ক্রিনশট পড়তে পারে এবং এক্সিকিউটেবল কোড জেনারেট করতে পারে তা অ্যাক্সেসিবিলিটি, ইন্টারফেস মাইগ্রেশন এবং দ্রুত প্রোটোটাইপিংয়ের ক্ষেত্রে সাহায্য করতে পারে, তবে জেনারেট করা কোডে কার্যকরী, নিরাপত্তা বা অ্যাক্সেসযোগ্যতার ত্রুটি থাকতে পারে। সরবরাহ করা প্রতিবেদনে এই ঝুঁকিগুলি সম্পর্কে কোনও প্রমাণ নেই, কোনও নিয়মতান্ত্রিক রেড-টিম ফলাফল এবং ব্যক্তিগত বা গোপনীয় ডেটা ধারণকারী ছবিগুলি পরিচালনার বিষয়ে কোনও তথ্য নেই। যতক্ষণ না এই প্রশ্নগুলির উত্তর দেওয়া হয়, ততক্ষণ পর্যন্ত সবচেয়ে সংরক্ষিত দৃষ্টিভঙ্গি হল যে DeepSeek একটি পরীক্ষামূলক মাল্টিমোডাল এপিআই রিপোর্ট করেছে যার প্রতিশ্রুতিবদ্ধ প্রদর্শন এবং গুরুত্বপূর্ণ সীমা রয়েছে, প্রতিষ্ঠিত দৃষ্টি সিস্টেমের জন্য একটি যাচাইকৃত প্রতিস্থাপনের পরিবর্তে।