প্রতিদিন আপডেট করা হয়2528 যাচাইকৃত গল্প
এআই নিউজ। গোলমাল ছাড়া।
একটি অলাভজনক শিক্ষা দল দ্বারা সরল ইংরেজিতে ব্যাখ্যা করা পণ্য লঞ্চ, নীতি পরিবর্তন, নিরাপত্তা গবেষণা, এবং শিল্প পদক্ষেপের উৎস-চেক করা AI কভারেজ।
যাচাইকৃত সোর্সিং
প্রতিটি গল্প শক্তিশালী উপলব্ধ প্রমাণের সাথে লিঙ্ক করে: যখন উপলব্ধ মূল উত্স, অন্যথায় স্পষ্টভাবে দায়ী প্রতিবেদন।
সরল ইংরেজি
কি ঘটেছে, কেন এটা গুরুত্বপূর্ণ, এবং কি দেখতে হবে — শব্দবাক্য ছাড়া.
ফিলার নেই
যখন সংকেত পাতলা হয়, আমরা ফিড প্যাড করার পরিবর্তে কিছুই প্রকাশ করি না।
আরও গল্প
9 গল্পউদ্ভাবন
NVIDIA SkillEvaluator এর সাথে AI এজেন্ট স্কিল পারফরম্যান্সের মূল্যায়ন করা
NVIDIA SkillEvaluator একটি তিন-স্তর মূল্যায়ন প্রক্রিয়ার মাধ্যমে AI এজেন্টের কর্মক্ষমতার উপর যাচাইকৃত দক্ষতার প্রভাব পরিমাপ করে।
developer.nvidia.comউদ্ভাবন
কাগজ "ছায়া মূল্যায়ন" উপস্থাপন করে: এআই এজেন্ট ইঞ্জিনিয়ারিং করেছে কিন্তু দুটি গবেষণা প্রশ্ন ব্যর্থ হয়েছে
একটি 24-লেখক প্রিপ্রিন্টে ফ্রন্টিয়ার এআই এজেন্টরা দুটি অপ্রকাশিত নিউরিআইপিএস 2026 জমার কেন্দ্রীয় গবেষণা প্রশ্নগুলি চেষ্টা করেছিল, তারপরে গবেষণাপত্রের নিজস্ব লেখকরা ফলাফলগুলি গ্রেড করেছিলেন৷ এজেন্টরা ছয় দিন ধরে প্রকৌশল বিনা সাহায্যে পরিচালনা করেছে কিন্তু গবেষণায় দ্ব্যর্থহীনভাবে প্রত্যাখ্যান করা হয়েছে।arxiv.orgপণ্য
ওয়ার্প কোডিং এজেন্টদের ফ্লিট চালানোর জন্য একটি কনফিগার-এ-কোড সিস্টেম "ফ্যাক্টরিগুলিতে" প্রাথমিক অ্যাক্সেস খোলে
Warp ওয়ার্প ফ্যাক্টরিগুলির জন্য প্রাথমিক-অ্যাক্সেসের অনুরোধ নিচ্ছে, যা কোডিং এজেন্টদের ফ্লিটকে কোড হিসাবে সংজ্ঞায়িত করে - CLI, API, SDK এবং MCP দ্বারা চালিত একটি YAML ফাইলে রেপো, মডেল, অনুমতি এবং মানব চেকপয়েন্ট। এর অটোমেশন এবং খরচ পরিসংখ্যান বিক্রেতা দাবি: কোন মূল্য, সাধারণ প্রাপ্যতা তারিখ বা স্বাধীন পরীক্ষা.warp.devউদ্ভাবন
বেঞ্চমার্ক বলছে পেন সাউন্ড এবং হ্যান্ড মোশন থেকে শব্দ পড়ার ক্ষেত্রে শীর্ষ মাল্টিমডাল মডেলের স্কোর 10% এর নিচে
একটি নতুন arXiv কাগজ একটি পরীক্ষা প্রবর্তন করে যেখানে মডেলগুলিকে অবশ্যই পেন-স্ক্র্যাচ অডিও এবং হ্যান্ড-মুভমেন্ট ভিডিও থেকে একটি লিখিত শব্দ অনুমান করতে হবে, কোন কালি দৃশ্যমান নয়। লেখকরা 80% এর উপরে মানুষের নির্দেশিত অক্ষর নির্ভুলতা এবং 10% এর নিচে অগ্রণী মডেলের রিপোর্ট করেছেন - এবং যে মডেলগুলি উভয় পদ্ধতি প্রদান করা প্রায়শই ফলাফল খারাপ করে।arxiv.orgউদ্ভাবন
কাগজ বলছে এজেন্ট-সচেতন ক্যাশে ম্যানেজমেন্ট মাল্টি-এজেন্ট পরিবেশনে 45% পর্যন্ত ফার্স্ট-টোকেন বিলম্ব হ্রাস করে
একটি নতুন arXiv প্রিপ্রিন্ট CacheScout বর্ণনা করে, একটি ওপেন-সোর্স vLLM সার্ভারে তৈরি একটি স্তর যা পরবর্তীতে কোন এজেন্ট চালানোর সম্ভাবনা রয়েছে তার উপর ভিত্তি করে একটি মডেলের কী-মান ক্যাশে কী রাখতে হবে তা নির্ধারণ করে। লেখকরা ডবল-ডিজিটের লেটেন্সি এবং থ্রুপুট লাভের রিপোর্ট করেছেন; কাজের চাপ, মডেল এবং হার্ডওয়্যার বিমূর্তটিতে বলা হয় না।arxiv.orgউদ্ভাবন
একটি OpenAI এআই-জেনারেটেড প্রমাণের অডিট একটি বিপরীত অবস্থা খুঁজে পায় এবং একটি মেরামত প্রকাশ করে
দু'জন গবেষক বলেছেন OpenAI এর গণিতের নথির অধ্যায় 6-এ একটি লেমা প্রমাণ একটি পোলারিটি ত্রুটি রয়েছে: গড় সাফল্যের পরিপ্রেক্ষিতে একটি পরীক্ষা যেখানে পরবর্তী ধাপে একটি বড় শর্তসাপেক্ষ ব্যর্থতার প্রয়োজন। তারা একটি পাল্টা উদাহরণ এবং একটি সংশোধিত প্রমাণ দেয় এবং সতর্ক করে যে এটি অধ্যায়ের মূল উপপাদ্যের যাচাই নয়।arxiv.orgউদ্ভাবন
রেপ্লিকেশন স্টাডি বলেছে যে FLOPগুলি এখনও AI রানটাইমকে ভুলভাবে অনুমান করে, এবং প্রস্তাবিত ফিক্স নতুন হার্ডওয়্যারে ব্যর্থ হয়
কেন সমান FLOP গণনা সমান কার্যকর করার সময় বোঝায় না তা নিয়ে দুই গবেষকের একটি প্রিপ্রিন্ট একটি পূর্ববর্তী গবেষণা পুনরুত্পাদন করে। এটি অন্তর্নিহিত দাবিকে নিশ্চিত করে কিন্তু রিপোর্ট করে যে α-FLOPs সংশোধন সূত্রটি সাধারণত নতুন হার্ডওয়্যারে রানটাইমকে অবমূল্যায়ন করে, যা সূত্রটি ক্যাপচার করে না লাফ এবং দোলন দেখায়।arxiv.orgএন্টারপ্রাইজ
বেঞ্চমার্ক পেপার 26% এর নিচে সমস্ত স্কোর এলএলএম সহ এন্টারপ্রাইজ ডেটা জিজ্ঞাসা করার চারটি উপায় খুঁজে পেয়েছে
একটি নতুন arXiv প্রিপ্রিন্ট একটি সিন্থেটিক দ্বিভাষিক বেঞ্চমার্কে একে অপরের বিরুদ্ধে এন্টারপ্রাইজ ডেটাবেসগুলির প্রাকৃতিক-ভাষা অনুসন্ধানের জন্য চারটি আর্কিটেকচারকে পিট করে। কেউই প্রায় এক চতুর্থাংশের বেশি ক্ষেত্রে সঠিকভাবে উত্তর দেয়নি এবং যে ডিজাইনটি সর্বোচ্চ স্কোর করেছে সেটি সবচেয়ে নিরাপদ বা সস্তা ছিল না।arxiv.orgউদ্ভাবন
কাগজ একটি শক্তিশালী মডেলের অভিসারী পরিমাপ করে লেবেল ছাড়া AI নিরাপত্তা এজেন্টদের গ্রেড করার প্রস্তাব দেয়
একটি নতুন arXiv প্রিপ্রিন্ট যুক্তি দেয় যে নিরাপত্তা দল বিচার করতে পারে যে একটি মেমরি- বা পুনরুদ্ধার-সজ্জিত AI এজেন্ট শিখছে কিনা তা পরিমাপ করে কতদূর এটি একটি শক্তিশালী "শিক্ষক" মডেলের ফাঁক বন্ধ করে, লেবেলযুক্ত বেঞ্চমার্কের পরিবর্তে যা প্রায়শই দুর্লভ বা বাসি। একইভাবে চালিত মডেল দ্বারা বিচার করা কোন ব্যবহারযোগ্য সংকেত দেয়নি।arxiv.org
প্রতি সপ্তাহে একটি দরকারী ব্রিফিং
ফিডে বসবাস না করে এআই-এর সাথে যোগাযোগ রাখুন।
সপ্তাহের যাচাইকৃত AI খবর, আসল ডেটা, দরকারী টুল, শেখার পছন্দ এবং নতুন AI চাকরি পান।
যারা এআই শিখছেন তাদের কাছে পৌঁছান
একজন AI পেশাদার নিয়োগ করছেন বা একটি দরকারী AI পণ্য চালু করছেন? যারা এখানে শিখতে এবং অভিনয় করতে এসেছেন তাদের সামনে এটি রাখুন।
একটি AI চাকরি পোস্ট করুনএকটি AI টুল জমা দিন