प्रतिदिन अद्यतन किया जाता है2528 सत्यापित कहानियाँ
एआई न्यूज। बिना शोर के.
उत्पाद लॉन्च, नीति परिवर्तन, सुरक्षा अनुसंधान और उद्योग चाल की स्रोत-जांच की गई एआई कवरेज, एक गैर-लाभकारी शिक्षा टीम द्वारा सरल अंग्रेजी में समझाई गई है।
सत्यापित सोर्सिंग
प्रत्येक कहानी सबसे मजबूत उपलब्ध साक्ष्य से जुड़ी होती है: उपलब्ध होने पर मूल स्रोत, अन्यथा स्पष्ट रूप से जिम्मेदार रिपोर्टिंग।
सादा अंग्रेजी
क्या हुआ, यह क्यों मायने रखता है, और क्या देखना है - शब्दजाल के बिना।
कोई भराव नहीं
जब सिग्नल पतला होता है, तो हम फ़ीड को पैड करने के बजाय कुछ भी प्रकाशित नहीं करते हैं।
और कहानियाँ
9 कहानियांनवीनता
NVIDIA स्किलइवैल्यूएटर के साथ एआई एजेंट कौशल प्रदर्शन का मूल्यांकन
NVIDIA स्किलइवैल्यूएटर तीन स्तरीय मूल्यांकन प्रक्रिया के माध्यम से एआई एजेंट के प्रदर्शन पर सत्यापित कौशल के प्रभाव को मापता है।
developer.nvidia.comनवीनता
पेपर "छाया मूल्यांकन" का परिचय देता है: एआई एजेंटों ने इंजीनियरिंग की लेकिन दो शोध प्रश्नों में असफल रहे
एक 24-लेखक प्रीप्रिंट में फ्रंटियर एआई एजेंटों ने दो अप्रकाशित NeurIPS 2026 सबमिशन के केंद्रीय अनुसंधान प्रश्नों का प्रयास किया था, फिर पेपर के अपने लेखकों ने परिणामों को ग्रेड किया था। एजेंटों ने छह दिनों तक बिना किसी सहायता के इंजीनियरिंग को संभाला लेकिन अनुसंधान पर स्पष्ट रूप से खारिज कर दिया गया।arxiv.orgउत्पाद
वॉर्प ने कोडिंग एजेंटों के बेड़े को चलाने के लिए एक कॉन्फिग-ए-कोड सिस्टम "फैक्ट्रियों" तक प्रारंभिक पहुंच खोली है।
Warp, Warp फ़ैक्टरियों के लिए अर्ली-एक्सेस अनुरोध ले रहा है, जो CLI, API, SDK और MCP द्वारा संचालित एक YAML फ़ाइल में कोडिंग एजेंटों के बेड़े को कोड - रिपो, मॉडल, अनुमतियाँ और मानव चौकियों के रूप में परिभाषित करता है। इसके स्वचालन और लागत के आंकड़े विक्रेता के दावे हैं: कोई मूल्य निर्धारण, सामान्य उपलब्धता तिथि या स्वतंत्र परीक्षण नहीं।warp.devनवीनता
बेंचमार्क का कहना है कि शीर्ष मल्टीमॉडल मॉडल पेन साउंड और हैंड मोशन से शब्द पढ़ने में 10% से कम स्कोर करते हैं
एक नया arXiv पेपर एक परीक्षण पेश करता है जिसमें मॉडलों को पेन-स्क्रैच ऑडियो और हाथ-मूवमेंट वीडियो से एक लिखित शब्द का अनुमान लगाना होगा, जिसमें कोई स्याही दिखाई नहीं देगी। लेखक रिपोर्ट करते हैं कि 80% से ऊपर के मनुष्यों ने अक्षर सटीकता का आदेश दिया और अग्रणी मॉडल 10% से नीचे - और मॉडल को दोनों तौर-तरीके देने से अक्सर परिणाम खराब हो जाते हैं।arxiv.orgनवीनता
पेपर का कहना है कि एजेंट-अवेयर कैश प्रबंधन मल्टी-एजेंट सर्विंग में प्रथम-टोकन विलंब को 45% तक कम कर देता है
एक नया arXiv प्रीप्रिंट कैशस्काउट का वर्णन करता है, जो ओपन-सोर्स vLLM सर्वर पर बनी एक परत है जो यह तय करती है कि किसी मॉडल के कुंजी-मूल्य कैश में क्या रखना है, जिसके आधार पर अगले एजेंट के चलने की संभावना है। लेखक दोहरे अंक की विलंबता और थ्रूपुट लाभ की रिपोर्ट करते हैं; सार में कार्यभार, मॉडल और हार्डवेयर का उल्लेख नहीं किया गया है।arxiv.orgनवीनता
OpenAI AI-जनरेटेड प्रूफ़ का ऑडिट एक उलट स्थिति पाता है, और एक मरम्मत प्रकाशित करता है
दो शोधकर्ताओं का कहना है कि OpenAI के गणित दस्तावेज़ के अध्याय 6 में एक लेम्मा प्रमाण में एक ध्रुवीयता त्रुटि है: औसत सफलता के संदर्भ में एक परीक्षण जहां अगले चरण के लिए एक बड़ी सशर्त विफलता की आवश्यकता होती है। वे एक प्रतिउदाहरण और एक सही प्रमाण देते हैं, और चेतावनी देते हैं कि यह अध्याय के मुख्य प्रमेय का सत्यापन नहीं है।arxiv.orgनवीनता
प्रतिकृति अध्ययन का कहना है कि फ्लॉप्स अभी भी एआई रनटाइम का गलत अनुमान लगाते हैं, और प्रस्तावित फिक्स नए हार्डवेयर पर विफल रहता है
दो शोधकर्ताओं द्वारा किया गया प्रीप्रिंट पहले के एक अध्ययन को पुन: प्रस्तुत करता है कि क्यों समान एफएलओपी गणनाओं का मतलब समान निष्पादन समय नहीं है। यह अंतर्निहित दावे की पुष्टि करता है लेकिन रिपोर्ट करता है कि α-FLOPs सुधार फॉर्मूला आम तौर पर नए हार्डवेयर पर रनटाइम को कम आंकता है, जो छलांग और दोलन दिखाता है जिसे फॉर्मूला कैप्चर नहीं करता है।arxiv.orgउद्यम
बेंचमार्क पेपर 26% से कम स्कोर वाले एलएलएम के साथ एंटरप्राइज़ डेटा को क्वेरी करने के चार तरीके ढूंढता है
एक नया arXiv प्रीप्रिंट एक सिंथेटिक द्विभाषी बेंचमार्क पर एक दूसरे के खिलाफ एंटरप्राइज़ डेटाबेस की प्राकृतिक-भाषा क्वेरी के लिए चार आर्किटेक्चर पेश करता है। लगभग एक चौथाई से अधिक मामलों का किसी ने भी सही उत्तर नहीं दिया, और जिस डिज़ाइन ने सबसे अधिक अंक प्राप्त किए वह सबसे सुरक्षित या सबसे सस्ता नहीं था।arxiv.orgनवीनता
पेपर एक मजबूत मॉडल में अभिसरण को मापकर बिना लेबल के एआई सुरक्षा एजेंटों की ग्रेडिंग का प्रस्ताव करता है
एक नए arXiv प्रीप्रिंट का तर्क है कि सुरक्षा टीमें यह निर्धारित कर सकती हैं कि मेमोरी- या पुनर्प्राप्ति-सुसज्जित एआई एजेंट यह मापकर सीख रहा है कि यह एक मजबूत "शिक्षक" मॉडल के अंतर को कितनी दूर तक कम करता है, बजाय लेबल वाले बेंचमार्क पर जो अक्सर दुर्लभ या बासी होते हैं। समान रूप से संचालित मॉडल को देखते हुए कोई प्रयोग करने योग्य संकेत नहीं मिला।arxiv.org
प्रत्येक सप्ताह एक उपयोगी ब्रीफिंग
फ़ीड में पड़े बिना एआई के साथ बने रहें।
सप्ताह की सत्यापित एआई समाचार, मूल डेटा, उपयोगी उपकरण, सीखने के विकल्प और ताज़ा एआई नौकरियां प्राप्त करें।
उन लोगों तक पहुंचें जो AI सीख रहे हैं
एक एआई पेशेवर को नियुक्त करना या एक उपयोगी एआई उत्पाद लॉन्च करना? इसे उन लोगों के सामने रखें जो यहां सीखने और अभिनय करने आए हैं।
एआई जॉब पोस्ट करेंएक AI टूल सबमिट करें