प्रतिदिन अद्यतन किया जाता है2528 सत्यापित कहानियाँ

एआई न्यूज। बिना शोर के.

उत्पाद लॉन्च, नीति परिवर्तन, सुरक्षा अनुसंधान और उद्योग चाल की स्रोत-जांच की गई एआई कवरेज, एक गैर-लाभकारी शिक्षा टीम द्वारा सरल अंग्रेजी में समझाई गई है।

समाचार संग्रह

एआई समाचार संग्रह — पेज 209

स्रोत-जांच की गई एआई कहानियां, नवीनतम सबसे पहले, उन लोगों के लिए जिन्हें प्रचार का पीछा किए बिना एआई को समझने की आवश्यकता है।

सत्यापित सोर्सिंग

प्रत्येक कहानी सबसे मजबूत उपलब्ध साक्ष्य से जुड़ी होती है: उपलब्ध होने पर मूल स्रोत, अन्यथा स्पष्ट रूप से जिम्मेदार रिपोर्टिंग।

सादा अंग्रेजी

क्या हुआ, यह क्यों मायने रखता है, और क्या देखना है - शब्दजाल के बिना।

कोई भराव नहीं

जब सिग्नल पतला होता है, तो हम फ़ीड को पैड करने के बजाय कुछ भी प्रकाशित नहीं करते हैं।

9 कहानियां
  1. नवीनतानवीनता7 min पढ़ें

    NVIDIA स्किलइवैल्यूएटर के साथ एआई एजेंट कौशल प्रदर्शन का मूल्यांकन

    NVIDIA स्किलइवैल्यूएटर तीन स्तरीय मूल्यांकन प्रक्रिया के माध्यम से एआई एजेंट के प्रदर्शन पर सत्यापित कौशल के प्रभाव को मापता है।developer.nvidia.com
  2. नवीनतानवीनता6 min पढ़ें

    पेपर "छाया मूल्यांकन" का परिचय देता है: एआई एजेंटों ने इंजीनियरिंग की लेकिन दो शोध प्रश्नों में असफल रहे

    एक 24-लेखक प्रीप्रिंट में फ्रंटियर एआई एजेंटों ने दो अप्रकाशित NeurIPS 2026 सबमिशन के केंद्रीय अनुसंधान प्रश्नों का प्रयास किया था, फिर पेपर के अपने लेखकों ने परिणामों को ग्रेड किया था। एजेंटों ने छह दिनों तक बिना किसी सहायता के इंजीनियरिंग को संभाला लेकिन अनुसंधान पर स्पष्ट रूप से खारिज कर दिया गया।arxiv.org
  3. उत्पादउत्पाद7 min पढ़ें

    वॉर्प ने कोडिंग एजेंटों के बेड़े को चलाने के लिए एक कॉन्फिग-ए-कोड सिस्टम "फैक्ट्रियों" तक प्रारंभिक पहुंच खोली है।

    Warp, Warp फ़ैक्टरियों के लिए अर्ली-एक्सेस अनुरोध ले रहा है, जो CLI, API, SDK और MCP द्वारा संचालित एक YAML फ़ाइल में कोडिंग एजेंटों के बेड़े को कोड - रिपो, मॉडल, अनुमतियाँ और मानव चौकियों के रूप में परिभाषित करता है। इसके स्वचालन और लागत के आंकड़े विक्रेता के दावे हैं: कोई मूल्य निर्धारण, सामान्य उपलब्धता तिथि या स्वतंत्र परीक्षण नहीं।warp.dev
  4. नवीनतानवीनता7 min पढ़ें

    बेंचमार्क का कहना है कि शीर्ष मल्टीमॉडल मॉडल पेन साउंड और हैंड मोशन से शब्द पढ़ने में 10% से कम स्कोर करते हैं

    एक नया arXiv पेपर एक परीक्षण पेश करता है जिसमें मॉडलों को पेन-स्क्रैच ऑडियो और हाथ-मूवमेंट वीडियो से एक लिखित शब्द का अनुमान लगाना होगा, जिसमें कोई स्याही दिखाई नहीं देगी। लेखक रिपोर्ट करते हैं कि 80% से ऊपर के मनुष्यों ने अक्षर सटीकता का आदेश दिया और अग्रणी मॉडल 10% से नीचे - और मॉडल को दोनों तौर-तरीके देने से अक्सर परिणाम खराब हो जाते हैं।arxiv.org
  5. नवीनतानवीनता7 min पढ़ें

    पेपर का कहना है कि एजेंट-अवेयर कैश प्रबंधन मल्टी-एजेंट सर्विंग में प्रथम-टोकन विलंब को 45% तक कम कर देता है

    एक नया arXiv प्रीप्रिंट कैशस्काउट का वर्णन करता है, जो ओपन-सोर्स vLLM सर्वर पर बनी एक परत है जो यह तय करती है कि किसी मॉडल के कुंजी-मूल्य कैश में क्या रखना है, जिसके आधार पर अगले एजेंट के चलने की संभावना है। लेखक दोहरे अंक की विलंबता और थ्रूपुट लाभ की रिपोर्ट करते हैं; सार में कार्यभार, मॉडल और हार्डवेयर का उल्लेख नहीं किया गया है।arxiv.org
  6. नवीनतानवीनता7 min पढ़ें

    OpenAI AI-जनरेटेड प्रूफ़ का ऑडिट एक उलट स्थिति पाता है, और एक मरम्मत प्रकाशित करता है

    दो शोधकर्ताओं का कहना है कि OpenAI के गणित दस्तावेज़ के अध्याय 6 में एक लेम्मा प्रमाण में एक ध्रुवीयता त्रुटि है: औसत सफलता के संदर्भ में एक परीक्षण जहां अगले चरण के लिए एक बड़ी सशर्त विफलता की आवश्यकता होती है। वे एक प्रतिउदाहरण और एक सही प्रमाण देते हैं, और चेतावनी देते हैं कि यह अध्याय के मुख्य प्रमेय का सत्यापन नहीं है।arxiv.org
  7. नवीनतानवीनता7 min पढ़ें

    प्रतिकृति अध्ययन का कहना है कि फ्लॉप्स अभी भी एआई रनटाइम का गलत अनुमान लगाते हैं, और प्रस्तावित फिक्स नए हार्डवेयर पर विफल रहता है

    दो शोधकर्ताओं द्वारा किया गया प्रीप्रिंट पहले के एक अध्ययन को पुन: प्रस्तुत करता है कि क्यों समान एफएलओपी गणनाओं का मतलब समान निष्पादन समय नहीं है। यह अंतर्निहित दावे की पुष्टि करता है लेकिन रिपोर्ट करता है कि α-FLOPs सुधार फॉर्मूला आम तौर पर नए हार्डवेयर पर रनटाइम को कम आंकता है, जो छलांग और दोलन दिखाता है जिसे फॉर्मूला कैप्चर नहीं करता है।arxiv.org
  8. उद्यमउद्यम6 min पढ़ें

    बेंचमार्क पेपर 26% से कम स्कोर वाले एलएलएम के साथ एंटरप्राइज़ डेटा को क्वेरी करने के चार तरीके ढूंढता है

    एक नया arXiv प्रीप्रिंट एक सिंथेटिक द्विभाषी बेंचमार्क पर एक दूसरे के खिलाफ एंटरप्राइज़ डेटाबेस की प्राकृतिक-भाषा क्वेरी के लिए चार आर्किटेक्चर पेश करता है। लगभग एक चौथाई से अधिक मामलों का किसी ने भी सही उत्तर नहीं दिया, और जिस डिज़ाइन ने सबसे अधिक अंक प्राप्त किए वह सबसे सुरक्षित या सबसे सस्ता नहीं था।arxiv.org
  9. नवीनतानवीनता7 min पढ़ें

    पेपर एक मजबूत मॉडल में अभिसरण को मापकर बिना लेबल के एआई सुरक्षा एजेंटों की ग्रेडिंग का प्रस्ताव करता है

    एक नए arXiv प्रीप्रिंट का तर्क है कि सुरक्षा टीमें यह निर्धारित कर सकती हैं कि मेमोरी- या पुनर्प्राप्ति-सुसज्जित एआई एजेंट यह मापकर सीख रहा है कि यह एक मजबूत "शिक्षक" मॉडल के अंतर को कितनी दूर तक कम करता है, बजाय लेबल वाले बेंचमार्क पर जो अक्सर दुर्लभ या बासी होते हैं। समान रूप से संचालित मॉडल को देखते हुए कोई प्रयोग करने योग्य संकेत नहीं मिला।arxiv.org

प्रत्येक सप्ताह एक उपयोगी ब्रीफिंग

फ़ीड में पड़े बिना एआई के साथ बने रहें।

सप्ताह की सत्यापित एआई समाचार, मूल डेटा, उपयोगी उपकरण, सीखने के विकल्प और ताज़ा एआई नौकरियां प्राप्त करें।

Send me
One email a week. Switch any time.

उन लोगों तक पहुंचें जो AI सीख रहे हैं

एक एआई पेशेवर को नियुक्त करना या एक उपयोगी एआई उत्पाद लॉन्च करना? इसे उन लोगों के सामने रखें जो यहां सीखने और अभिनय करने आए हैं।

एआई जॉब पोस्ट करेंएक AI टूल सबमिट करें