प्रतिदिन अद्यतन किया जाता है1866 सत्यापित कहानियाँ
एआई न्यूज। बिना शोर के.
उत्पाद लॉन्च, नीति परिवर्तन, सुरक्षा अनुसंधान और उद्योग चाल की स्रोत-जांच की गई एआई कवरेज, एक गैर-लाभकारी शिक्षा टीम द्वारा सरल अंग्रेजी में समझाई गई है।
सत्यापित सोर्सिंग
प्रत्येक कहानी सबसे मजबूत उपलब्ध साक्ष्य से जुड़ी होती है: उपलब्ध होने पर मूल स्रोत, अन्यथा स्पष्ट रूप से जिम्मेदार रिपोर्टिंग।
सादा अंग्रेजी
क्या हुआ, यह क्यों मायने रखता है, और क्या देखना है - शब्दजाल के बिना।
कोई भराव नहीं
जब सिग्नल पतला होता है, तो हम फ़ीड को पैड करने के बजाय कुछ भी प्रकाशित नहीं करते हैं।
और कहानियाँ
9 कहानियांउद्योग
कर्सर का कहना है कि स्पेसएक्स द्वारा इसका अधिग्रहण आधिकारिक तौर पर बंद हो गया है
कर्सर ने एक छोटी पोस्ट प्रकाशित की जिसमें कहा गया कि स्पेसएक्स ने एआई कोडिंग टूल का अधिग्रहण पूरा कर लिया है, यह प्रक्रिया अप्रैल में स्पेसएक्सएआई के साथ मॉडल-प्रशिक्षण साझेदारी के साथ शुरू हुई थी। यह पोस्ट उस चीज़ तक पहुंच का वादा करती है जिसे वह दुनिया का सबसे बड़ा जीपीयू बेड़ा कहती है, लेकिन कोई नियम, समयसीमा या उत्पाद परिवर्तन का खुलासा नहीं करती है।
cursor.comनवीनता
नए बेंचमार्क ने पाया कि एआई एजेंट 28% बार गलत तरीके से स्वीकृत कार्य को रोकते हैं
एक प्रीप्रिंट स्टीयरबेंच-वर्क का परिचय देता है, जो उस समय का 106-परिदृश्य परीक्षण है जब एक एआई एजेंट समीक्षा के लिए कार्य करने या रुकने का निर्णय लेता है। 30 मॉडल स्थितियों में, लेखकों की रिपोर्ट है कि गलत तरीके से असुरक्षित काम की अनुमति देने की तुलना में गलत तरीके से स्वीकृत कार्य को रोकना लगभग 28 गुना अधिक आम था।arxiv.orgनवीनता
पेपर रिपोर्ट फ्रंटियर एलएलएम जजों ने पुशबैक के तहत 25-71% फैसले पलट दिए
एक नया arXiv प्रीप्रिंट स्ट्रेस-टेस्ट स्वचालित ग्रेडर के रूप में उपयोग किए जाने वाले नौ सीमांत मॉडलों का परीक्षण करता है और रिपोर्ट करता है कि वे सभी चुनौती के तहत अपने फैसले बदलते हैं - और बदले हुए फैसले आमतौर पर सही उत्तर से दूर जाते हैं, इसकी ओर नहीं।arxiv.orgनवीनता
पेपर का तर्क है कि विकास रणनीतियाँ एलएलएम उत्तर सेट को विविध बनाए रखने में आरएल को मात देती हैं
एक नया arXiv प्रीप्रिंट तर्क देता है कि विकास रणनीतियों के साथ प्रशिक्षण के बाद एलएलएम - एक जनसंख्या-आधारित, ग्रेडिएंट-मुक्त विधि जो सीधे वजन में गड़बड़ी करती है - पास@के और समाधान कवरेज पर सुदृढीकरण सीखने को मात देती है। सार बेहतर गणित-बेंचमार्क परिणामों का हवाला देता है लेकिन कोई मॉडल, बेंचमार्क या संख्या का नाम नहीं देता है।arxiv.orgसुरक्षा
पेपर में कहा गया है कि स्व-सुधार करने वाले एआई एजेंट एक असुरक्षित सफलता को पुन: प्रयोज्य कौशल में बदल सकते हैं
एक नया arXiv प्रीप्रिंट एक विशिष्ट एजेंट विफलता मोड को बेंचमार्क करता है: जब एक स्व-सुधार एजेंट मेमोरी में एक असुरक्षित प्रक्रिया लिखता है, तो इसे बाद के सत्रों में पुनर्प्राप्त और निष्पादित किया जा सकता है। परीक्षण किए गए प्रत्येक विकसित कॉन्फ़िगरेशन ने असुरक्षित कलाकृतियों का उत्पादन किया, और तीन दुर्भावनापूर्ण कार्यों ने कैरीओवर हमले की सफलता को दोगुना कर दिया।arxiv.orgसुरक्षा
एसईएजी पेपर आरएजी क्वेरीज़ के बाहरी एलएलएम तक पहुंचने से पहले संवेदनशील संस्थाओं को उपनाम देने का प्रस्ताव करता है
arXiv पर पोस्ट किया गया एक प्रीप्रिंट एक ऐसे ढांचे का वर्णन करता है जो प्रश्नों में संवेदनशील नामों को स्वैप करता है और उन्हें तीसरे पक्ष के मॉडल पर भेजने से पहले उपनामों के लिए दस्तावेज़ पुनर्प्राप्त करता है। लेखक अपने एंड-टू-एंड उपयोगकर्ता मीट्रिक पर 80% से अधिक सटीकता की रिपोर्ट करते हैं, और तीन छोटे मॉडलों में 74.91% और 77.83% के बीच पूर्ण-छिपाव दर की रिपोर्ट करते हैं।arxiv.orgनवीनता
CABS+ पेपर 27 डेटासेट में सस्ते, तेज़ मॉडल के विलय की रिपोर्ट करता है
arXiv पर पोस्ट किया गया एक प्रीप्रिंट CABS+ का वर्णन करता है, जो एक मॉडल-मर्जिंग विधि है जो ग्रिड खोज को ग्रेडिएंट-मुक्त गुणांक खोज से बदल देती है। लेखक दो बेसलाइनों पर दोहरे अंकों के प्रदर्शन लाभ की रिपोर्ट करते हैं, एक बेसलाइन की जीपीयू मेमोरी के एक चौथाई के तहत, और दूसरे बेसलाइन की तुलना में लगभग 4x स्पीडअप।arxiv.orgनवीनता
Paper Proposes Retrieved "Lessons" to Improve Spatial Reasoning in Frozen Vision-Language Models
An arXiv preprint describes Spatial Memory Agent, which stores verified experience as text lessons retrieved at inference time, claiming gains across five spatial benchmarks and four vision-language models without changing model weights. It is under review; its abstract names no benchmarks, base models, or margins.arxiv.orgनवीनता
PROVE-RT Paper Reports 44.7% Success Generating Machine-Checked Real-Time Proofs
An arXiv preprint presents PROVE-RT, which uses retrieval and staged prompting to make large language models write PROSA/ROCQ proof scripts for real-time schedulability analysis. The authors report a 44.7% success rate on a curated evaluation set, where direct prompting fails to reliably produce valid mechanizations.arxiv.org
प्रत्येक सप्ताह एक उपयोगी ब्रीफिंग
फ़ीड में पड़े बिना एआई के साथ बने रहें।
सप्ताह की सत्यापित एआई समाचार, मूल डेटा, उपयोगी उपकरण, सीखने के विकल्प और ताज़ा एआई नौकरियां प्राप्त करें।
उन लोगों तक पहुंचें जो AI सीख रहे हैं
एक एआई पेशेवर को नियुक्त करना या एक उपयोगी एआई उत्पाद लॉन्च करना? इसे उन लोगों के सामने रखें जो यहां सीखने और अभिनय करने आए हैं।
एआई जॉब पोस्ट करेंएक AI टूल सबमिट करें