روزانہ اپ ڈیٹ کیا جاتا ہے۔1792 تصدیق شدہ کہانیاں

اے آئی نیوز۔شور کے بغیر۔

مصنوعات کی لانچز، پالیسی تبدیلیوں، حفاظتی تحقیق، اور صنعت کی تبدیلیوں کی ماخذ سے چیک شدہ AI کوریج، جسے ایک غیر منافع بخش تعلیمی ٹیم نے سادہ انگریزی میں بیان کیا۔

تصدیق شدہ سورسنگ

ہر کہانی سب سے مضبوط دستیاب شواہد سے جڑی ہوتی ہے: اصل ذرائع جب دستیاب ہوں، ورنہ واضح طور پر منسوب رپورٹنگ۔

سادہ انگریزی

What happened, why it matters, and what to watch — without the jargon.

کوئی فلر نہیں۔

جب سگنل پتلا ہوتا ہے، تو ہم فیڈ کو پیڈ کرنے کے بجائے کچھ بھی شائع نہیں کرتے ہیں۔

نیوز آرکائیو

AI نیوز آرکائیو — صفحہ 148

Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.

Source-provided image accompanying Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questionsٹاپ سٹوری
اختراع6 min پڑھیں
اختراع6 min پڑھیں

Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questions

A 24-author preprint had frontier AI agents attempt the central research questions of two unpublished NeurIPS 2026 submissions, then had the papers' own authors grade the results. The agents handled the engineering unaided over six days but were unambiguously rejected on the research.

کہانی پڑھیں تصدیق شدہ ماخذ: arxiv.org
9 کہانیاں
  1. اختراع7 min پڑھیں

    کاغذ کا کہنا ہے کہ ایجنٹ سے آگاہ کیش مینجمنٹ ملٹی ایجنٹ کی خدمت میں پہلے ٹوکن کی تاخیر کو 45٪ تک کاٹتا ہے۔

    ایک نیا arXiv preprint CacheScout کی وضاحت کرتا ہے، جو اوپن سورس vLLM سرور پر بنی ایک پرت ہے جو فیصلہ کرتی ہے کہ ماڈل کے کلیدی قدر والے کیشے میں کیا رکھنا ہے اس بنیاد پر کہ اگلا کون سا ایجنٹ چلائے گا۔ مصنفین دوہرے ہندسوں میں تاخیر اور تھرو پٹ حاصلات کی اطلاع دیتے ہیں۔ کام کے بوجھ، ماڈل، اور ہارڈ ویئر کو خلاصہ میں بیان نہیں کیا گیا ہے۔

    arxiv.org
  2. اختراع7 min پڑھیں

    ایک OpenAI AI سے تیار کردہ ثبوت کا آڈٹ ایک الٹی حالت تلاش کرتا ہے، اور ایک مرمت شائع کرتا ہے

    دو محققین کا کہنا ہے کہ OpenAI کی ریاضی کی دستاویز کے باب 6 میں ایک لیما ثبوت میں قطبیت کی خرابی ہے: اوسط کامیابی کے لحاظ سے ایک امتحان جہاں اگلے مرحلے میں بڑی مشروط ناکامی کی ضرورت ہے۔ وہ ایک جوابی مثال اور ایک درست ثبوت دیتے ہیں، اور احتیاط کرتے ہیں کہ یہ باب کے مرکزی نظریہ کی تصدیق نہیں ہے۔

    arxiv.org
  3. اختراع7 min پڑھیں

    نقل کے مطالعہ کا کہنا ہے کہ FLOPs پھر بھی AI رن ٹائم کی غلط پیش گوئی کرتے ہیں، اور مجوزہ فکس نئے ہارڈ ویئر پر ناکام ہو جاتا ہے۔

    دو محققین کا ایک پری پرنٹ ایک سابقہ مطالعہ کو دوبارہ پیش کرتا ہے کہ کیوں مساوی FLOP شمار کا مطلب عمل درآمد کا مساوی وقت نہیں ہے۔ یہ بنیادی دعوے کی تصدیق کرتا ہے لیکن رپورٹ کرتا ہے کہ α-FLOPs اصلاحی فارمولہ عام طور پر نئے ہارڈ ویئر پر رن ​​ٹائم کو کم سمجھتا ہے، جو فارمولہ کی گرفت میں آنے والی چھلانگوں اور دوغلوں کو ظاہر کرتا ہے۔

    arxiv.org
  4. انٹرپرائز6 min پڑھیں

    بینچ مارک پیپر نے LLMs کے ساتھ انٹرپرائز ڈیٹا کو استفسار کرنے کے چار طریقے ڈھونڈے ہیں تمام اسکور 26% سے کم

    ایک نیا arXiv پری پرنٹ ایک مصنوعی دو لسانی بینچ مارک پر ایک دوسرے کے خلاف انٹرپرائز ڈیٹا بیس کی قدرتی زبان میں استفسار کے لیے چار فن تعمیرات کو کھڑا کرتا ہے۔ کسی نے بھی تقریباً ایک چوتھائی سے زیادہ کیسز کا صحیح جواب نہیں دیا، اور جس ڈیزائن نے سب سے زیادہ اسکور کیا وہ سب سے محفوظ یا سستا نہیں تھا۔

    arxiv.org
  5. اختراع7 min پڑھیں

    کاغذ ایک مضبوط ماڈل میں کنورجنسی کی پیمائش کرکے لیبل کے بغیر AI سیکیورٹی ایجنٹوں کو گریڈ کرنے کی تجویز کرتا ہے

    ایک نیا arXiv پری پرنٹ دلیل دیتا ہے کہ سیکیورٹی ٹیمیں یہ فیصلہ کر سکتی ہیں کہ آیا میموری- یا بازیافت سے لیس AI ایجنٹ یہ پیمائش کر کے سیکھ رہا ہے کہ یہ ایک مضبوط "ٹیچر" ماڈل کے خلا کو کس حد تک بند کرتا ہے، بجائے اس کے کہ اکثر نایاب یا باسی ہوتے ہیں۔ اسی طرح سے چلنے والے ماڈل کی طرف سے فیصلہ کرنے سے کوئی قابل استعمال سگنل نہیں ملا۔

    arxiv.org
  6. اختراع7 min پڑھیں

    نیا بینچ مارک ٹیسٹ کرتا ہے کہ آیا AI معاونین فون کے استعمال کا ایک سال یاد رکھ سکتے ہیں۔

    arXiv پر پوسٹ کی گئی ایک 17 مصنف کی تکنیکی رپورٹ میں MobileMem متعارف کرایا گیا ہے، جو ایک بینچ مارک اور فریم ورک آن ڈیوائس طویل مدتی میموری کے لیے موبائل تجربات کے ایک سال کے پیمانے کے مجموعہ سے بنایا گیا ہے۔ خلاصہ ڈیزائن کی وضاحت کرتا ہے لیکن کوئی اسکور رپورٹ نہیں کرتا، اور بنیادی ڈیٹا کے بارے میں اہم تفصیلات نامعلوم رہتی ہیں۔

    arxiv.org
  7. اختراع7 min پڑھیں

    کاغذ کی رپورٹیں دماغ کی طرح ماڈیولر تنظیم بڑی زبان کے ماڈلز کے اندر ابھرتی ہیں

    ایک نیا arXiv preprint کہتا ہے کہ بڑے لینگویج ماڈلز فنکشنل طور پر مخصوص اندرونی ڈھانچہ تیار کرتے ہیں جو چار علمی ڈومینز میں 46 کاموں کے سرکٹ تجزیوں کی بنیاد پر مختلف انسانی دماغی نیٹ ورکس کے ساتھ ملتے ہیں۔ خلاصہ صفحہ کلیدی طریقہ کار کی تفصیلات کو غیر بیان کرتا ہے۔

    arxiv.org
  8. اختراع7 min پڑھیں

    کاغذ ماہرین کے مرکب کی دیر سے پرتیں ڈھونڈتا ہے ماڈل بھاری ماہر ماسکنگ کو برداشت کرتا ہے

    ایک پری پرنٹ رپورٹ کرتا ہے کہ 35-بلین پیرامیٹر مکسچر-آف-ماہرین ماڈل کی آخری پانچ پرتوں میں کم شدت والے ماہرین کو غیر فعال کرنے سے تمام پرتوں میں یکساں کٹوتی پھیلانے سے کہیں زیادہ قابل استعمال کوڈ ٹرانسلیشن آؤٹ پٹس محفوظ رہے۔ اس میں ایک ماڈل اور ایک بینچ مارک کا احاطہ کیا گیا ہے، اور خلاصہ کی رپورٹ کوئی بے نقاب بیس لائن نہیں ہے۔

    arxiv.org
  9. سیکیورٹی7 min پڑھیں

    کور بریک کی خامیاں ایجنٹ ٹولز کو ماڈل کے بغیر چلنے دیتی ہیں۔

    کلاؤڈ سیکیورٹی الائنس کا ایک تحقیقی نوٹ CoreBreak، Amazon Bedrock AgentCore میں خامیوں کا ایک نمونہ، Google کی ایجنٹ ڈویلپمنٹ کٹ، اور Vercel کے AI SDK ہارنس پیکجز کی وضاحت کرتا ہے جس نے ٹولز کو ماڈل موڑ کے بغیر عمل کرنے کی اجازت دی — ماڈل کی سطح کے گارڈریلز کو دیکھنے کے لیے کچھ بھی نہیں چھوڑا۔

    labs.cloudsecurityalliance.org

ہر ہفتے ایک مفید بریفنگ

AI کے ساتھ بغیر فیڈ میں رہنے کے ساتھ قدم ملا کر چلیں۔

ہفتے کی تصدیق شدہ AI خبریں، اصل ڈیٹا، مفید اوزار، سیکھنے کے انتخاب، اور تازہ AI نوکریاں حاصل کریں۔

Send me
One email a week. Switch any time.

Reach people who are learning AI

کسی AI پروفیشنل کو ہائر کرنا یا کوئی مفید AI پروڈکٹ لانچ کرنا؟ اسے ان لوگوں کے سامنے رکھیں جو یہاں سیکھنے اور عمل کرنے آئے ہیں۔

اے آئی کی نوکری پوسٹ کریں ایک AI ٹول جمع کروائیں