روزانہ اپ ڈیٹ کیا جاتا ہے۔1866 تصدیق شدہ کہانیاں

اے آئی نیوز۔ شور کے بغیر۔

مصنوعات کی لانچز، پالیسی تبدیلیوں، حفاظتی تحقیق، اور صنعت کی تبدیلیوں کی ماخذ سے چیک شدہ AI کوریج، جسے ایک غیر منافع بخش تعلیمی ٹیم نے سادہ انگریزی میں بیان کیا۔

تصدیق شدہ سورسنگ

ہر کہانی سب سے مضبوط دستیاب شواہد سے جڑی ہوتی ہے: اصل ذرائع جب دستیاب ہوں، ورنہ واضح طور پر منسوب رپورٹنگ۔

سادہ انگریزی

کیا ہوا، یہ کیوں اہمیت رکھتا ہے، اور کیا دیکھنا ہے — بغیر لغت کے۔

کوئی فلر نہیں۔

جب سگنل پتلا ہوتا ہے، تو ہم فیڈ کو پیڈ کرنے کے بجائے کچھ بھی شائع نہیں کرتے ہیں۔

9 کہانیاں
  1. صنعتصنعت6 min پڑھیں

    کرسر کا کہنا ہے کہ اسپیس ایکس کے ذریعہ اس کا حصول سرکاری طور پر بند ہوگیا ہے۔

    کرسر نے ایک مختصر پوسٹ شائع کی جس میں کہا گیا ہے کہ SpaceX نے AI کوڈنگ ٹول کا اپنا حصول مکمل کر لیا ہے، اس عمل کو مکمل کر کے اس کا کہنا ہے کہ اپریل میں SpaceXAI کے ساتھ ماڈل ٹریننگ پارٹنرشپ کے ساتھ شروع ہوا تھا۔ پوسٹ اس تک رسائی کا وعدہ کرتی ہے جسے وہ دنیا کا سب سے بڑا GPU فلیٹ کہتا ہے، لیکن اس میں کوئی شرائط، ٹائم لائنز، یا پروڈکٹ کی تبدیلیوں کا انکشاف نہیں کیا گیا ہے۔cursor.com
  2. اختراعاختراع7 min پڑھیں

    نئے بینچ مارک نے AI ایجنٹوں کو غلط طریقے سے منظور شدہ کام کو 28% وقت میں بلاک کیا۔

    ایک پری پرنٹ SteerBench-Work کو متعارف کراتا ہے، اس لمحے کا 106-منظر ٹیسٹ جس میں ایک AI ایجنٹ جائزہ لینے کے لیے کام کرنے یا روکنے کا فیصلہ کرتا ہے۔ 30 ماڈل حالات میں، مصنفین نے رپورٹ کیا ہے کہ غیر محفوظ کام کی غلط اجازت دینے کے مقابلے میں کلیئر شدہ کام کو غلط طریقے سے رکھنا تقریباً 28 گنا زیادہ عام تھا۔arxiv.org
  3. اختراعاختراع7 min پڑھیں

    کاغذی رپورٹس فرنٹیئر ایل ایل ایم ججز نے پش بیک کے تحت 25-71 فیصد فیصلے پلٹائے

    ایک نیا arXiv پری پرنٹ کشیدگی کے نو فرنٹیئر ماڈلز کو خودکار گریڈرز کے طور پر استعمال کرتا ہے اور رپورٹ کرتا ہے کہ وہ سبھی چیلنج کے تحت اپنے فیصلوں کو تبدیل کرتے ہیں — اور یہ کہ بدلے ہوئے فیصلے عام طور پر درست جواب سے ہٹ جاتے ہیں، اس کی طرف نہیں۔arxiv.org
  4. اختراعاختراع7 min پڑھیں

    کاغذ کا استدلال ہے کہ ایل ایل ایم جوابات کو متنوع رکھنے میں ارتقاء کی حکمت عملیوں نے RL کو ہرا دیا

    ایک نیا arXiv پری پرنٹ دلیل دیتا ہے کہ ارتقاء کی حکمت عملیوں کے ساتھ LLMs کی پوسٹ ٹریننگ — آبادی پر مبنی، میلان سے پاک طریقہ جو وزن کو براہ راست پریشان کرتا ہے — پاس@k اور حل کی کوریج پر کمک سیکھنے کو مات دیتا ہے۔ خلاصہ ریاضی کے بینچ مارک کے بہتر نتائج کا حوالہ دیتا ہے لیکن کسی ماڈل، بینچ مارک یا نمبر کا نام نہیں دیتا۔arxiv.org
  5. سیکیورٹیسیکیورٹی7 min پڑھیں

    کاغذ کا کہنا ہے کہ خود کو بہتر بنانے والے AI ایجنٹ ایک غیر محفوظ کامیابی کو دوبارہ قابل استعمال مہارت میں بدل سکتے ہیں۔

    ایک نیا arXiv پری پرنٹ ایک مخصوص ایجنٹ کی ناکامی کے موڈ کو نشان زد کرتا ہے: جب خود کو بہتر بنانے والا ایجنٹ میموری میں ایک غیر محفوظ طریقہ کار لکھتا ہے، تو اسے دوبارہ حاصل کیا جا سکتا ہے اور بعد کے سیشنز میں اس پر عمل کیا جا سکتا ہے۔ جانچ کی گئی ہر تیار شدہ ترتیب نے غیر محفوظ نمونے تیار کیے، اور تین بدنیتی پر مبنی کاموں نے کیری اوور حملے کی کامیابی کو دوگنا کیا۔arxiv.org
  6. سیکیورٹیسیکیورٹی6 min پڑھیں

    SEAG پیپر نے RAG کے سوالات بیرونی LLM تک پہنچنے سے پہلے حساس اداروں کو الگ کرنے کی تجویز پیش کی ہے۔

    arXiv پر پوسٹ کیا گیا ایک پری پرنٹ ایک فریم ورک کی وضاحت کرتا ہے جو سوالات میں حساس ناموں کو تبدیل کرتا ہے اور کسی تیسرے فریق کے ماڈل کو بھیجنے سے پہلے عرفی ناموں کے لیے دستاویزات کو بازیافت کرتا ہے۔ مصنفین اپنے اختتام سے آخر تک صارف میٹرک پر 80% سے زیادہ درستگی اور تین چھوٹے ماڈلز میں 74.91% اور 77.83% کے درمیان مکمل چھپانے کی شرح کی اطلاع دیتے ہیں۔arxiv.org
  7. اختراعاختراع6 min پڑھیں

    CABS+ پیپر رپورٹس سستی، تیز ترین ماڈل 27 ڈیٹاسیٹس میں ضم

    arXiv پر پوسٹ کیا گیا ایک پری پرنٹ CABS+ کی وضاحت کرتا ہے، ایک ماڈل ضم کرنے کا طریقہ جو گرڈ سرچ کو گریڈینٹ فری کوفیشنٹ تلاش سے بدل دیتا ہے۔ مصنفین دو بیس لائنوں پر دوہرے ہندسوں کی کارکردگی میں اضافے کی اطلاع دیتے ہیں، ایک بیس لائن کی GPU میموری کے ایک چوتھائی کے نیچے، اور دوسری کے مقابلے میں تقریباً 4x رفتار۔arxiv.org
  8. اختراعاختراع6 min پڑھیں

    کاغذ منجمد وژن لینگویج ماڈلز میں مقامی استدلال کو بہتر بنانے کے لیے بازیافت شدہ "اسباق" کی تجویز کرتا ہے۔

    ایک arXiv پری پرنٹ اسپیشل میموری ایجنٹ کی وضاحت کرتا ہے، جو تصدیق شدہ تجربے کو قیاس کے وقت بازیافت کیے گئے ٹیکسٹ اسباق کے طور پر اسٹور کرتا ہے، جس میں ماڈل کے وزن کو تبدیل کیے بغیر پانچ مقامی بینچ مارکس اور چار ویژن لینگویج ماڈلز میں حاصل ہونے کا دعویٰ کیا گیا ہے۔ یہ زیر غور ہے؛ اس کے خلاصہ ناموں میں کوئی بینچ مارک، بیس ماڈل، یا مارجن نہیں ہے۔arxiv.org
  9. اختراعاختراع7 min پڑھیں

    PROVE-RT پیپر رپورٹس 44.7% کامیابی جنریٹنگ مشین سے چیک شدہ ریئل ٹائم ثبوت

    ایک arXiv پری پرنٹ PROVE-RT پیش کرتا ہے، جس میں بڑی زبان کے ماڈلز کو حقیقی وقت کے نظام الاوقات کے تجزیہ کے لیے PROSA/ROCQ پروف اسکرپٹس لکھنے کے لیے بازیافت اور اسٹیج پرمپٹنگ کا استعمال کیا جاتا ہے۔ مصنفین کیوریٹڈ ایویلیویشن سیٹ پر 44.7% کامیابی کی شرح بتاتے ہیں، جہاں ڈائریکٹ پرمپٹنگ قابل اعتماد طریقے سے درست میکانائزیشن پیدا کرنے میں ناکام رہتی ہے۔arxiv.org

ہر ہفتے ایک مفید بریفنگ

AI کے ساتھ بغیر فیڈ میں رہنے کے ساتھ قدم ملا کر چلیں۔

ہفتے کی تصدیق شدہ AI خبریں، اصل ڈیٹا، مفید اوزار، سیکھنے کے انتخاب، اور تازہ AI نوکریاں حاصل کریں۔

Send me
One email a week. Switch any time.

ان لوگوں تک پہنچیں جو AI سیکھ رہے ہیں۔

کسی AI پروفیشنل کو ہائر کرنا یا کوئی مفید AI پروڈکٹ لانچ کرنا؟ اسے ان لوگوں کے سامنے رکھیں جو یہاں سیکھنے اور عمل کرنے آئے ہیں۔

اے آئی کی نوکری پوسٹ کریںایک AI ٹول جمع کروائیں