روزانہ اپ ڈیٹ کیا جاتا ہے۔1866 تصدیق شدہ کہانیاں
اے آئی نیوز۔ شور کے بغیر۔
مصنوعات کی لانچز، پالیسی تبدیلیوں، حفاظتی تحقیق، اور صنعت کی تبدیلیوں کی ماخذ سے چیک شدہ AI کوریج، جسے ایک غیر منافع بخش تعلیمی ٹیم نے سادہ انگریزی میں بیان کیا۔
تصدیق شدہ سورسنگ
ہر کہانی سب سے مضبوط دستیاب شواہد سے جڑی ہوتی ہے: اصل ذرائع جب دستیاب ہوں، ورنہ واضح طور پر منسوب رپورٹنگ۔
سادہ انگریزی
کیا ہوا، یہ کیوں اہمیت رکھتا ہے، اور کیا دیکھنا ہے — بغیر لغت کے۔
کوئی فلر نہیں۔
جب سگنل پتلا ہوتا ہے، تو ہم فیڈ کو پیڈ کرنے کے بجائے کچھ بھی شائع نہیں کرتے ہیں۔
مزید کہانیاں
9 کہانیاںصنعت
کرسر کا کہنا ہے کہ اسپیس ایکس کے ذریعہ اس کا حصول سرکاری طور پر بند ہوگیا ہے۔
کرسر نے ایک مختصر پوسٹ شائع کی جس میں کہا گیا ہے کہ SpaceX نے AI کوڈنگ ٹول کا اپنا حصول مکمل کر لیا ہے، اس عمل کو مکمل کر کے اس کا کہنا ہے کہ اپریل میں SpaceXAI کے ساتھ ماڈل ٹریننگ پارٹنرشپ کے ساتھ شروع ہوا تھا۔ پوسٹ اس تک رسائی کا وعدہ کرتی ہے جسے وہ دنیا کا سب سے بڑا GPU فلیٹ کہتا ہے، لیکن اس میں کوئی شرائط، ٹائم لائنز، یا پروڈکٹ کی تبدیلیوں کا انکشاف نہیں کیا گیا ہے۔
cursor.comاختراع
نئے بینچ مارک نے AI ایجنٹوں کو غلط طریقے سے منظور شدہ کام کو 28% وقت میں بلاک کیا۔
ایک پری پرنٹ SteerBench-Work کو متعارف کراتا ہے، اس لمحے کا 106-منظر ٹیسٹ جس میں ایک AI ایجنٹ جائزہ لینے کے لیے کام کرنے یا روکنے کا فیصلہ کرتا ہے۔ 30 ماڈل حالات میں، مصنفین نے رپورٹ کیا ہے کہ غیر محفوظ کام کی غلط اجازت دینے کے مقابلے میں کلیئر شدہ کام کو غلط طریقے سے رکھنا تقریباً 28 گنا زیادہ عام تھا۔arxiv.orgاختراع
کاغذی رپورٹس فرنٹیئر ایل ایل ایم ججز نے پش بیک کے تحت 25-71 فیصد فیصلے پلٹائے
ایک نیا arXiv پری پرنٹ کشیدگی کے نو فرنٹیئر ماڈلز کو خودکار گریڈرز کے طور پر استعمال کرتا ہے اور رپورٹ کرتا ہے کہ وہ سبھی چیلنج کے تحت اپنے فیصلوں کو تبدیل کرتے ہیں — اور یہ کہ بدلے ہوئے فیصلے عام طور پر درست جواب سے ہٹ جاتے ہیں، اس کی طرف نہیں۔arxiv.orgاختراع
کاغذ کا استدلال ہے کہ ایل ایل ایم جوابات کو متنوع رکھنے میں ارتقاء کی حکمت عملیوں نے RL کو ہرا دیا
ایک نیا arXiv پری پرنٹ دلیل دیتا ہے کہ ارتقاء کی حکمت عملیوں کے ساتھ LLMs کی پوسٹ ٹریننگ — آبادی پر مبنی، میلان سے پاک طریقہ جو وزن کو براہ راست پریشان کرتا ہے — پاس@k اور حل کی کوریج پر کمک سیکھنے کو مات دیتا ہے۔ خلاصہ ریاضی کے بینچ مارک کے بہتر نتائج کا حوالہ دیتا ہے لیکن کسی ماڈل، بینچ مارک یا نمبر کا نام نہیں دیتا۔arxiv.orgسیکیورٹی
کاغذ کا کہنا ہے کہ خود کو بہتر بنانے والے AI ایجنٹ ایک غیر محفوظ کامیابی کو دوبارہ قابل استعمال مہارت میں بدل سکتے ہیں۔
ایک نیا arXiv پری پرنٹ ایک مخصوص ایجنٹ کی ناکامی کے موڈ کو نشان زد کرتا ہے: جب خود کو بہتر بنانے والا ایجنٹ میموری میں ایک غیر محفوظ طریقہ کار لکھتا ہے، تو اسے دوبارہ حاصل کیا جا سکتا ہے اور بعد کے سیشنز میں اس پر عمل کیا جا سکتا ہے۔ جانچ کی گئی ہر تیار شدہ ترتیب نے غیر محفوظ نمونے تیار کیے، اور تین بدنیتی پر مبنی کاموں نے کیری اوور حملے کی کامیابی کو دوگنا کیا۔arxiv.orgسیکیورٹی
SEAG پیپر نے RAG کے سوالات بیرونی LLM تک پہنچنے سے پہلے حساس اداروں کو الگ کرنے کی تجویز پیش کی ہے۔
arXiv پر پوسٹ کیا گیا ایک پری پرنٹ ایک فریم ورک کی وضاحت کرتا ہے جو سوالات میں حساس ناموں کو تبدیل کرتا ہے اور کسی تیسرے فریق کے ماڈل کو بھیجنے سے پہلے عرفی ناموں کے لیے دستاویزات کو بازیافت کرتا ہے۔ مصنفین اپنے اختتام سے آخر تک صارف میٹرک پر 80% سے زیادہ درستگی اور تین چھوٹے ماڈلز میں 74.91% اور 77.83% کے درمیان مکمل چھپانے کی شرح کی اطلاع دیتے ہیں۔arxiv.orgاختراع
CABS+ پیپر رپورٹس سستی، تیز ترین ماڈل 27 ڈیٹاسیٹس میں ضم
arXiv پر پوسٹ کیا گیا ایک پری پرنٹ CABS+ کی وضاحت کرتا ہے، ایک ماڈل ضم کرنے کا طریقہ جو گرڈ سرچ کو گریڈینٹ فری کوفیشنٹ تلاش سے بدل دیتا ہے۔ مصنفین دو بیس لائنوں پر دوہرے ہندسوں کی کارکردگی میں اضافے کی اطلاع دیتے ہیں، ایک بیس لائن کی GPU میموری کے ایک چوتھائی کے نیچے، اور دوسری کے مقابلے میں تقریباً 4x رفتار۔arxiv.orgاختراع
کاغذ منجمد وژن لینگویج ماڈلز میں مقامی استدلال کو بہتر بنانے کے لیے بازیافت شدہ "اسباق" کی تجویز کرتا ہے۔
ایک arXiv پری پرنٹ اسپیشل میموری ایجنٹ کی وضاحت کرتا ہے، جو تصدیق شدہ تجربے کو قیاس کے وقت بازیافت کیے گئے ٹیکسٹ اسباق کے طور پر اسٹور کرتا ہے، جس میں ماڈل کے وزن کو تبدیل کیے بغیر پانچ مقامی بینچ مارکس اور چار ویژن لینگویج ماڈلز میں حاصل ہونے کا دعویٰ کیا گیا ہے۔ یہ زیر غور ہے؛ اس کے خلاصہ ناموں میں کوئی بینچ مارک، بیس ماڈل، یا مارجن نہیں ہے۔arxiv.orgاختراع
PROVE-RT پیپر رپورٹس 44.7% کامیابی جنریٹنگ مشین سے چیک شدہ ریئل ٹائم ثبوت
ایک arXiv پری پرنٹ PROVE-RT پیش کرتا ہے، جس میں بڑی زبان کے ماڈلز کو حقیقی وقت کے نظام الاوقات کے تجزیہ کے لیے PROSA/ROCQ پروف اسکرپٹس لکھنے کے لیے بازیافت اور اسٹیج پرمپٹنگ کا استعمال کیا جاتا ہے۔ مصنفین کیوریٹڈ ایویلیویشن سیٹ پر 44.7% کامیابی کی شرح بتاتے ہیں، جہاں ڈائریکٹ پرمپٹنگ قابل اعتماد طریقے سے درست میکانائزیشن پیدا کرنے میں ناکام رہتی ہے۔arxiv.org
ہر ہفتے ایک مفید بریفنگ
AI کے ساتھ بغیر فیڈ میں رہنے کے ساتھ قدم ملا کر چلیں۔
ہفتے کی تصدیق شدہ AI خبریں، اصل ڈیٹا، مفید اوزار، سیکھنے کے انتخاب، اور تازہ AI نوکریاں حاصل کریں۔
ان لوگوں تک پہنچیں جو AI سیکھ رہے ہیں۔
کسی AI پروفیشنل کو ہائر کرنا یا کوئی مفید AI پروڈکٹ لانچ کرنا؟ اسے ان لوگوں کے سامنے رکھیں جو یہاں سیکھنے اور عمل کرنے آئے ہیں۔
اے آئی کی نوکری پوسٹ کریںایک AI ٹول جمع کروائیں