Günlük olarak güncellenir2528 doğrulanmış hikayeler
Yapay Zeka Haberleri. Gürültü olmadan.
Ürün lansmanları, politika değişiklikleri, güvenlik araştırmaları ve sektör hamleleriyle ilgili kaynak kontrollü yapay zeka kapsamı, kar amacı gütmeyen bir eğitim ekibi tarafından sade İngilizceyle açıklanıyor.
Doğrulanmış kaynak
Her hikaye en güçlü mevcut kanıtlara bağlanır: mevcut olduğunda orijinal kaynaklar, aksi takdirde açıkça atfedilen haberler.
Düz İngilizce
Ne oldu, neden önemli ve ne izlenecek - jargon olmadan.
Dolgu yok
Sinyal zayıf olduğunda feed'i doldurmak yerine hiçbir şey yayınlamayız.
Daha fazla hikaye
9 hikayelerYenilik
NVIDIA SkillEvaluator ile Yapay Zeka Aracısı Beceri Performansını Değerlendirme
NVIDIA SkillEvaluator, doğrulanan becerilerin AI aracı performansı üzerindeki etkisini üç katmanlı bir değerlendirme süreci aracılığıyla ölçer.
developer.nvidia.comYenilik
Makalede "Gölge Değerlendirmeleri" Tanıtılıyor: Yapay Zeka Ajanları Mühendislik Yaptı Ancak İki Araştırma Sorusunda Başarısız Oldu
24 yazarlı bir ön baskı, öncü AI ajanlarının yayınlanmamış iki NeurIPS 2026 sunumunun merkezi araştırma sorularını denemesini ve ardından makalelerin kendi yazarlarının sonuçları derecelendirmesini sağladı. Ajanlar altı gün boyunca mühendislik işlerini yardım almadan yürüttüler ancak araştırma açıkça reddedildi.arxiv.orgÜrün
Warp, Kodlama Aracıları Filolarını Çalıştırmak için Kod Olarak Yapılandırma Sistemi olan "Fabrikalara" Erken Erişimi Açıyor
Warp, kodlama aracısı filolarını CLI, API, SDK ve MCP tarafından yönetilen tek bir YAML dosyasında kod depoları, modeller, izinler ve insan kontrol noktaları olarak tanımlayan Warp Fabrikaları için erken erişim isteklerini alıyor. Otomasyon ve maliyet rakamları satıcı iddialarına dayanmaktadır: fiyatlandırma, genel kullanılabilirlik tarihi veya bağımsız test yoktur.warp.devYenilik
Benchmark, En İyi Multimodal Modellerin Kalem Seslerinden ve El Hareketlerinden Kelimeleri Okumada %10'un Altında Puan Aldığını Söyledi
Yeni bir arXiv makalesi, modellerin mürekkep olmadan, kalem çiziklerinden ve el hareketi videolarından yazılı bir kelime çıkarması gereken bir testi tanıtıyor. Yazarlar, insanlarda %80'in üzerinde sıralı harf doğruluğu ve önde gelen modellerin %10'un altında olduğunu ve modellere her iki yöntemi de vermenin genellikle sonuçları daha kötü hale getirdiğini bildiriyor.arxiv.orgYenilik
Paper, Aracı Farkında Önbellek Yönetiminin Çoklu Aracı Sunumunda İlk Belirteç Gecikmesini %45'e Kadar Azalttığını Söyledi
Yeni bir arXiv ön baskısı, açık kaynaklı vLLM sunucusu üzerine inşa edilmiş ve bir sonraki adımda hangi aracının çalışacağına bağlı olarak bir modelin anahtar/değer önbelleğinde neyin tutulacağına karar veren bir katman olan CacheScout'u tanımlıyor. Yazarlar çift haneli gecikme ve üretim artışı bildirdiler; özette iş yükleri, modeller ve donanım belirtilmemiştir.arxiv.orgYenilik
OpenAI Yapay Zeka Tarafından Oluşturulan Kanıtın Denetimi Tersine Dönmüş Bir Koşul Buluyor ve Bir Onarım Yayınlıyor
İki araştırmacı, OpenAI'in matematik belgesinin 6. Bölümündeki bir lemma kanıtında kutupsallık hatası bulunduğunu söylüyor: bir sonraki adımın büyük bir koşullu başarısızlığa ihtiyaç duyduğu ortalama başarı açısından bir test. Bir karşı örnek ve düzeltilmiş bir kanıt veriyorlar ve bunun, bölümün ana teoreminin doğrulanması olmadığı konusunda uyarıda bulunuyorlar.arxiv.orgYenilik
Çoğaltma Çalışması, FLOP'ların Yapay Zeka Çalışma Zamanını Hala Yanlış Tahmin Ettiğini ve Önerilen Düzeltmenin Daha Yeni Donanımda Başarısız Olduğunu Söylüyor
İki araştırmacının ön baskısı, eşit FLOP sayılarının neden eşit yürütme süresi anlamına gelmediğine dair daha önceki bir çalışmayı yeniden üretiyor. Temel iddiayı doğruluyor ancak α-FLOP düzeltme formülünün genellikle daha yeni donanımdaki çalışma süresini olduğundan düşük tahmin ettiğini, bu da formülün yakalayamadığı sıçramaları ve salınımları gösterdiğini bildiriyor.arxiv.orgkurumsal
Benchmark Paper, Yüksek Lisans Puanlarının %26'nın Altında Olduğu Kurumsal Verileri Sorgulamanın Dört Yolunu Buluyor
Yeni bir arXiv ön baskısı, kurumsal veritabanlarının doğal dilde sorgulanması için dört mimariyi sentetik iki dilli bir kıyaslamayla karşılaştırıyor. Hiçbiri vakaların yaklaşık dörtte birinden fazlasını doğru yanıtlamadı ve en yüksek puanı alan tasarım en güvenli veya en ucuz tasarım değildi.arxiv.orgYenilik
Paper, Daha Güçlü Bir Modele Yakınsamayı Ölçerek Yapay Zeka Güvenlik Aracılarının Etiketsiz Derecelendirilmesini Öneriyor
Yeni bir arXiv ön baskısı, güvenlik ekiplerinin, bellek veya erişim donanımlı bir yapay zeka aracısının, çoğunlukla kıt veya bayat olan etiketli ölçütler yerine, daha güçlü bir "öğretmen" modeliyle aradaki farkı ne kadar kapattığını ölçerek öğrenip öğrenmediğini değerlendirebileceğini öne sürüyor. Benzer şekilde güçlü bir modele bakılırsa kullanılabilir bir sinyal verilmedi.arxiv.org
Her hafta bir faydalı brifing
Akışta yaşamadan, yapay zekaya ayak uydurun.
Haftanın doğrulanmış yapay zeka haberlerini, orijinal verilerini, faydalı araçları, öğrenme önerilerini ve yeni yapay zeka işlerini edinin.
Yapay zekayı öğrenen insanlara ulaşın
Bir yapay zeka profesyonelini işe almak mı yoksa faydalı bir yapay zeka ürünü mi başlatmak mı? Bunu buraya öğrenmek ve hareket etmek için gelen insanların önüne koyun.
Bir yapay zeka işi ilan edinBir yapay zeka aracı gönderin