Dikemas kini setiap hari2528 cerita yang disahkan
Berita AI. Tanpa bunyi bising.
Liputan AI yang diperiksa sumber mengenai pelancaran produk, perubahan dasar, penyelidikan keselamatan, dan langkah industri, dijelaskan dalam bahasa Inggeris mudah oleh pasukan pendidikan bukan untung.
Sumber yang disahkan
Setiap cerita berhubung dengan bukti terkuat yang ada: sumber asal apabila ada, laporan yang sebaliknya jelas dikaitkan.
Bahasa Inggeris biasa
Apa yang berlaku, mengapa ia penting, dan perkara yang perlu ditonton — tanpa jargon.
Tiada pengisi
Apabila isyarat nipis, kami tidak menerbitkan apa-apa selain daripada mengalas suapan.
Lagi cerita
9 ceritaInovasi
Menilai Prestasi Kemahiran Ejen AI dengan NVIDIA SkillEvaluator
NVIDIA SkillEvaluator mengukur kesan kemahiran yang disahkan pada prestasi ejen AI melalui proses penilaian tiga peringkat.
developer.nvidia.comInovasi
Kertas Memperkenalkan "Penilaian Bayangan": Ejen AI Melakukan Kejuruteraan tetapi Gagal Dua Soalan Penyelidikan
Pracetak 24 pengarang mempunyai ejen AI sempadan mencuba soalan penyelidikan pusat bagi dua penyerahan NeurIPS 2026 yang tidak diterbitkan, kemudian meminta pengarang kertas itu sendiri menilai hasilnya. Ejen mengendalikan kejuruteraan tanpa bantuan selama enam hari tetapi ditolak dengan jelas dalam penyelidikan.arxiv.orgproduk
Warp Membuka Akses Awal kepada "Kilang," Sistem Konfig-sebagai-Kod untuk Menjalankan Armada Agen Pengekodan
Warp menerima permintaan akses awal untuk Warp Factories, yang mentakrifkan kumpulan ejen pengekodan sebagai kod — repo, model, kebenaran dan pusat pemeriksaan manusia dalam satu fail YAML, didorong oleh CLI, API, SDK dan MCP. Angka automasi dan kosnya ialah tuntutan vendor: tiada harga, tarikh ketersediaan umum atau ujian bebas.warp.devInovasi
Penanda Aras Mengatakan Model Multimodal Teratas Skor Di Bawah 10% pada Membaca Perkataan Daripada Bunyi Pen dan Gerakan Tangan
Kertas arXiv baharu memperkenalkan ujian di mana model mesti membuat kesimpulan perkataan bertulis daripada audio calar pen dan video gerakan tangan, tanpa dakwat kelihatan. Pengarang melaporkan manusia melebihi 80% memesan ketepatan huruf dan model terkemuka di bawah 10% — dan memberikan model kedua-dua modaliti sering memburukkan keputusan.arxiv.orgInovasi
Kertas Mengatakan Pengurusan Cache Sedar Agen Mengurangkan Kelewatan Token Pertama Sehingga 45% dalam Penyajian Berbilang Ejen
Pracetak arXiv baharu menerangkan CacheScout, lapisan yang dibina pada pelayan vLLM sumber terbuka yang memutuskan perkara yang perlu disimpan dalam cache nilai kunci model berdasarkan agen mana yang mungkin akan dijalankan seterusnya. Pengarang melaporkan kependaman dua digit dan keuntungan pemprosesan; beban kerja, model dan perkakasan tidak dinyatakan dalam abstrak.arxiv.orgInovasi
Audit OpenAI Bukti Dijana AI Menemui Keadaan Terbalik, dan Menerbitkan Pembaikan
Dua penyelidik mengatakan bukti lemma dalam Bab 6 dokumen matematik OpenAI mempunyai ralat kekutuban: ujian dari segi purata kejayaan di mana langkah seterusnya memerlukan kegagalan bersyarat yang besar. Mereka memberikan contoh balas dan bukti yang diperbetulkan, dan berhati-hati bahawa ini bukan pengesahan teorem utama bab.arxiv.orgInovasi
Kajian Replikasi Mengatakan FLOP Masih Salah Ramalan Masa Jalan AI, dan Cadangan Pembaikan Gagal pada Perkakasan Baru
Pracetak oleh dua penyelidik menghasilkan semula kajian terdahulu tentang sebab kiraan FLOP yang sama tidak bermakna masa pelaksanaan yang sama. Ia mengesahkan dakwaan asas tetapi melaporkan bahawa formula pembetulan α-FLOPs secara amnya meremehkan masa jalan pada perkakasan yang lebih baharu, yang menunjukkan lompatan dan ayunan yang tidak ditangkap oleh formula.arxiv.orgPerusahaan
Kertas Penanda Aras Menemui Empat Cara untuk Menyoal Data Perusahaan Dengan LLM Semua Skor Di Bawah 26%
Pracetak arXiv baharu menggabungkan empat seni bina untuk pertanyaan bahasa semula jadi bagi pangkalan data perusahaan antara satu sama lain pada penanda aras dwibahasa sintetik. Tiada yang menjawab lebih daripada satu perempat kes dengan betul, dan reka bentuk yang mendapat markah tertinggi bukanlah yang paling selamat atau paling murah.arxiv.orgInovasi
Paper Mencadangkan Penggredan Ejen Keselamatan AI Tanpa Label dengan Mengukur Penumpuan kepada Model yang Lebih Kuat
Pracetak arXiv baharu berhujah bahawa pasukan keselamatan boleh menilai sama ada ejen AI yang dilengkapi memori atau pengambilan sedang belajar dengan mengukur sejauh mana ia merapatkan jurang kepada model "guru" yang lebih kukuh, dan bukannya pada penanda aras berlabel yang selalunya jarang atau basi. Berdasarkan model berkuasa serupa tidak memberikan isyarat yang boleh digunakan.arxiv.org
Satu taklimat berguna setiap minggu
Teruskan AI tanpa perlu hidup dalam suapan itu.
Dapatkan berita AI yang disahkan minggu ini, data asal, alat berguna, pilihan pembelajaran, dan pekerjaan AI segar.
Jangkau orang yang belajar AI
Mengupah profesional AI atau melancarkan produk AI yang berguna? Tunjukkan kepada orang yang datang ke sini untuk belajar dan bertindak.
Siarkan kerja AIHantar alat AI