Diperbarui setiap hari2273 cerita terverifikasi
Berita AI. Tanpa kebisingan.
Liputan AI yang diperiksa sumber tentang peluncuran produk, perubahan kebijakan, riset keselamatan, dan langkah industri, dijelaskan dengan bahasa sederhana oleh tim edukasi nirlaba.
Sumber terverifikasi
Setiap cerita terhubung ke bukti terkuat yang tersedia: sumber asli jika tersedia, dan laporan yang jelas dikaitkan dengan jelas.
Bahasa Inggris Biasa
Apa yang terjadi, mengapa hal itu penting, dan apa yang harus diperhatikan — tanpa jargon.
Tidak ada pengisi
Ketika sinyalnya tipis, kami tidak mempublikasikan apa pun selain mengisi feed.
Lebih banyak cerita
9 ceritaInovasi
Tolok Ukur Mengatakan Skor Model Multimodal Teratas Di Bawah 10% dalam Membaca Kata Dari Suara Pena dan Gerakan Tangan
Makalah arXiv baru memperkenalkan pengujian di mana model harus menyimpulkan kata tertulis dari audio goresan pena dan video gerakan tangan, tanpa tinta terlihat. Para penulis melaporkan manusia di atas 80% dengan akurasi huruf yang dipesan dan model terdepan di bawah 10% — dan memberikan model kedua modalitas tersebut sering kali memberikan hasil yang lebih buruk.arxiv.orgInovasi
Paper Mengatakan Manajemen Cache Sadar Agen Memotong Penundaan Token Pertama Hingga 45% dalam Pelayanan Multi-Agen
Pracetak arXiv baru menjelaskan CacheScout, lapisan yang dibangun di server vLLM sumber terbuka yang memutuskan apa yang akan disimpan dalam cache nilai kunci model berdasarkan agen mana yang kemungkinan akan dijalankan selanjutnya. Penulis melaporkan latensi dua digit dan peningkatan throughput; beban kerja, model, dan perangkat keras tidak disebutkan secara abstrak.arxiv.orgInovasi
Audit terhadap OpenAI Bukti yang Dihasilkan AI Menemukan Kondisi Terbalik, dan Memublikasikan Perbaikan
Dua peneliti mengatakan bukti lemma dalam Bab 6 dokumen matematika OpenAI memiliki kesalahan polaritas: tes dalam hal keberhasilan rata-rata di mana langkah selanjutnya memerlukan kegagalan bersyarat yang besar. Mereka memberikan contoh tandingan dan bukti yang dikoreksi, dan memperingatkan bahwa ini bukan verifikasi teorema utama bab ini.arxiv.orgInovasi
Studi Replikasi Mengatakan FLOP Masih Salah Memprediksi Waktu Proses AI, dan Usulan Perbaikan Gagal pada Perangkat Keras Baru
Sebuah pracetak oleh dua peneliti mereproduksi studi sebelumnya tentang mengapa jumlah FLOP yang sama tidak berarti waktu eksekusi yang sama. Hal ini mengkonfirmasi klaim yang mendasarinya tetapi melaporkan bahwa rumus koreksi α-FLOPs umumnya meremehkan waktu proses pada perangkat keras yang lebih baru, yang menunjukkan lompatan dan osilasi yang tidak ditangkap oleh rumus tersebut.arxiv.orgPerusahaan
Makalah Tolok Ukur Menemukan Empat Cara untuk Mengkueri Data Perusahaan Dengan Semua Skor LLM Di Bawah 26%
Pracetak arXiv baru menempatkan empat arsitektur untuk kueri database perusahaan dalam bahasa alami terhadap satu sama lain pada tolok ukur bilingual sintetis. Tidak ada yang menjawab lebih dari seperempat kasus dengan benar, dan desain yang mendapat skor tertinggi bukanlah yang paling aman atau termurah.arxiv.orgInovasi
Makalah Mengusulkan Penilaian Agen Keamanan AI Tanpa Label dengan Mengukur Konvergensi ke Model yang Lebih Kuat
Pracetak arXiv baru berpendapat bahwa tim keamanan dapat menilai apakah agen AI yang dilengkapi memori atau pengambilan belajar dengan mengukur seberapa jauh ia menutup kesenjangan terhadap model “guru” yang lebih kuat, bukan pada tolok ukur berlabel yang sering kali langka atau ketinggalan jaman. Dilihat dari model bertenaga serupa tidak memberikan sinyal yang dapat digunakan.arxiv.orgInovasi
Tolok Ukur Baru Menguji Apakah Asisten AI Dapat Mengingat Satu Tahun Penggunaan Ponsel
Laporan teknis yang ditulis oleh 17 penulis dan diposting ke arXiv memperkenalkan MobileMem, sebuah tolok ukur dan kerangka kerja untuk memori jangka panjang pada perangkat yang dibangun dari kumpulan pengalaman seluler berskala tahun. Abstrak menjelaskan desain namun tidak melaporkan skor, dan detail penting tentang data yang mendasarinya masih dirahasiakan.arxiv.orgInovasi
Laporan Makalah Organisasi Modular Seperti Otak yang Muncul dalam Model Bahasa Besar
Pracetak arXiv baru mengatakan model bahasa besar mengembangkan struktur internal yang terspesialisasi secara fungsional yang sejalan dengan jaringan otak manusia yang berbeda, berdasarkan analisis sirkuit pada 46 tugas dalam empat domain kognitif. Halaman abstrak tidak mencantumkan rincian metodologi utama.arxiv.orgInovasi
Makalah Menemukan Lapisan Akhir dari Model Campuran Pakar Menoleransi Penyembunyian Pakar yang Berat
Sebuah pracetak melaporkan bahwa menonaktifkan pakar berkekuatan rendah di lima lapisan terakhir dari model Mixture-of-Experts dengan 35 miliar parameter akan mempertahankan keluaran terjemahan kode yang jauh lebih berguna daripada menyebarkan pemotongan yang sama ke semua lapisan. Ini mencakup satu model dan satu tolok ukur, dan laporan abstraknya tidak mengungkap garis dasar.arxiv.org
Satu pengarahan berguna setiap minggu
Ikuti AI tanpa harus hidup di feed.
Dapatkan berita AI terverifikasi minggu ini, data asli, alat berguna, pilihan pembelajaran, dan pekerjaan AI segar.
Jangkau orang-orang yang sedang mempelajari AI
Menyewa profesional AI atau meluncurkan produk AI yang berguna? Tunjukkan kepada orang-orang yang datang ke sini untuk belajar dan bertindak.
Posting pekerjaan AIKirim alat AI