Dikemas kini setiap hari1866 cerita yang disahkan
Berita AI. Tanpa bunyi bising.
Liputan AI yang diperiksa sumber mengenai pelancaran produk, perubahan dasar, penyelidikan keselamatan, dan langkah industri, dijelaskan dalam bahasa Inggeris mudah oleh pasukan pendidikan bukan untung.
Sumber yang disahkan
Setiap cerita berhubung dengan bukti terkuat yang ada: sumber asal apabila ada, laporan yang sebaliknya jelas dikaitkan.
Bahasa Inggeris biasa
Apa yang berlaku, mengapa ia penting, dan perkara yang perlu ditonton — tanpa jargon.
Tiada pengisi
Apabila isyarat nipis, kami tidak menerbitkan apa-apa selain daripada mengalas suapan.
Lagi cerita
9 ceritaindustri
Kursor Mengatakan Pemerolehannya oleh SpaceX Telah Ditutup Secara Rasmi
Kursor menerbitkan catatan pendek mengatakan SpaceX telah menyelesaikan pemerolehan alat pengekodan AI, menyelesaikan proses yang dikatakan bermula pada April dengan perkongsian latihan model dengan SpaceXAI. Siaran itu menjanjikan akses kepada apa yang disebutnya sebagai kumpulan GPU terbesar di dunia, tetapi tidak mendedahkan syarat, garis masa atau perubahan produk.
cursor.comInovasi
Penanda Aras Baharu Mendapati Ejen AI Tersalah Sekat Kerja Yang Diluluskan 28% Sepanjang Masa
Pracetak memperkenalkan SteerBench-Work, ujian 106 senario ketika ejen AI memutuskan untuk bertindak atau berhenti seketika untuk semakan. Merentasi 30 keadaan model, penulis melaporkan bahawa salah memegang kerja yang dibersihkan adalah kira-kira 28 kali lebih biasa daripada salah membenarkan kerja yang tidak selamat.arxiv.orgInovasi
Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Di Bawah Pushback
Pracetak arXiv baharu menguji sembilan model sempadan yang digunakan sebagai penggred automatik dan melaporkan bahawa kesemuanya menukar keputusan mereka di bawah cabaran — dan keputusan yang diubah biasanya beralih daripada jawapan yang betul, bukan ke arah itu.arxiv.orgInovasi
Kertas Berhujah Strategi Evolusi Mengalahkan RL pada Mengekalkan Set Jawapan LLM Pelbagai
Pracetak arXiv baharu berpendapat bahawa LLM selepas latihan dengan strategi evolusi — kaedah berasaskan populasi, bebas kecerunan yang mengganggu pemberat secara langsung — mengalahkan pembelajaran pengukuhan pada pass@k dan liputan penyelesaian. Abstrak memetik hasil penanda aras matematik yang lebih baik tetapi tidak menamakan model, penanda aras atau nombor.arxiv.orgKeselamatan
Paper Mengatakan Ejen AI Mempertingkatkan Diri Boleh Mengubah Satu Kejayaan Tidak Selamat Menjadi Kemahiran Boleh Digunakan Semula
Pracetak arXiv baharu menanda aras mod kegagalan ejen tertentu: apabila ejen yang memperbaiki diri menulis prosedur yang tidak selamat ke dalam ingatan, ia boleh diambil dan dilaksanakan dalam sesi kemudian. Setiap konfigurasi berubah yang diuji menghasilkan artifak yang tidak selamat, dan tiga tugas berniat jahat lebih daripada dua kali ganda kejayaan serangan pemindahan.arxiv.orgKeselamatan
SEAG Paper Mencadang Aliasing Entiti Sensitif Sebelum Pertanyaan RAG Mencapai LLM Luaran
Pracetak yang disiarkan ke arXiv menerangkan rangka kerja yang menukar nama sensitif dalam pertanyaan dan mendapatkan semula dokumen untuk alias sebelum menghantarnya kepada model pihak ketiga. Penulis melaporkan lebih 80% ketepatan pada metrik pengguna hujung ke hujung mereka, dan kadar penyembunyian penuh antara 74.91% dan 77.83% merentas tiga model kecil.arxiv.orgInovasi
Laporan Kertas CABS+ Lebih Murah, Model Lebih Pantas Bercantum Merentas 27 Set Data
Pracetak yang disiarkan ke arXiv menerangkan CABS+, kaedah penggabungan model yang menggantikan carian grid dengan carian pekali bebas kecerunan. Penulis melaporkan peningkatan prestasi dua digit berbanding dua garis dasar, di bawah satu perempat daripada satu memori GPU garis dasar, dan lebih kurang 4x kelajuan berbanding yang lain.arxiv.orgInovasi
Kertas Mencadangkan "Pelajaran" yang Diperoleh untuk Memperbaik Penaakulan Ruang dalam Model Bahasa Penglihatan Beku
Pracetak arXiv menerangkan Ejen Memori Spatial, yang menyimpan pengalaman yang disahkan sebagai pelajaran teks yang diperoleh pada masa inferens, menuntut keuntungan merentas lima penanda aras spatial dan empat model bahasa penglihatan tanpa mengubah berat model. Ia dalam semakan; nama abstraknya tiada tanda aras, model asas atau jidar.arxiv.orgInovasi
Kertas PROVE-RT Laporan 44.7% Kejayaan Menjana Bukti Masa Nyata Disemak Mesin
Pracetak arXiv mempersembahkan PROVE-RT, yang menggunakan pengesanan semula dan gesaan berperingkat untuk membuat model bahasa besar menulis skrip bukti PROSA/ROCQ untuk analisis penjadualan masa nyata. Pengarang melaporkan kadar kejayaan 44.7% pada set penilaian yang dipilih susun, di mana dorongan langsung gagal menghasilkan mekanisasi yang sah dengan pasti.arxiv.org
Satu taklimat berguna setiap minggu
Teruskan AI tanpa perlu hidup dalam suapan itu.
Dapatkan berita AI yang disahkan minggu ini, data asal, alat berguna, pilihan pembelajaran, dan pekerjaan AI segar.
Jangkau orang yang belajar AI
Mengupah profesional AI atau melancarkan produk AI yang berguna? Tunjukkan kepada orang yang datang ke sini untuk belajar dan bertindak.
Siarkan kerja AIHantar alat AI