Dikemas kini setiap hari2000 cerita yang disahkan
Berita AI. Tanpa bunyi bising.
Liputan AI yang diperiksa sumber mengenai pelancaran produk, perubahan dasar, penyelidikan keselamatan, dan langkah industri, dijelaskan dalam bahasa Inggeris mudah oleh pasukan pendidikan bukan untung.
Sumber yang disahkan
Setiap cerita berhubung dengan bukti terkuat yang ada: sumber asal apabila ada, laporan yang sebaliknya jelas dikaitkan.
Bahasa Inggeris biasa
Apa yang berlaku, mengapa ia penting, dan perkara yang perlu ditonton — tanpa jargon.
Tiada pengisi
Apabila isyarat nipis, kami tidak menerbitkan apa-apa selain daripada mengalas suapan.
Lagi cerita
9 ceritaInovasi
Kaji peta 46 model bahasa yang dibina untuk bahasa Portugis
Kajian pemetaan sistematik mengkatalog 46 model bahasa Portugis dan membandingkan seni bina, sumber latihan, pelesenan, kod, data dan pemberat. Penulis mengatakan bidang itu berkembang tetapi sukar untuk dinilai kerana maklumat tersebar di seluruh kertas, laporan teknikal, repositori dan dokumentasi projek.arxiv.orgInovasi
Interpretability study links Qwen3-4B’s overconfident answers to a certainty-biased mechanism
An arXiv study reports that Qwen3-4B favors certainty over uncertainty in controlled reasoning tasks and identifies model features that may drive the imbalance. The authors say targeted interventions reduced overconfident errors, but the abstract does not disclose effect sizes or testing details.arxiv.orgInovasi
The Deontic Gap: Large Language Models and the Modal Language of Obligation
Modal auxiliaries such as must, should, and have to mark necessity and obligation within the contexts of speaker authority and interpersonal stance.arxiv.orgKeselamatan
Paper proposes obscuring refusal signals to resist abliteration attacks
An arXiv preprint introduces a weight-editing method intended to make safety refusals harder to extract and remove. The paper reports stronger post-abliteration refusal scores on two open models, with different tradeoffs in general-purpose performance.arxiv.orgInovasi
Kertas melaporkan kaedah temporal untuk mengesan halusinasi pada tahap token
Pracetak arXiv menerangkan pengesan halusinasi yang menggabungkan statistik teks, isyarat entail dan kejutan model bahasa merentas jujukan dan bukannya menilai token secara bebas. Model BiGRUnya mencapai AUC 0.840 pada RAGTruth, menurut kertas itu.arxiv.orgInovasi
Penjejakan entiti muncul pada 410 juta parameter, melebihi manusia merentas naratif naturalistik
Memahami bahasa memerlukan penjejakan entiti merentas wacana - iaitu, mengetahui di mana keadaan dan cara ia berubah, walaupun tidak dinyatakan secara eksplisit.arxiv.orgInovasi
Paper reports compiler-guided search improves Lean theorem-proving efficiency
An arXiv preprint proposes an adaptive proof-search method for context-dependent Lean 4 projects. Its authors report a 12.8-percentage-point average pass-rate improvement within a pass@32 budget while using 21.9% fewer LLM calls than pass@k baselines.arxiv.orgInovasi
Benchmark Separates Geometry Solving From Diagram Construction
A new open-source benchmark tests whether foundation models can construct faithful geometry diagrams, not merely solve the underlying problems. Its authors report that evaluated models achieved an average compile success rate of 36.14%, exposing a gap between mathematical answers and usable visual constructions.arxiv.orgInovasi
Penjajaran Adalah Semua yang Anda Perlukan: Latihan Tanpa Arahan untuk Model Bahasa Audio Umum
Pendekatan baharu untuk melatih model bahasa besar berbilang mod (MLLM) menghapuskan keperluan untuk penyeliaan khusus tugasan yang meluas.arxiv.org
Satu taklimat berguna setiap minggu
Teruskan AI tanpa perlu hidup dalam suapan itu.
Dapatkan berita AI yang disahkan minggu ini, data asal, alat berguna, pilihan pembelajaran, dan pekerjaan AI segar.
Jangkau orang yang belajar AI
Mengupah profesional AI atau melancarkan produk AI yang berguna? Tunjukkan kepada orang yang datang ke sini untuk belajar dan bertindak.
Siarkan kerja AIHantar alat AI