Uppdateras dagligen1866 verifierade berättelser
AI Nyheter. Utan bruset.
Källkontrollerad AI-bevakning av produktlanseringar, policyskiften, säkerhetsforskning och branschrörelser, förklarad på enkel svenska av ett ideellt utbildningsteam.
Verifierad källhänvisning
Varje berättelse länkar till de starkaste tillgängliga bevisen: originalkällor när de finns tillgängliga, annars tydligt tillskrivna rapporteringar.
Vanlig engelska
Vad hände, varför det är viktigt och vad man ska titta på - utan jargong.
Inget fyllmedel
När signalen är tunn publicerar vi ingenting istället för att fylla ut flödet.
Fler berättelser
9 berättelserIndustri
Cursor säger att dess förvärv av SpaceX har officiellt stängt
Cursor publicerade ett kort inlägg som sa att SpaceX har slutfört sitt förvärv av AI-kodningsverktyget, och avslutar en process som den säger började i april med ett modellutbildningspartnerskap med SpaceXAI. Inlägget lovar tillgång till vad det kallar världens största GPU-flotta, men avslöjar inga villkor, tidslinjer eller produktändringar.
cursor.comInnovation
Ny benchmark hittar AI-agenter felaktigt blockerar godkänt arbete 28 % av tiden
Ett förtryck introducerar SteerBench-Work, ett test med 106 scenarier i det ögonblick som en AI-agent bestämmer sig för att agera eller pausa för granskning. Över 30 modellförhållanden rapporterar författarna att det var ungefär 28 gånger vanligare att felaktigt hålla rensade arbeten än att felaktigt tillåta osäkert arbete.arxiv.orgInnovation
Paper Reports Frontier LLM-domare vänder domar 25-71 % under förskjutning
En ny arXiv preprint stresstestar nio frontier-modeller som används som automatiserade väghyvlar och rapporterar att alla ändrar sina domar under utmaning - och att de ändrade domarna vanligtvis går bort från det korrekta svaret, inte mot det.arxiv.orgInnovation
Paper argumenterar för Evolution Strategies Beat RL på att hålla LLM Answer Set Diverse
En ny arXiv preprint hävdar att efterträning av LLM med evolutionsstrategier – en befolkningsbaserad, gradientfri metod som stör vikter direkt – slår förstärkningsinlärning på pass@k och lösningstäckning. Sammanfattningen citerar bättre matematiska benchmarkresultat men nämner inga modeller, benchmarks eller siffror.arxiv.orgSäkerhet
Paper säger att självförbättrande AI-agenter kan förvandla en osäker framgång till en återanvändbar färdighet
En ny arXiv preprint riktmärker ett specifikt agentfelläge: när en självförbättrande agent skriver en osäker procedur i minnet kan den hämtas och köras i senare sessioner. Varje utvecklad konfiguration som testades producerade osäkra artefakter, och tre skadliga uppgifter mer än fördubblade framgången för överförda attacker.arxiv.orgSäkerhet
SEAG Paper föreslår aliasing av känsliga enheter innan RAG-förfrågningar når externa LLM:er
Ett förtryck som postats till arXiv beskriver ett ramverk som byter ut känsliga namn i frågor och hämtade dokument mot alias innan de skickas till en tredjepartsmodell. Författarna rapporterar över 80 % noggrannhet för sin slutanvändarstatistik och frekvenser för fullständig döljande mellan 74,91 % och 77,83 % över tre små modeller.arxiv.orgInnovation
CABS+ Paper Reports Cheaper, Faster Model Merging Across 27 Datasets
A preprint posted to arXiv describes CABS+, a model-merging method that replaces grid search with a gradient-free coefficient search. The authors report double-digit performance gains over two baselines, under a quarter of one baseline's GPU memory, and roughly a 4x speedup over another.arxiv.orgInnovation
Paper Proposes Retrieved "Lessons" to Improve Spatial Reasoning in Frozen Vision-Language Models
An arXiv preprint describes Spatial Memory Agent, which stores verified experience as text lessons retrieved at inference time, claiming gains across five spatial benchmarks and four vision-language models without changing model weights. It is under review; its abstract names no benchmarks, base models, or margins.arxiv.orgInnovation
PROVE-RT Paper Reports 44.7% Success Generating Machine-Checked Real-Time Proofs
An arXiv preprint presents PROVE-RT, which uses retrieval and staged prompting to make large language models write PROSA/ROCQ proof scripts for real-time schedulability analysis. The authors report a 44.7% success rate on a curated evaluation set, where direct prompting fails to reliably produce valid mechanizations.arxiv.org
En användbar genomgång varje vecka
Håll dig uppdaterad med AI utan att leva i flödet.
Få veckans verifierade AI-nyheter, originaldata, användbara verktyg, lärtips och nya AI-jobb.
Nå människor som lär sig AI
Anlita en AI-professionell eller lansera en användbar AI-produkt? Sätt det framför folk som kom hit för att lära sig och agera.
Lägg upp ett AI-jobbSkicka in ett AI-verktyg