Uppdateras dagligen2273 verifierade berättelser
AI Nyheter. Utan bruset.
Källkontrollerad AI-bevakning av produktlanseringar, policyskiften, säkerhetsforskning och branschrörelser, förklarad på enkel svenska av ett ideellt utbildningsteam.
Verifierad källhänvisning
Varje berättelse länkar till de starkaste tillgängliga bevisen: originalkällor när de finns tillgängliga, annars tydligt tillskrivna rapporteringar.
Vanlig engelska
Vad hände, varför det är viktigt och vad man ska titta på - utan jargong.
Inget fyllmedel
När signalen är tunn publicerar vi ingenting istället för att fylla ut flödet.
Fler berättelser
9 berättelserInnovation
Benchmark Says Top Multimodal Models Score Under 10% at Reading Words From Pen Sounds and Hand Motion
A new arXiv paper introduces a test in which models must infer a written word from pen-scratch audio and hand-movement video, with no ink visible. The authors report humans above 80% ordered letter accuracy and leading models below 10% — and that giving models both modalities often made results worse.arxiv.orgInnovation
Paper säger att agentmedveten cachehantering minskar fördröjningen av första token med upp till 45 % i visning av flera agenter
Ett nytt arXiv-förtryck beskriver CacheScout, ett lager byggt på vLLM-servern med öppen källkod som bestämmer vad som ska behållas i en modells nyckel-värdescache baserat på vilken agent som troligen kommer att köras härnäst. Författarna rapporterar tvåsiffrig latens och genomströmningsvinster; arbetsbelastningen, modellerna och hårdvaran anges inte i abstraktet.arxiv.orgInnovation
Granskning av ett OpenAI AI-genererat bevis hittar ett omvänt tillstånd och publicerar en reparation
Två forskare säger att ett lemmabevis i kapitel 6 i OpenAIs matematikdokument har ett polaritetsfel: ett test i termer av genomsnittlig framgång där nästa steg kräver ett stort villkorligt misslyckande. De ger ett motexempel och ett korrigerat bevis, och varnar för att detta inte är verifiering av kapitlets huvudsats.arxiv.orgInnovation
Replication Study Says FLOPs Still Mispredict AI Runtime, and the Proposed Fix Fails on Newer Hardware
A preprint by two researchers reproduces an earlier study on why equal FLOP counts do not mean equal execution time. It confirms the underlying claim but reports that the α-FLOPs correction formula generally underestimates runtime on newer hardware, which shows jumps and oscillations the formula does not capture.arxiv.orgFöretag
Benchmark Paper hittar fyra sätt att söka företagsdata med LLM:s alla poäng under 26 %
Ett nytt arXiv-förtryck sätter fyra arkitekturer för sökning på naturliga språk av företagsdatabaser mot varandra på ett syntetiskt tvåspråkigt riktmärke. Ingen svarade rätt på mer än ungefär en fjärdedel av fallen och den design som fick högst poäng var inte den säkraste eller billigaste.arxiv.orgInnovation
Paper föreslår klassificering av AI-säkerhetsagenter utan etiketter genom att mäta konvergens till en starkare modell
En ny arXiv preprint hävdar att säkerhetsteam kan bedöma om en minnes- eller hämtningsutrustad AI-agent lär sig genom att mäta hur långt den stänger gapet till en starkare "lärarmodell", snarare än på märkta riktmärken som ofta är knappa eller inaktuella. Att döma av en liknande driven modell gav ingen användbar signal.arxiv.orgInnovation
Nya benchmark-tester om AI-assistenter kan komma ihåg ett års telefonanvändning
En teknisk rapport med 17 författare som publicerats på arXiv introducerar MobileMem, ett riktmärke och ramverk för långtidsminne på enheten byggt från en samling av mobila upplevelser i årsskala. Sammanfattningen beskriver designen men rapporterar inga poäng, och nyckeldetaljer om underliggande data förblir okänd.arxiv.orgInnovation
Pappersrapporter Hjärnliknande modulär organisation som växer fram i stora språkmodeller
Ett nytt arXiv preprint säger att stora språkmodeller utvecklar funktionellt specialiserad intern struktur som stämmer överens med distinkta mänskliga hjärnnätverk, baserat på kretsanalyser över 46 uppgifter i fyra kognitiva domäner. Den abstrakta sidan lämnar viktiga metodologiska detaljer oförklarade.arxiv.orgInnovation
Papper hittar sena lager av en blandning av expertmodeller tål tung expertmaskering
Ett förtryck rapporterar att inaktivering av lågmagnitude experter i de sista fem lagren av en 35-miljarder-parameter Mixture-of-Experts modell bevarade mycket mer användbara kodöversättningsutdata än att sprida samma snitt över alla lager. Den täcker en modell och ett riktmärke, och sammandraget rapporterar ingen omaskerad baslinje.arxiv.org
En användbar genomgång varje vecka
Håll dig uppdaterad med AI utan att leva i flödet.
Få veckans verifierade AI-nyheter, originaldata, användbara verktyg, lärtips och nya AI-jobb.
Nå människor som lär sig AI
Anlita en AI-professionell eller lansera en användbar AI-produkt? Sätt det framför folk som kom hit för att lära sig och agera.
Lägg upp ett AI-jobbSkicka in ett AI-verktyg