Uppdateras dagligen2528 verifierade berättelser
AI Nyheter. Utan bruset.
Källkontrollerad AI-bevakning av produktlanseringar, policyskiften, säkerhetsforskning och branschrörelser, förklarad på enkel svenska av ett ideellt utbildningsteam.
Verifierad källhänvisning
Varje berättelse länkar till de starkaste tillgängliga bevisen: originalkällor när de finns tillgängliga, annars tydligt tillskrivna rapporteringar.
Vanlig engelska
Vad hände, varför det är viktigt och vad man ska titta på - utan jargong.
Inget fyllmedel
När signalen är tunn publicerar vi ingenting istället för att fylla ut flödet.
Fler berättelser
9 berättelserInnovation
Utvärdera AI Agent Skill Performance med NVIDIA SkillEvaluator
NVIDIA SkillEvaluator mäter effekten av verifierade färdigheter på AI-agentens prestanda genom en utvärderingsprocess i tre nivåer.
developer.nvidia.comInnovation
Paper introducerar "Shadow Evaluations": AI-agenter gjorde tekniken men misslyckades med två forskningsfrågor
Ett förtryck med 24 författare fick frontier AI-agenter att försöka de centrala forskningsfrågorna i två opublicerade NeurIPS 2026-inlämningar, och sedan fick tidningarnas egna författare betygsätta resultaten. Agenterna skötte ingenjörsarbetet utan hjälp under sex dagar men avvisades otvetydigt i forskningen.arxiv.orgProdukt
Warp öppnar tidig åtkomst till "Factories", ett Config-as-Code-system för att köra flottor av kodningsagenter
Warp tar förfrågningar om tidig åtkomst för Warp Factories, som definierar flottor av kodningsagenter som kod – repos, modeller, behörigheter och mänskliga kontrollpunkter i en YAML-fil, driven av CLI, API, SDK och MCP. Dess automatiserings- och kostnadssiffror är leverantörsanspråk: ingen prissättning, allmänt tillgänglighetsdatum eller oberoende testning.warp.devInnovation
Benchmark säger att de bästa multimodala modellerna ger under 10 % vid läsning av ord från pennljud och handrörelse
Ett nytt arXiv-papper introducerar ett test där modeller måste sluta sig till ett skrivet ord från ljud med penna och handrörelse, utan att bläcket syns. Författarna rapporterar att människor över 80 % beställde bokstavsnoggrannhet och ledande modeller under 10 % - och att ge modeller båda modaliteterna ofta gjorde resultaten sämre.arxiv.orgInnovation
Paper säger att agentmedveten cachehantering minskar fördröjningen av första token med upp till 45 % i visning av flera agenter
Ett nytt arXiv-förtryck beskriver CacheScout, ett lager byggt på vLLM-servern med öppen källkod som bestämmer vad som ska behållas i en modells nyckel-värdescache baserat på vilken agent som troligen kommer att köras härnäst. Författarna rapporterar tvåsiffrig latens och genomströmningsvinster; arbetsbelastningen, modellerna och hårdvaran anges inte i abstraktet.arxiv.orgInnovation
Granskning av ett OpenAI AI-genererat bevis hittar ett omvänt tillstånd och publicerar en reparation
Två forskare säger att ett lemmabevis i kapitel 6 i OpenAIs matematikdokument har ett polaritetsfel: ett test i termer av genomsnittlig framgång där nästa steg kräver ett stort villkorligt misslyckande. De ger ett motexempel och ett korrigerat bevis, och varnar för att detta inte är verifiering av kapitlets huvudsats.arxiv.orgInnovation
Replikeringsstudie säger att FLOPs fortfarande felförutsäger AI-körtid, och att den föreslagna korrigeringen misslyckas på nyare hårdvara
Ett förtryck av två forskare återger en tidigare studie om varför lika FLOP-antal inte betyder lika utförandetid. Den bekräftar det underliggande påståendet men rapporterar att α-FLOPs-korrigeringsformeln generellt underskattar körtid på nyare hårdvara, vilket visar hopp och svängningar som formeln inte fångar upp.arxiv.orgFöretag
Benchmark Paper hittar fyra sätt att söka företagsdata med LLM:s alla poäng under 26 %
Ett nytt arXiv-förtryck sätter fyra arkitekturer för sökning på naturliga språk av företagsdatabaser mot varandra på ett syntetiskt tvåspråkigt riktmärke. Ingen svarade rätt på mer än ungefär en fjärdedel av fallen och den design som fick högst poäng var inte den säkraste eller billigaste.arxiv.orgInnovation
Paper föreslår klassificering av AI-säkerhetsagenter utan etiketter genom att mäta konvergens till en starkare modell
En ny arXiv preprint hävdar att säkerhetsteam kan bedöma om en minnes- eller hämtningsutrustad AI-agent lär sig genom att mäta hur långt den stänger gapet till en starkare "lärarmodell", snarare än på märkta riktmärken som ofta är knappa eller inaktuella. Att döma av en liknande driven modell gav ingen användbar signal.arxiv.org
En användbar genomgång varje vecka
Håll dig uppdaterad med AI utan att leva i flödet.
Få veckans verifierade AI-nyheter, originaldata, användbara verktyg, lärtips och nya AI-jobb.
Nå människor som lär sig AI
Anlita en AI-professionell eller lansera en användbar AI-produkt? Sätt det framför folk som kom hit för att lära sig och agera.
Lägg upp ett AI-jobbSkicka in ett AI-verktyg