Oppdateres daglig2396 bekreftede historier
AI Nyheter. Uten støyen.
Kildesjekket AI-dekning av produktlanseringer, endringer i retningslinjene, sikkerhetsundersøkelser og bransjebevegelser, forklart på vanlig engelsk av et nonprofit-utdanningsteam.
Verifisert kilde
Hver historie kobler til de sterkeste tilgjengelige bevisene: originale kilder når de er tilgjengelige, ellers tydelig tilskrevet rapportering.
Vanlig engelsk
Hva skjedde, hvorfor det er viktig og hva du bør se - uten sjargongen.
Ingen filler
Når signalet er tynt, publiserer vi ingenting i stedet for å polstre feeden.
Flere historier
9 historierInnovasjon
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
developer.nvidia.comInnovasjon
Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questions
A 24-author preprint had frontier AI agents attempt the central research questions of two unpublished NeurIPS 2026 submissions, then had the papers' own authors grade the results. The agents handled the engineering unaided over six days but were unambiguously rejected on the research.arxiv.orgProdukt
Warp Opens Early Access to "Factories," a Config-as-Code System for Running Fleets of Coding Agents
Warp is taking early-access requests for Warp Factories, which defines fleets of coding agents as code — repos, models, permissions and human checkpoints in one YAML file, driven by CLI, API, SDK and MCP. Its automation and cost figures are vendor claims: no pricing, general availability date or independent testing.warp.devInnovasjon
Benchmark sier at de beste multimodale modellene scorer under 10 % ved å lese ord fra pennelyder og håndbevegelser
Et nytt arXiv-papir introduserer en test der modellene må utlede et skrevet ord fra penn-scratch-lyd og håndbevegelsesvideo, uten blekk synlig. Forfatterne rapporterer at mennesker over 80 % bestilte bokstavnøyaktighet og ledende modeller under 10 % - og at det å gi modellene begge modalitetene ofte gjorde resultatene verre.arxiv.orgInnovasjon
Paper sier Agent-Aware Cache Management reduserer første-token-forsinkelsen med opptil 45 % i multi-agent-servering
Et nytt arXiv preprint beskriver CacheScout, et lag bygget på open source vLLM-serveren som bestemmer hva som skal beholdes i en modells nøkkelverdi-cache basert på hvilken agent som sannsynligvis kjører neste gang. Forfatterne rapporterer tosifret ventetid og gjennomstrømningsgevinster; arbeidsmengdene, modellene og maskinvaren er ikke oppgitt i abstraktet.arxiv.orgInnovasjon
Revisjon av et OpenAI AI-generert bevis finner en omvendt tilstand og publiserer en reparasjon
To forskere sier at et lemmabevis i kapittel 6 i OpenAIs matematikkdokument har en polaritetsfeil: en test i form av gjennomsnittlig suksess der neste trinn trenger en stor betinget feil. De gir et moteksempel og et korrigert bevis, og advarer om at dette ikke er verifisering av kapittelets hovedteorem.arxiv.orgInnovasjon
Replikeringsstudie sier at FLOP-er fortsatt feilforutsier AI-kjøring, og at den foreslåtte løsningen mislykkes på nyere maskinvare
Et fortrykk av to forskere gjengir en tidligere studie om hvorfor like FLOP-tall ikke betyr lik utførelsestid. Den bekrefter den underliggende påstanden, men rapporterer at α-FLOPs-korreksjonsformelen generelt undervurderer kjøretid på nyere maskinvare, som viser hopp og svingninger formelen ikke fanger opp.arxiv.orgEnterprise
Benchmark Paper finner fire måter å forespørre bedriftsdata med LLM-er på under 26 %
Et nytt arXiv preprint setter fire arkitekturer for naturlig språksøking av bedriftsdatabaser opp mot hverandre på en syntetisk tospråklig benchmark. Ingen svarte mer enn rundt en fjerdedel av sakene riktig, og designet som skåret høyest var ikke det sikreste eller billigste.arxiv.orgInnovasjon
Paper foreslår å gradere AI-sikkerhetsagenter uten etiketter ved å måle konvergens til en sterkere modell
Et nytt arXiv preprint argumenterer for at sikkerhetsteam kan vurdere om en minne- eller gjenfinningsutstyrt AI-agent lærer ved å måle hvor langt den lukker gapet til en sterkere "lærer"-modell, i stedet for på merkede benchmarks som ofte er knappe eller foreldede. Å dømme etter en tilsvarende drevet modell ga ikke noe brukbart signal.arxiv.org
En nyttig orientering hver uke
Hold deg oppdatert med AI uten å leve i feeden.
Få ukens bekreftede AI-nyheter, originale data, nyttige verktøy, læringsvalg og ferske AI-jobber.
Nå folk som lærer AI
Ansette en AI-profesjonell eller lansere et nyttig AI-produkt? Sett det foran folk som kom hit for å lære og handle.
Legg ut en AI-jobbSend inn et AI-verktøy