Oppdateres daglig2528 bekreftede historier
AI Nyheter. Uten støyen.
Kildesjekket AI-dekning av produktlanseringer, endringer i retningslinjene, sikkerhetsundersøkelser og bransjebevegelser, forklart på vanlig engelsk av et nonprofit-utdanningsteam.
Verifisert kilde
Hver historie kobler til de sterkeste tilgjengelige bevisene: originale kilder når de er tilgjengelige, ellers tydelig tilskrevet rapportering.
Vanlig engelsk
Hva skjedde, hvorfor det er viktig og hva du bør se - uten sjargongen.
Ingen filler
Når signalet er tynt, publiserer vi ingenting i stedet for å polstre feeden.
Flere historier
9 historierInnovasjon
Evaluering av AI Agent Skill Performance med NVIDIA SkillEvaluator
NVIDIA SkillEvaluator måler virkningen av verifiserte ferdigheter på AI-agentytelse gjennom en tre-lags evalueringsprosess.
developer.nvidia.comInnovasjon
Paper introduserer "Shadow Evaluations": AI-agenter gjorde ingeniørarbeidet, men mislyktes med to forskningsspørsmål
Et forhåndstrykk med 24 forfattere fikk frontier AI-agenter til å forsøke de sentrale forskningsspørsmålene til to upubliserte NeurIPS 2026-innleveringer, og fikk deretter avisenes egne forfattere til å vurdere resultatene. Agentene håndterte ingeniørarbeidet uten hjelp i løpet av seks dager, men ble utvetydig avvist på forskningen.arxiv.orgProdukt
Warp åpner tidlig tilgang til "Factories", et Config-as-Code-system for å kjøre flåter av kodeagenter
Warp tar forespørsler om tidlig tilgang for Warp Factories, som definerer flåter av kodingsagenter som kode – repos, modeller, tillatelser og menneskelige sjekkpunkter i én YAML-fil, drevet av CLI, API, SDK og MCP. Automatiserings- og kostnadstallene er leverandørkrav: ingen priser, generell tilgjengelighetsdato eller uavhengig testing.warp.devInnovasjon
Benchmark sier at de beste multimodale modellene scorer under 10 % ved å lese ord fra pennelyder og håndbevegelser
Et nytt arXiv-papir introduserer en test der modellene må utlede et skrevet ord fra penn-scratch-lyd og håndbevegelsesvideo, uten blekk synlig. Forfatterne rapporterer at mennesker over 80 % bestilte bokstavnøyaktighet og ledende modeller under 10 % - og at det å gi modellene begge modalitetene ofte gjorde resultatene verre.arxiv.orgInnovasjon
Paper sier Agent-Aware Cache Management reduserer første-token-forsinkelsen med opptil 45 % i multi-agent-servering
Et nytt arXiv preprint beskriver CacheScout, et lag bygget på open source vLLM-serveren som bestemmer hva som skal beholdes i en modells nøkkelverdi-cache basert på hvilken agent som sannsynligvis kjører neste gang. Forfatterne rapporterer tosifret ventetid og gjennomstrømningsgevinster; arbeidsmengdene, modellene og maskinvaren er ikke oppgitt i abstraktet.arxiv.orgInnovasjon
Revisjon av et OpenAI AI-generert bevis finner en omvendt tilstand og publiserer en reparasjon
To forskere sier at et lemmabevis i kapittel 6 i OpenAIs matematikkdokument har en polaritetsfeil: en test i form av gjennomsnittlig suksess der neste trinn trenger en stor betinget feil. De gir et moteksempel og et korrigert bevis, og advarer om at dette ikke er verifisering av kapittelets hovedteorem.arxiv.orgInnovasjon
Replikeringsstudie sier at FLOP-er fortsatt feilforutsier AI-kjøring, og at den foreslåtte løsningen mislykkes på nyere maskinvare
Et fortrykk av to forskere gjengir en tidligere studie om hvorfor like FLOP-tall ikke betyr lik utførelsestid. Den bekrefter den underliggende påstanden, men rapporterer at α-FLOPs-korreksjonsformelen generelt undervurderer kjøretid på nyere maskinvare, som viser hopp og svingninger formelen ikke fanger opp.arxiv.orgEnterprise
Benchmark Paper finner fire måter å forespørre bedriftsdata med LLM-er på under 26 %
Et nytt arXiv preprint setter fire arkitekturer for naturlig språksøking av bedriftsdatabaser opp mot hverandre på en syntetisk tospråklig benchmark. Ingen svarte mer enn rundt en fjerdedel av sakene riktig, og designet som skåret høyest var ikke det sikreste eller billigste.arxiv.orgInnovasjon
Paper foreslår å gradere AI-sikkerhetsagenter uten etiketter ved å måle konvergens til en sterkere modell
Et nytt arXiv preprint argumenterer for at sikkerhetsteam kan vurdere om en minne- eller gjenfinningsutstyrt AI-agent lærer ved å måle hvor langt den lukker gapet til en sterkere "lærer"-modell, i stedet for på merkede benchmarks som ofte er knappe eller foreldede. Å dømme etter en tilsvarende drevet modell ga ikke noe brukbart signal.arxiv.org
En nyttig orientering hver uke
Hold deg oppdatert med AI uten å leve i feeden.
Få ukens bekreftede AI-nyheter, originale data, nyttige verktøy, læringsvalg og ferske AI-jobber.
Nå folk som lærer AI
Ansette en AI-profesjonell eller lansere et nyttig AI-produkt? Sett det foran folk som kom hit for å lære og handle.
Legg ut en AI-jobbSend inn et AI-verktøy