Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Oppdateres daglig1421 bekreftede historier
Kildesjekket AI-dekning av produktlanseringer, endringer i retningslinjene, sikkerhetsundersøkelser og bransjebevegelser, forklart på vanlig engelsk av et nonprofit-utdanningsteam.
Hver historie kobler til de sterkeste tilgjengelige bevisene: originale kilder når de er tilgjengelige, ellers tydelig tilskrevet rapportering.
Hva skjedde, hvorfor det er viktig og hva du bør se på – ingen sjargongskatt.
Når signalet er tynt, publiserer vi ingenting i stedet for å polstre feeden.
En voksende strøm av bekreftede perspektiver for folk som trenger å forstå AI uten å jage etter hype.
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
A 24-author preprint had frontier AI agents attempt the central research questions of two unpublished NeurIPS 2026 submissions, then had the papers' own authors grade the results. The agents handled the engineering unaided over six days but were unambiguously rejected on the research.
Warp is taking early-access requests for Warp Factories, which defines fleets of coding agents as code — repos, models, permissions and human checkpoints in one YAML file, driven by CLI, API, SDK and MCP. Its automation and cost figures are vendor claims: no pricing, general availability date or independent testing.
Et nytt arXiv-papir introduserer en test der modellene må utlede et skrevet ord fra penn-scratch-lyd og håndbevegelsesvideo, uten blekk synlig. Forfatterne rapporterer at mennesker over 80 % bestilte bokstavnøyaktighet og ledende modeller under 10 % - og at det å gi modellene begge modalitetene ofte gjorde resultatene verre.
Et nytt arXiv preprint beskriver CacheScout, et lag bygget på open source vLLM-serveren som bestemmer hva som skal beholdes i en modells nøkkelverdi-cache basert på hvilken agent som sannsynligvis kjører neste gang. Forfatterne rapporterer tosifret ventetid og gjennomstrømningsgevinster; arbeidsmengdene, modellene og maskinvaren er ikke oppgitt i abstraktet.
To forskere sier at et lemmabevis i kapittel 6 i OpenAIs matematikkdokument har en polaritetsfeil: en test i form av gjennomsnittlig suksess der neste trinn trenger en stor betinget feil. De gir et moteksempel og et korrigert bevis, og advarer om at dette ikke er verifisering av kapittelets hovedteorem.
Et fortrykk av to forskere gjengir en tidligere studie om hvorfor like FLOP-tall ikke betyr lik utførelsestid. Den bekrefter den underliggende påstanden, men rapporterer at α-FLOPs-korreksjonsformelen generelt undervurderer kjøretid på nyere maskinvare, som viser hopp og svingninger formelen ikke fanger opp.
Et nytt arXiv preprint setter fire arkitekturer for naturlig språksøking av bedriftsdatabaser opp mot hverandre på en syntetisk tospråklig benchmark. Ingen svarte mer enn rundt en fjerdedel av sakene riktig, og designet som skåret høyest var ikke det sikreste eller billigste.
Et nytt arXiv preprint argumenterer for at sikkerhetsteam kan vurdere om en minne- eller gjenfinningsutstyrt AI-agent lærer ved å måle hvor langt den lukker gapet til en sterkere "lærer"-modell, i stedet for på merkede benchmarks som ofte er knappe eller foreldede. Å dømme etter en tilsvarende drevet modell ga ikke noe brukbart signal.
En teknisk rapport med 17 forfattere lagt ut på arXiv introduserer MobileMem, et benchmark og et rammeverk for langtidsminne på enheten bygget fra en samling av mobile opplevelser på årsbasis. Abstraktet beskriver designet, men rapporterer ingen poengsummer, og nøkkeldetaljer om de underliggende dataene forblir ikke avslørt.
Et nytt arXiv preprint sier at store språkmodeller utvikler funksjonelt spesialisert intern struktur som er i tråd med distinkte menneskelige hjernenettverk, basert på kretsanalyser på tvers av 46 oppgaver i fire kognitive domener. Den abstrakte siden etterlater viktige metodologiske detaljer uoppgitt.
Et forhåndstrykk rapporterer at deaktivering av lavmagnitude-eksperter i de siste fem lagene av en 35-milliarder-parameter Mixture-of-Experts-modell bevarte langt mer brukbare kodeoversettelsesutdata enn å spre de samme kuttene over alle lagene. Den dekker én modell og én benchmark, og abstraktet rapporterer ingen demaskert grunnlinje.
En nyttig orientering hver uke
Få ukens bekreftede AI-nyheter, originale data, nyttige verktøy, læringsvalg og ferske AI-jobber.
Ansette en AI-profesjonell eller lansere et nyttig AI-produkt? Sett det foran folk som kom hit for å lære og handle.
Post an AI job Submit an AI tool