Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Uppdateras dagligen1793 verifierade berättelser
Källkontrollerad AI-bevakning av produktlanseringar, policyskiften, säkerhetsforskning och branschrörelser, förklarad på enkel svenska av ett ideellt utbildningsteam.
Varje berättelse länkar till de starkaste tillgängliga bevisen: originalkällor när de finns tillgängliga, annars tydligt tillskrivna rapporteringar.
What happened, why it matters, and what to watch — without the jargon.
När signalen är tunn publicerar vi ingenting istället för att fylla ut flödet.
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Ett förtryck med 24 författare fick frontier AI-agenter att försöka de centrala forskningsfrågorna i två opublicerade NeurIPS 2026-inlämningar, och sedan fick tidningarnas egna författare betygsätta resultaten. Agenterna skötte ingenjörsarbetet utan hjälp under sex dagar men avvisades otvetydigt i forskningen.
Warp tar förfrågningar om tidig åtkomst för Warp Factories, som definierar flottor av kodningsagenter som kod – repos, modeller, behörigheter och mänskliga kontrollpunkter i en YAML-fil, driven av CLI, API, SDK och MCP. Dess automatiserings- och kostnadssiffror är leverantörsanspråk: ingen prissättning, allmänt tillgänglighetsdatum eller oberoende testning.
A new arXiv paper introduces a test in which models must infer a written word from pen-scratch audio and hand-movement video, with no ink visible. The authors report humans above 80% ordered letter accuracy and leading models below 10% — and that giving models both modalities often made results worse.
Ett nytt arXiv-förtryck beskriver CacheScout, ett lager byggt på vLLM-servern med öppen källkod som bestämmer vad som ska behållas i en modells nyckel-värdescache baserat på vilken agent som troligen kommer att köras härnäst. Författarna rapporterar tvåsiffrig latens och genomströmningsvinster; arbetsbelastningen, modellerna och hårdvaran anges inte i abstraktet.
Två forskare säger att ett lemmabevis i kapitel 6 i OpenAIs matematikdokument har ett polaritetsfel: ett test i termer av genomsnittlig framgång där nästa steg kräver ett stort villkorligt misslyckande. De ger ett motexempel och ett korrigerat bevis, och varnar för att detta inte är verifiering av kapitlets huvudsats.
A preprint by two researchers reproduces an earlier study on why equal FLOP counts do not mean equal execution time. It confirms the underlying claim but reports that the α-FLOPs correction formula generally underestimates runtime on newer hardware, which shows jumps and oscillations the formula does not capture.
Ett nytt arXiv-förtryck sätter fyra arkitekturer för sökning på naturliga språk av företagsdatabaser mot varandra på ett syntetiskt tvåspråkigt riktmärke. Ingen svarade rätt på mer än ungefär en fjärdedel av fallen och den design som fick högst poäng var inte den säkraste eller billigaste.
En ny arXiv preprint hävdar att säkerhetsteam kan bedöma om en minnes- eller hämtningsutrustad AI-agent lär sig genom att mäta hur långt den stänger gapet till en starkare "lärarmodell", snarare än på märkta riktmärken som ofta är knappa eller inaktuella. Att döma av en liknande driven modell gav ingen användbar signal.
En teknisk rapport med 17 författare som publicerats på arXiv introducerar MobileMem, ett riktmärke och ramverk för långtidsminne på enheten byggt från en samling av mobila upplevelser i årsskala. Sammanfattningen beskriver designen men rapporterar inga poäng, och nyckeldetaljer om underliggande data förblir okänd.
Ett nytt arXiv preprint säger att stora språkmodeller utvecklar funktionellt specialiserad intern struktur som stämmer överens med distinkta mänskliga hjärnnätverk, baserat på kretsanalyser över 46 uppgifter i fyra kognitiva domäner. Den abstrakta sidan lämnar viktiga metodologiska detaljer oförklarade.
Ett förtryck rapporterar att inaktivering av lågmagnitude experter i de sista fem lagren av en 35-miljarder-parameter Mixture-of-Experts modell bevarade mycket mer användbara kodöversättningsutdata än att sprida samma snitt över alla lager. Den täcker en modell och ett riktmärke, och sammandraget rapporterar ingen omaskerad baslinje.
En användbar genomgång varje vecka
Få veckans verifierade AI-nyheter, originaldata, användbara verktyg, lärtips och nya AI-jobb.
Anlita en AI-professionell eller lansera en användbar AI-produkt? Sätt det framför folk som kom hit för att lära sig och agera.
Lägg upp ett AI-jobb Skicka in ett AI-verktyg